Přeskočit na obsah
ejaj.cz

easy-dataset

Zdarma jako open-source projekt (AGPL 3.0), placená verze v podkladech neuvedenaOpen sourceAPIProduktivita

Open-source nástroj pro vývojáře a týmy, kteří potřebují z vlastních dokumentů rychle vytvořit datasety pro fine-tuning, RAG nebo evaluaci LLM.

docs.easy-dataset.com
Náhled nástroje easy-dataset

O nástroji

Easy Dataset řeší problém, jak z doménových dokumentů získat strukturovaná trénovací data pro jazykové modely bez ruční práce. Nástroj umí zpracovat dokumenty ve formátech PDF, Markdown, DOCX, EPUB i prostý text – automaticky je segmentuje, čistí a strukturuje. Z takto připraveného obsahu pak pomocí LLM API generuje otázky, hierarchické stromy štítků a odpovědi podle upravitelných šablon, včetně odpovědí typu Chain of Thought, jedno- i vícetahových QA datasetů nebo obrazových QA datasetů. Datasety lze vytvářet i bez nahrávání vlastních dokumentů, a to destilací dat z zadaných témat. Součástí je i evaluační modul – vytváří evaluační datasety (true/false, výběr z možností, otevřené otázky) a umožňuje automatizované hodnocení modelem-porotcem i lidský blind test formou tzv. Areny, takže lze rovnou testovat kvalitu výsledných dat i výkon modelů. Výstupní datasety jsou kompatibilní se všemi LLM API ve formátu OpenAI a lze je přímo nahrát do Hugging Face Hub, což usnadňuje navazující trénování či sdílení. Easy Dataset je open-source projekt pod licencí AGPL 3.0, kód je dostupný na GitHubu (ConardLi/easy-dataset) a repozitář má přes 10 000 hvězdiček. Dokumentace je v čínštině, informace o ceně, případné placené verzi ani o českém rozhraní nejsou v dostupných podkladech uvedeny.

Klíčové vlastnosti

  • Zpracování PDF, Markdown, DOCX, EPUB i prostého textu
  • Automatická segmentace a čištění dokumentů
  • Generování otázek, štítků a odpovědí přes LLM API
  • Tvorba datasetů i bez vlastních dokumentů destilací témat
  • Evaluační modul s hodnocením modelem i lidským blind testem
  • Export do formátu OpenAI a přímé nahrání na Hugging Face Hub

Časté dotazy

Co Easy Dataset přesně umí?

Z nahraných dokumentů (PDF, Markdown, DOCX, EPUB, text) automaticky vytvoří strukturovaný dataset otázek a odpovědí pomocí LLM API, včetně hierarchických štítků a odpovědí typu Chain of Thought. Umí také vygenerovat evaluační dataset a otestovat kvalitu dat či výkon modelů.

Kolik Easy Dataset stojí?

Jde o open-source projekt pod licencí AGPL 3.0 dostupný zdarma na GitHubu, konkrétní informace o placené verzi nejsou v podkladech uvedeny.

Pro koho je nástroj vhodný a jak začít?

Je určen vývojářům a týmům, kteří potřebují z vlastních dokumentů rychle připravit trénovací data pro fine-tuning, RAG nebo evaluaci LLM. Začít lze stažením kódu z repozitáře ConardLi/easy-dataset na GitHubu.

Kategorie

AI novinky do e-mailu

Každý pátek 3 vybrané AI nástroje, prompt týdne a to nejdůležitější ze světa AI — přehledně, česky a bez balastu.

Jeden z nejstarších pravidelných českých AI newsletterů.

Jednou týdně, v pátek. Žádný spam — odhlásíte se jedním klikem.

Podobné nástroje

Hledáte alternativu k easy-dataset? Tady je 6 podobných nástrojů z kategorie Produktivita.

Zobrazit všechny alternativy v kategorii Produktivita