easy-dataset
Open-source nástroj pro vývojáře a týmy, kteří potřebují z vlastních dokumentů rychle vytvořit datasety pro fine-tuning, RAG nebo evaluaci LLM.

O nástroji
Easy Dataset řeší problém, jak z doménových dokumentů získat strukturovaná trénovací data pro jazykové modely bez ruční práce. Nástroj umí zpracovat dokumenty ve formátech PDF, Markdown, DOCX, EPUB i prostý text – automaticky je segmentuje, čistí a strukturuje. Z takto připraveného obsahu pak pomocí LLM API generuje otázky, hierarchické stromy štítků a odpovědi podle upravitelných šablon, včetně odpovědí typu Chain of Thought, jedno- i vícetahových QA datasetů nebo obrazových QA datasetů. Datasety lze vytvářet i bez nahrávání vlastních dokumentů, a to destilací dat z zadaných témat. Součástí je i evaluační modul – vytváří evaluační datasety (true/false, výběr z možností, otevřené otázky) a umožňuje automatizované hodnocení modelem-porotcem i lidský blind test formou tzv. Areny, takže lze rovnou testovat kvalitu výsledných dat i výkon modelů. Výstupní datasety jsou kompatibilní se všemi LLM API ve formátu OpenAI a lze je přímo nahrát do Hugging Face Hub, což usnadňuje navazující trénování či sdílení. Easy Dataset je open-source projekt pod licencí AGPL 3.0, kód je dostupný na GitHubu (ConardLi/easy-dataset) a repozitář má přes 10 000 hvězdiček. Dokumentace je v čínštině, informace o ceně, případné placené verzi ani o českém rozhraní nejsou v dostupných podkladech uvedeny.
Klíčové vlastnosti
- Zpracování PDF, Markdown, DOCX, EPUB i prostého textu
- Automatická segmentace a čištění dokumentů
- Generování otázek, štítků a odpovědí přes LLM API
- Tvorba datasetů i bez vlastních dokumentů destilací témat
- Evaluační modul s hodnocením modelem i lidským blind testem
- Export do formátu OpenAI a přímé nahrání na Hugging Face Hub
Časté dotazy
Co Easy Dataset přesně umí?
Z nahraných dokumentů (PDF, Markdown, DOCX, EPUB, text) automaticky vytvoří strukturovaný dataset otázek a odpovědí pomocí LLM API, včetně hierarchických štítků a odpovědí typu Chain of Thought. Umí také vygenerovat evaluační dataset a otestovat kvalitu dat či výkon modelů.
Kolik Easy Dataset stojí?
Jde o open-source projekt pod licencí AGPL 3.0 dostupný zdarma na GitHubu, konkrétní informace o placené verzi nejsou v podkladech uvedeny.
Pro koho je nástroj vhodný a jak začít?
Je určen vývojářům a týmům, kteří potřebují z vlastních dokumentů rychle připravit trénovací data pro fine-tuning, RAG nebo evaluaci LLM. Začít lze stažením kódu z repozitáře ConardLi/easy-dataset na GitHubu.
Kategorie
AI novinky do e-mailu
Každý pátek 3 vybrané AI nástroje, prompt týdne a to nejdůležitější ze světa AI — přehledně, česky a bez balastu.
Jeden z nejstarších pravidelných českých AI newsletterů.
Podobné nástroje
Hledáte alternativu k easy-dataset? Tady je 6 podobných nástrojů z kategorie Produktivita.

ChatGPT
FreemiumChatGPT je konverzační AI asistent od OpenAI, který generuje text, odpovídá na otázky, píše kód,...

GPT3 Playground
PlacenéOpenAI Playground je webový nástroj pro interaktivní experimentování s modely OpenAI (GPT-4o, GP...

Cody
FreemiumCody je AI chatbot, který se natrénuje na firemních dokumentech a odpovídá zaměstnancům i zákazn...

Taskade
FreemiumTaskade je AI platforma pro tvorbu firemních aplikací, agentů a automatizovaných workflow z jedi...
IngestAI
FreemiumPřevádí firemní dokumenty a znalostní báze na kontextového AI chatbota bez nutnosti programování...

Notion AI
FreemiumNotion AI je AI workspace, který kombinuje psaní dokumentů, správu projektů a automatizaci úkolů...
