Přeskočit na obsah
ejaj.cz

data-juicer

ZdarmaOpen sourceAPIVývojářské nástroje

Data-Juicer je open-source systém pro zpracování a čištění multimodálních dat určený k přípravě kvalitních datasetů pro trénink LLM.

datajuicer.github.io
Náhled nástroje data-juicer

O nástroji

Data-Juicer je jednotný multimodální systém pro zpracování dat, jehož cílem je vytvořit kvalitnější, bohatší a lépe zpracovatelná data pro velké jazykové modely. Je určen vývojářům LLM a multimodálních modelů i výzkumníkům, kteří připravují data pro pre-training a fine-tuning. Nástroj obsahuje jemně granulovanou abstrakci pipeline pro tvorbu datových receptů s více než 50 vestavěnými operátory, které lze snadno skládat a rozšiřovat. Díky vizualizaci a auto-evaluačním schopnostem umožňuje včasnou zpětnou vazbu při pre-trainingu i fine-tuningu a je integrován s ekosystémy jako Megatron-LM, HELM, Ray, Beam a knihovnou Huggingface-datasets. Mezi nedávná vylepšení patří podpora OpenAI Responses API, aktualizovaný Docker image (CUDA 12.6.3, Ubuntu 24.04, Python 3.11), vylepšená Ray deduplikace a S3 loading. Data-Juicer podporuje vyhledávání operátorů pomocí BM25/regex a nabízí rozšířený MCP server se čtyřmi nástroji pro vyhledávání operátorů, analýzu datasetů, získávání schémat konfigurace a strategie načítání dat. Je vydán pod licencí Apache License 2.0 a je k dispozici zdarma.

Klíčové vlastnosti

  • Více než 50 vestavěných operátorů pro čištění dat
  • Vyhledávání operátorů pomocí BM25 nebo regexu
  • Vizualizace a auto-evaluace pro zpětnou vazbu při tréninku
  • Integrace s Megatron-LM, HELM, Ray, Beam a Huggingface-datasets
  • MCP server se čtyřmi nástroji pro analýzu datasetů
  • Podpora Ray deduplikace a načítání dat z S3

Časté dotazy

Co Data-Juicer umí?

Zpracovává a čistí multimodální data pro přípravu kvalitních datasetů k tréninku LLM, pomocí skládatelných operátorů v pipeline s podporou vizualizace a auto-evaluace.

Kolik Data-Juicer stojí?

Je zcela zdarma jako open-source projekt vydaný pod licencí Apache License 2.0.

Pro koho je nástroj určený a jak začít?

Je určen vývojářům LLM a multimodálních modelů i výzkumníkům připravujícím data pro pre-training a fine-tuning, kteří si nástroj stáhnou a nasadí přes Docker image nebo integrují do vlastní pipeline.

Kategorie

AI novinky do e-mailu

Každý pátek 3 vybrané AI nástroje, prompt týdne a to nejdůležitější ze světa AI – přehledně, česky a bez balastu.

Jeden z nejstarších pravidelných českých AI newsletterů.

Jednou týdně, v pátek. Žádný spam – odhlásíte se jedním klikem.

Podobné nástroje

Hledáte alternativu k data-juicer? Tady je 6 podobných nástrojů z kategorie Vývojářské nástroje.

Zobrazit všechny alternativy v kategorii Vývojářské nástroje

Další nástroje v kategorii Vývojářské nástroje

Nezůstávejte jen u nejoblíbenějších – tohle jsou další nástroje z kategorie Vývojářské nástroje, které stojí za prohlédnutí.