langextract
Python knihovna, která pomocí LLM extrahuje strukturovaná data z neuspořádaného textu podle vlastních instrukcí uživatele.

O nástroji
LangExtract je open-source Python knihovna dostupná přes pip (aktuální verze 1.6.0), která využívá jazykové modely k extrakci strukturovaných informací z nestrukturovaných textových dokumentů, jako jsou klinické poznámky nebo zprávy, na základě uživatelem definovaných instrukcí. Nástroj mapuje každou extrakci na přesné místo v původním textu, což umožňuje vizuální zvýraznění a snadné ověření správnosti výsledků. Knihovna podporuje jak cloudové modely (např. Google Gemini, doporučený výchozí model gemini-3.5-flash, s alternativou gemini-3.1-flash-lite pro levnější provoz), tak lokální open-source modely přes vestavěné rozhraní Ollama, a rovněž modely OpenAI. Umí zpracovávat dlouhé dokumenty pomocí chunkování textu, paralelního zpracování a více průchodů pro vyšší přesnost, generuje interaktivní HTML vizualizace extrahovaných entit a vynucuje konzistentní výstupní schéma na základě několika ukázkových příkladů (few-shot). Projekt je vydán pod licencí Apache-2.0 a je určen vývojářům a datovým specialistům pro nasazení v jakékoli doméně bez nutnosti fine-tuningu modelu. Pro použití cloudových modelů jako Gemini je vyžadován API klíč, konfigurace probíhá přímo v Python kódu importem balíčku langextract.
Klíčové vlastnosti
- Mapování extrakcí na přesné místo v textu
- Podpora Gemini, OpenAI i lokálních modelů přes Ollama
- Chunkování a paralelní zpracování dlouhých dokumentů
- Interaktivní HTML vizualizace extrahovaných entit
- Vynucení konzistentního výstupního schématu
- Definice úloh pomocí několika ukázkových příkladů
Časté dotazy
Co přesně LangExtract umí?
Extrahuje strukturovaná data (entity, vztahy, atributy) z neuspořádaného textu podle vlastních instrukcí a příkladů, a každou extrakci propojí s přesným místem v původním textu.
Kolik LangExtract stojí?
Samotná knihovna je open-source a zdarma pod licencí Apache-2.0, ale pro cloudové modely jako Gemini nebo OpenAI je potřeba vlastní API klíč, jehož použití se platí zvlášť podle ceníku daného poskytovatele.
Pro koho je nástroj určený a jak začít?
Je určen vývojářům a datovým specialistům, kteří chtějí extrahovat data z textu bez fine-tuningu modelu; stačí nainstalovat balíček přes pip, nastavit API klíč (nebo použít lokální model přes Ollama) a v Python kódu definovat prompt s ukázkovými příklady.
Kategorie
AI novinky do e-mailu
Každý pátek 3 vybrané AI nástroje, prompt týdne a to nejdůležitější ze světa AI – přehledně, česky a bez balastu.
Jeden z nejstarších pravidelných českých AI newsletterů.
Podobné nástroje
Hledáte alternativu k langextract? Tady je 6 podobných nástrojů z kategorie Vývojářské nástroje.

Vectorizer AI
FreemiumPřevádí rastrové obrázky PNG, JPG, GIF, BMP a WebP na vektorové formáty SVG, PDF, EPS a DXF pomo...

Stable Diffusion
FreemiumStability AI je platforma pro generování obrázků, videa a dalšího obsahu pomocí generativní AI,...

Whisper
ZdarmaPřevádí mluvenou řeč na text ve více než 90 jazycích. Whisper je open-source model od OpenAI tré...

ai
FreemiumOpen-source TypeScript SDK od Vercelu pro vývojáře stavějící AI aplikace a agenty s React, Next....

Pinecone
FreemiumPinecone je vektorová databáze jako služba, která umožňuje ukládat, spravovat a prohledávat vekt...

Escape
NeuvedenoEscape je AI-powered platforma pro ofenzivní bezpečnost, která automatizuje discovery, pentestin...
Další nástroje v kategorii Vývojářské nástroje
Nezůstávejte jen u nejoblíbenějších – tohle jsou další nástroje z kategorie Vývojářské nástroje, které stojí za prohlédnutí.





