Přeskočit na obsah
ejaj.cz
Nástroje

Google představil TabFM, model pro tabulková data bez trénování na míru

NástrojeZatím jediný zdroj v našem monitoringu. Neznamená to, že je zpráva nepravdivá – jen že jsme k ní zatím nenašli další nezávislý zdroj mezi sledovanými médii.

TabFM od Googlu umí klasifikaci i regresi na tabulkových datech jediným průchodem, bez ladění na konkrétní úlohu. V testech na 51 datasetech překonal i pečlivě vyladěné modely typu gradient boosting a míří do BigQuery.

Tabulková data tvoří páteř podnikové datové infrastruktury a pohání velkou část kritických prediktivních aplikací strojového učení – od předpovídání odchodu zákazníků po odhalování finančních podvodů. Tradiční přístup s modely jako XGBoost nebo random forest přináší výraznou zátěž: dataloví vědci musí investovat mnoho hodin do ladění hyperparametrů a ručního vytváření příznaků, a to pro každý nový dataset znovu. Google nyní do tohoto prostoru přináší přístup, který úspěšně zavedl v časových řadách s modelem TimesFM – a představuje TabFM, základový model pro tabulková data pracující na principu in-context learningu.

TabFM přistupuje k tabulkové predikci jako k problému in-context learningu (ICL): celý dataset včetně historických trénovacích příkladů i cílových řádků vstupuje do modelu jako jeden jediný prompt a předpověď vznikne v jediném průchodu dopředu, bez jakékoli aktualizace vah modelu. Architektura spojuje střídavou pozornost přes řádky a sloupce (podobně jako TabPFN), kompresi řádků do hustých vektorových reprezentací a finální Transformer operující nad těmito komprimovanými vektory (inspirovaný TabICL) – to zajišťuje výpočetní efektivitu i pro větší datasety. Protože kvalitní tabulková data pro předtrénování jsou v open-source prostoru vzácná, byl TabFM natrénován výhradně na stovkách milionů syntetických datasetů generovaných pomocí strukturálních kauzálních modelů.

Výkonnostní testy proběhly na benchmarku TabArena, který hodnotí modely Elo skóre na základě výsledků vzájemných soubojů. Evaluace zahrnovala 38 klasifikačních a 13 regresních datasetů o velikosti od 700 do 150 000 vzorků, tedy celkem 51 datasetů. Testovány byly dvě konfigurace: základní TabFM bez jakéhokoli ladění a TabFM-Ensemble, který využívá křížové příznaky, SVD příznaky, 32násobný ensemble s vahami počítanými metodou nezáporných nejmenších čtverců a pro klasifikaci navíc Plattovo škálování. Oba módy podle zveřejněných výsledků překonaly i pečlivě vyladěné průmyslové algoritmy.

TabFM je nyní dostupný na Hugging Face a GitHubu a v nadcházejících týdnech bude integrován přímo do Google BigQuery. Uživatelé tam budou moci provádět pokročilou regresi a klasifikaci jediným SQL příkazem `AI.PREDICT` – bez nutnosti jakýchkoli znalostí strojového učení.

Proč by vás to mělo zajímat

Firmy by mohly analyzovat tabulková data přes jednoduchý SQL příkaz bez stavby vlastního modelu strojového učení.

🌅 Podobné novinky každé ráno v 7:00 do mailu

Zdarma, odhlášení jedním klikem v každém e-mailu.

Vyzkoušejte k tomu – z katalogu ejaj.cz

Další novinky

Zpět na přehled AI novinek.