MIT Technology Review rozebírá nejnovější objev Anthropicu týkající se skrytého „přemýšlecího prostoru“ uvnitř Claude – a upozorňuje, co výsledky skutečně ukazují a co si z nich nelze odnést. Anthropic je v době zveřejnění hodnocen jako nejcennější AI firma světa s valuací blízkou 1 bilionu dolarů. Analýza varuje před přílišným zobecňováním závěrů výzkumu.
Podle MIT Technology Review Anthropic vyvinul interpretační techniku, která odhaluje skrytý prostor, kde Claude „tápe nad koncepty", než formuluje odpověď. Jde o průlom v oblasti interpretovatelnosti, protože dosavadní metody umožňovaly sledovat výstupy modelu, nikoli jeho vnitřní stavy.
Výzkumníci zjistili, že model pracuje s abstrakcemi, které nejsou přímo mapovatelné na slova výstupního textu – jinými slovy, Claude „myslí" jinak, než jak mluví. Konkrétní metodika ani výsledky nejsou v dostupných podkladech podrobněji specifikovány; MIT Technology Review je označuje za „fascinující" a slibuje další analýzu.
Nálezy mají přímý dopad na bezpečnostní výzkum: lepší pochopení vnitřních stavů modelů je předpokladem pro spolehlivější detekci nežádoucího chování ještě před tím, než se projeví ve výstupu.
Proč by vás to mělo zajímat
Pokud nasazujete Clauda v byznysu, výzkum naznačuje, kde a proč model může selhat nebo překvapit – což usnadní audit výstupů před odesláním zákazníkům.



