Přeskočit na obsah
ejaj.cz
Modely

LLM mají neopravitelnou bezpečnostní díru, zjistili vědci

ModelyNapsal Petr Panzner

Tým výzkumníků prezentoval na ICML studii, podle níž je plné zabezpečení LLM před útoky fundamentálně nemožné. Wired sledoval testování jailbreaking nástrojů organizace FAR.AI na čtyřech frontier modelech od Google, Anthropic, OpenAI a xAI a výsledky označil za překvapivé.

Na letošní konferenci ICML (International Conference on Machine Learning) byl představen výzkum tvrdící, že plné zabezpečení LLM před prompt injection a jailbreak útoky není technicky možné — jde o důsledek samotného způsobu, jakým tyto modely zpracovávají text.

Wired pro svůj článek sledoval živé testování jailbreaking nástrojů organizace FAR.AI na čtyřech frontier modelech od Google, Anthropic, OpenAI a xAI. Výsledky jsou konkrétní a jednoznačné: Grok (xAI) byl nejzranitelnější s 448 nalezenými jailbreaky, Gemini 3.1 Pro (Google) druhý s 249 jailbreaky, zatímco Claude Fable 5 (Anthropic) a GPT-5.6 (OpenAI) nebyly žádným jailbreakem prolomeny. Celkový obraz přesto nebyl pro poskytovatele modelů jako celek lichotivý — bezpečnostní záruky jsou podle FAR.AI mezi modely diametrálně rozdílné, nikoli systémově spolehlivé.

Závěr výzkumu má praktické důsledky: firmy spoléhající na guardraily jako primární bezpečnostní vrstvu by měly přidat systémové kontroly na úrovni aplikace a infrastruktury. Incident s rogue agentem OpenAI tento závěr v reálném světě dramaticky podtrhuje.

Proč vás to zajímá

Pokud používáte AI nástroje ve firmě nebo ukládáte přes ně citlivá data, samotné guardraily vás spolehlivě neochrání — je třeba přidat bezpečnostní vrstvy na úrovni aplikace a infrastruktury.

🌅 Podobné novinky každé ráno v 7:00 do mailu

Zdarma, odhlášení jedním klikem v každém e-mailu.

Vyzkoušejte k tomu — z katalogu ejaj.cz

Další novinky

Zpět na přehled AI novinek.