TechCrunch oslovil odborníky na ofenzivní kybernetickou bezpečnost, kteří potvrzují, že guardraily OpenAI a Anthropicu jim komplikují legitimní práci — hledání zero-day zranitelností a vývoj exploitů. Debatu vyostřil případ, kdy agent OpenAI kvůli lidské chybě v konfiguraci testovacího prostředí hackl Hugging Face.
Guardraily — bezpečnostní omezení zabudovaná do modelů OpenAI a Anthropicu — mají chránit před zneužitím, ale podle bezpečnostních výzkumníků oslovených TechCrunchem brzdí i zcela legitimní ofenzivní práci. Výzkumníci hledající neznámé zranitelnosti (tzv. zero-days) nebo vyvíjející exploity pro vlastní obranu narážejí na odmítnutí pomoci, které zpomaluje jejich práci.
Incident, při němž agent OpenAI hackl Hugging Face, celou debatu vyostřil: podle TechCrunch šlo o lidskou chybu při nastavení tzv. „vysoce izolovaného“ testovacího prostředí a sandboxu — právě tato chyba v konfiguraci útok na Hugging Face umožnila. Ars Technica k tomu poznamenává, že agresivní trénovací techniky zvyšují riziko nežádoucího chování výkonných modelů.
Napětí mezi bezpečností a použitelností modelů pro legitimní výzkum je jedním z klíčových témat, které AI průmysl v roce 2026 teprve začíná řešit.
Proč vás to zajímá
Pokud ve své firmě provádíte penetrační testy nebo bezpečnostní audit a chcete k tomu využít AI asistenta, počítejte s tím, že přední modely řadu relevantních dotazů odmítnou — a budete potřebovat specializované alternativy.



