OpenAI odhalilo GPT-Red, specializovaný jazykový model trénovaný jako automatizovaný red-teamer, který pomáhá ostatním modelům firmy odolávat kyberútokům a prompt injection. Systém funguje na principu self-play, kde GPT-Red útočí a cílové modely se brání. MIT Technology Review a OpenAI blog potvrdily vydání nejnovější verze minulý týden.
GPT-Red je interní nástroj OpenAI navržený výhradně pro ofenzivní testování vlastních modelů. Na rozdíl od tradičního red-teamingu, kde bezpečnostní experti ručně hledají slabiny, GPT-Red proces automatizuje: model neustále vymýšlí nové útoky, včetně prompt injection a pokusů o obejití bezpečnostních guardrails, a tím pomáhá ostatním modelům posilovat obranu.
Princip self-play – kdy jeden model útočí a druhý se brání – je přístup inspirovaný herními AI systémy jako AlphaGo. OpenAI takto buduje kontinuální smyčku zpětné vazby: čím sofistikovanější útoky GPT-Red vymyslí, tím robustnější obrana vzniká na druhé straně. Nejnovější verze GPT-Red byla vydána minulý týden.
Vydání GPT-Red přichází v době, kdy celý sektor čelí rostoucím obavám z prompt injection a zneužití AI agentů. OpenAI zároveň čelí veřejnému tlaku na transparentnost kolem bezpečnostních procesů, a zveřejnění alespoň základního popisu tohoto systému je krokem k odpovědi na tyto kritiky.
Proč by vás to mělo zajímat
Pokud používáte AI agenty nebo nástroje postavené na modelech OpenAI, GPT-Red přímo ovlivňuje, jak odolné tyto nástroje budou vůči pokusům o manipulaci a prompt injection útokům.



