ÉlőUtoljára: 1 órájaMa: 2
Biztonságfrissítve: 18:15

Automatikus red-teamerrel ellenállóbbá tették a GPT-5.6-t az OpenAI-nál

Az OpenAI GPT-Red nevű automatizált tesztelője képes feltárni a prompt injection támadásokat, amelyek ellen korábbi modelljeik rendkívül sérülékenyek voltak. A GPT-5.6 modellt a GPT-Red segítségével képezték, így az ellenállóbb lett ezekkel a támadásokkal szemben.

Automatikus red-teamerrel ellenállóbbá tették a GPT-5.6-t az OpenAI-nál
Fotó: Jonathan Kemper / Unsplash
forrás: OpenAI·AI Forradalom szerk.·
Megosztás

Az OpenAI bemutatta a GPT‑Red nevű automatizált red-teaming modellt, amelynek célja a biztonsági rések feltárása és a modellek robusztusságának növelése. A jelenlegi manuális tesztelési módszerek nem skálázhatók hatékonyan, és a korábbi értékelési módszerek már telítődtek a legújabb modellekkel. Az új megközelítés lehetővé teszi, hogy a biztonsági és igazítási képességek lépést tartsanak a modellfejlesztéssel.

A GPT-Red működése és képességei

A GPT‑Red önjátékos megerősítéses tanulási módszerrel fejlődik, ahol a modell és különféle védelmi LLM-ek együtt képeznek egy széles körű red-teaming forgatókönyvön. A GPT‑Red jutalmat kap sikeres támadások – például prompt injection – végrehajtásáért, míg a védelmi modellek ellenállásukért és eredeti feladatuk teljesítéséért kapnak jutalmat. A képzési folyamat során a védők egyre robusztusabbá válnak, ami arra kényszeríti a GPT‑Red-et, hogy erősebb és változatosabb támadásokat fedezzen fel.

Kapcsolódó: AI red teaming eszközök

A GPT‑Red képzése során valósághű forgatókönyveket hoznak létre, ahol a prompt injection támadások beilleszthetők. Ezekben a környezetekben egy fenyegetési modell határozza meg, hogy a GPT‑Red mit irányíthat, és mi számít sikeres támadásnak. A képzés végére a GPT‑Red rendkívül erős támadóvá válik, képes feltörni szinte minden ellene felállított modellt, beleértve a GPT‑5.5-ig bezárólag minden belső és gyártásban lévő modellt.

Kapcsolódó: GPT-5.4-Cyber kibervédelem

Hatékonyság és általánosíthatóság

A GPT‑Red képességeit novel biztonsági környezetekben és célmodelleken is tesztelték. Egy, a Dziemian et al. (2025) által kidolgozott indirekt prompt injection arénában a GPT‑Red 84%-os támadási sikerességi rátát ért el, szemben az emberi tesztelők 13%-ával. Ez azt mutatja, hogy a GPT‑Red kiválóan alkalmas általános célú red-teaming feladatokra, és széles körben képes elősegíteni a biztonságot az OpenAI-nál.

Kapcsolódó: OpenAI GPT-5.4-Cyber

Egy valós esettanulmányban a GPT‑Red egy AI-vezérelt automata italautomatát támadott meg. Azonosította a rendszer gyengeségeit, és sikeresen végrehajtotta céljait: egy drága termék árát a minimálisra csökkentette, majd egy másik vásárló rendelését törölte. Ezeket a sebezhetőségeket felfedték, és új védelmi mechanizmusokat tesztelnek.

Kapcsolódó: Daybreak biztonsági eszköztár

Az OpenAI a GPT‑Red-et elkülönítve tartja a bevezetett modellektől, hogy a rosszindulatú képességek ne kerüljenek illetéktelen kezekbe, miközben a termékmodellek robusztusságát növelik. A GPT‑Red-et a GPT‑5.6 képzésére is felhasználták, ami jelentősen ellenállóbbá tette a modell a prompt injection támadásokkal szemben. Az OpenAI tervei szerint tovább skálázzák a GPT‑Red-et, hogy lépést tartson a modellképességek fejlődésével.

Kapcsolódó: GPT-5.6 Sol csalási aránya

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom