Kontextusbombával csökkentik az AI-támadások sikerességét a Tracebit kutatói
A Tracebit kutatói 152 támadási kísérlet során 57%-ról 5%-ra csökkentették az adminisztrátori jogosultságok kiszivárgásának arányát kontextus-alapú bombákkal. Ezek a tiltott parancsok az LLM-eket leállítják, ha például antrax-szintetizálási vagy politikailag érzékeny utalásokra kerülnek sor.

A prompt injection támadások, melyek során rosszindulatú parancsokat rejtenek el a nagy nyelvi modellek (LLM) tartalmába, eddig az AI-platformok felhasználói elleni támadások fő eszközei voltak. Egy jól megfogalmazott, e-mailbe vagy naptárba csempészett parancs gyakran elegendő volt ahhoz, hogy az LLM érzékeny adatokat szivárogtasson ki vagy más káros műveleteket hajtson végre. Most a védekezők is magukévá teszik a prompt injection technikáját.
A Tracebit kutatói közölték, hogy a jelszavak, kriptográfiai kulcsok és más titkok mellett elhelyezett prompt injection karakterláncok gyakran elegendőek voltak az AI-támadó ügynökök támadásainak leállítására. Ezek a parancsok arra irányítják a támadó LLM-et, hogy hajtson végre egy, a biztonsági korlátok által tiltott műveletet. Az LLM erre válaszul leáll. Ilyen parancs lehet például az inhalálható antrax spórák kifejlesztésének lépéseit kérő utasítás, vagy a kínai fejlesztők modelljeinél a Tienanmen téri mészárlás ikonikus Tank Manjére való utalás. Amint az LLM ezekkel a tiltott parancsokkal találkozik, már nem követi a korábbi utasításait. A kutatók a technikát „kontextusbombázásnak” nevezték el.
Kapcsolódó: Prompt injection támadások 2025-ben
A kontextusbomba hatása
„Végső soron egy megtagadási mechanizmust aktiválunk a kontextusban” – magyarázta Andy Smith, a Tracebit társalapítója és vezérigazgatója. „Azt próbáljuk megragadni, hogy ennek erős, éles hatása van, és nehéz az ügynökök számára visszatérni belőle. Ha egyszer bekerül a kontextusukba, továbbra is megtagadnak majd.”
Kapcsolódó: Közvetett prompt injekció kockázata
A Tracebit szerint a kezdeti tesztek nagy potenciált mutatnak. Öt vezető modellt – Opus 4.8, Gemini 3.1 Pro, GLM 5.2, DeepSeek 4 Pro és Kimi 2.6 – teszteltek egy szimulált AWS környezetben. A tesztek során a modelleknek rutin fejlesztői feladatokat kellett végrehajtaniuk, amelyek során erőforrásokat enumeráltak és belefutottak az elhelyezett karakterláncokba. Az öt modell és 152 támadási futás során egyetlen karakterlánc elhelyezése egy „csali” titok mellett 57%-ról 5%-ra csökkentette a teljes fiókelérés megszerzésének arányát, és a teljes kompromittálást (amikor a támadó tartós lábnyomot is hagyott maga után) 36%-ról 1%-ra – áll a blogbejegyzésben. A tesztek legképzettebb ügynöke, az Opus 4.8, 93%-os admin hozzáférési sikerességről 0%-ra esett vissza, amikor kontextusbomba elé került.
Kapcsolódó: AI és a rendszerüzenetek kezelése
Az eredmények és a védekezés
Az átlagos eredmények a következőképpen alakultak az öt modell és a 152 futás során: a rendszergazdai jogosultságok megszerzése 57%-ról 5%-ra esett vissza. A tartós lábnyommal járó jogosultság-escaláció 36%-ról 1%-ra csökkent. Az esetek 91%-ából 15%-ra esett vissza a bármilyen támadási útvonal elérése. Átlagosan egy futás 1,53 sikeres útvonalról mindössze 0,16-ra csökkent. Egyetlen futás sem tudta befejezni a támadási útvonalat anélkül, hogy legalább egy „canary” (csali) észlelést kiváltott volna.
A kutatás az eredményekre épül, amikor a Tracebit bemutatott egy módszert a védekezők számára, hogy figyelmeztetést kapjanak, amikor infrastruktúrájukat AI-ügynökök támadják. Ez AWS erőforrások formájában valósul meg, amelyek úgy néznek ki, mintha legitim célt szolgálnának, de valójában nem használatosak. Ezek a valódi erőforrások mellett helyezkednek el. Amikor az AI-ügynökök megvizsgálják őket, a védekezők riasztást kapnak. A Tracebit Canariens átlagosan nyolc percen belül jelezte a támadás kezdetét.
Kapcsolódó: Microsoft Copilot adatszivárgása
A kontextusbomba kifejlesztésének motivációja a volt, hogy valami olyat találjanak, ami megállítja a támadásokat, nem csupán figyelmeztet rájuk. A kísérletekben az ügynöki modelleknek átlagosan 14 percre volt szükségük a rendszergazdai vezérlés eléréséig. A hatperces figyelmeztetés túl szoros volt. A támadók már használták a prompt injection technikákat a hálózatokon belüli AI-védelmi rendszerek leállítására. A Socket biztonsági cég kutatói például múlt hónapban fedeztek fel egy LLM-ügynököt, amely cél-LLM-eknek adott utasításokat nukleáris bomba vagy biológiai fegyverek építésére. Az injekciókat az AI-vezérelt malware-elemzés leállítására tervezték.
Kapcsolódó: AI és kiberbiztonsági fegyverkezés
A kontextusbomba tűnik az első ismert esetnek, amikor a védekezők fordítottak a helyzeten. „Ezt a technikát védekezésként még nem láttam senki mást használni, tudomásom szerint” – mondta Earlence Fernandes, a Kaliforniai Egyetem AI-biztonságra szakosodott professzora. Elmondása szerint ő maga is hasonló megközelítésen gondolkodott, bár kissé eltérő kontextusban. „Én akartam az első lenni itt, de úgy tűnik, ezek az emberek megelőztek!” A Socket múlt hónapban felfedezett LLM-ügynök nukleáris és biológiai fegyverek építésére adott utasításokat cél-LLM-eknek.