AI-k nem különböztetik meg a rendszerüzeneteket a felhasználói bemenettől
Az AI-modellek nem képesek megbízhatóan megkülönböztetni a privilegizált rendszerüzeneteket a felhasználói bemenettől, ami újfajta támadási vektorokat nyit meg — közölte Charles Ye és kutatócsoportja.

Az AI-modellek nem képesek megbízhatóan megkülönböztetni a privilegizált rendszerüzeneteket a felhasználói bemenettől, még akkor sem, ha azok speciális szerepkör-címkékkel, mint például <system> vagy <user>, vannak ellátva. Ezt a jelenséget a kutatók „szerepkör-zavarnak” nevezték el, és úgy vélik, ez kulcsfontosságú kihívást jelent a prompt-injekciók elleni védekezésben.
Charles Ye és kutatócsoportja azt állapította meg, hogy a modellek többnyire a szöveg stílusát használják a tartalom megértéséhez, nem pedig a tényleges szerepkör-címkéket. Ez a mechanizmus rosszindulatú felhasználók által manipulálható, és így a modell eredeti betanításának felülírásához vezethet.
Kapcsolódó: AI-kódügynökök sebezhetősége
A „destyling” technika hatása
A kutatók egy „destyling” nevű technikát is bemutattak, amelynek lényege a szöveg stilisztikai átalakítása. Ezzel a módszerrel a támadások sikerességi aránya drasztikusan, 61%-ról 10%-ra csökkenthető volt a vizsgált adatkészletben. Az emberi szem számára szinte észrevehetetlen változtatások is jelentősen befolyásolták a modell szerepkör-észlelését.
Kapcsolódó: COMPASS és a promptmérnökség automatizálása
A védekezés örökös küzdelme
A szerzők szerint amíg az LLM-ek nem rendelkeznek valódi szerepkör-észlelési képességgel, addig a prompt-injekciók elleni védekezés folyamatos „whack-a-mole” játéknak fog maradni. A szerepkör-határok folytonos természete lehetővé teszi, hogy szinte ártalmatlan szövegekkel is fokozatosan manipulálják az AI-modellek állapotát, akár jogilag is, nagy léptékben.
Kapcsolódó: IBM VAKRA benchmark
A kutatás eredményei a gpt-oss-20b modellen kerültek demonstrálásra, de a jelenség általános érvényessége más LLM-ekre is felmerül. A szerzők szerint a valódi szerepkör-észlelés hiánya továbbra is komoly akadályt jelent a biztonságos AI-rendszerek fejlesztésében.
Kapcsolódó: Felhasználói adatok kiszűrődése