ÉlőUtoljára: 1 órájaMa: 6
Biztonságfrissítve: 03:30

AI-k nem különböztetik meg a rendszerüzeneteket a felhasználói bemenettől

Az AI-modellek nem képesek megbízhatóan megkülönböztetni a privilegizált rendszerüzeneteket a felhasználói bemenettől, ami újfajta támadási vektorokat nyit meg — közölte Charles Ye és kutatócsoportja.

AI-k nem különböztetik meg a rendszerüzeneteket a felhasználói bemenettől
Fotó: Milad Fakurian / Unsplash
forrás: Simon Willison·AI Forradalom szerk.·
Megosztás

Az AI-modellek nem képesek megbízhatóan megkülönböztetni a privilegizált rendszerüzeneteket a felhasználói bemenettől, még akkor sem, ha azok speciális szerepkör-címkékkel, mint például <system> vagy <user>, vannak ellátva. Ezt a jelenséget a kutatók „szerepkör-zavarnak” nevezték el, és úgy vélik, ez kulcsfontosságú kihívást jelent a prompt-injekciók elleni védekezésben.

Charles Ye és kutatócsoportja azt állapította meg, hogy a modellek többnyire a szöveg stílusát használják a tartalom megértéséhez, nem pedig a tényleges szerepkör-címkéket. Ez a mechanizmus rosszindulatú felhasználók által manipulálható, és így a modell eredeti betanításának felülírásához vezethet.

Kapcsolódó: AI-kódügynökök sebezhetősége

A „destyling” technika hatása

A kutatók egy „destyling” nevű technikát is bemutattak, amelynek lényege a szöveg stilisztikai átalakítása. Ezzel a módszerrel a támadások sikerességi aránya drasztikusan, 61%-ról 10%-ra csökkenthető volt a vizsgált adatkészletben. Az emberi szem számára szinte észrevehetetlen változtatások is jelentősen befolyásolták a modell szerepkör-észlelését.

Kapcsolódó: COMPASS és a promptmérnökség automatizálása

A védekezés örökös küzdelme

A szerzők szerint amíg az LLM-ek nem rendelkeznek valódi szerepkör-észlelési képességgel, addig a prompt-injekciók elleni védekezés folyamatos „whack-a-mole” játéknak fog maradni. A szerepkör-határok folytonos természete lehetővé teszi, hogy szinte ártalmatlan szövegekkel is fokozatosan manipulálják az AI-modellek állapotát, akár jogilag is, nagy léptékben.

Kapcsolódó: IBM VAKRA benchmark

A kutatás eredményei a gpt-oss-20b modellen kerültek demonstrálásra, de a jelenség általános érvényessége más LLM-ekre is felmerül. A szerzők szerint a valódi szerepkör-észlelés hiánya továbbra is komoly akadályt jelent a biztonságos AI-rendszerek fejlesztésében.

Kapcsolódó: Felhasználói adatok kiszűrődése

Forrás

Feldolgozott sajtóforrás·Simon Willison

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom