Új módszer teszteli az AI-ügynökök biztonságát — 45 rendszeren vizsgálták a RIFT-Bench hatékonyságát
A RIFT-Bench nevű új keretrendszer egységesen képes vizsgálni a különböző autonóm AI-rendszerek biztonsági réseit, a szerzők szerint a módszer 45 különböző ügynökön bizonyult hatékonynak.

Az autonóm AI-ügynökök egyre kifinomultabbá válnak, ami új támadási vektorokat nyit meg a hagyományos LLM-ek sebezhetőségein túl. A Stanford és a Google Robotics kutatói által kifejlesztett RIFT-Bench nevű módszer célja, hogy egységes értékelést biztosítson a heterogén rendszerek biztonsági szintjéről — írja az arXiv.
A RIFT-Bench egy grafikus reprezentáción alapuló, kétfázisú automatizált folyamat. Az első, Discovery fázis a rendszer szerkezetét tárja fel, majd a második, Scanning fázisban adaptív támadásokat indít, hogy átfogó értékelést adjon a vizsgált rendszerről. A módszer a rendszer sajátosságait kihasználva, dinamikusan alkalmazkodó támadó szondákat vet be különböző célpontok ellen.
Kapcsolódó: Agent-BOM rendszer
Tesztelés 45 ügynökön
A kutatók 45 különböző, heterogén architektúrájú AI-ügynökrendszeren demonstrálták a RIFT-Bench hatékonyságát és általánosíthatóságát. Az eredmények azt mutatják, hogy a keretrendszer képes megbízhatóan azonosítani a biztonsági réseket a sokféle rendszerben. A tesztek eredményeit a szerzők saját kísérletei támasztják alá.
Kapcsolódó: telekommunikációs teszt
Mitigációs stratégiák értékelése
A RIFT-Bench nem csupán a támadások azonosítására alkalmas, hanem a védekezési stratégiák közvetlen értékelésére is lehetőséget ad. Ez lehetővé teszi a fejlesztők számára, hogy gyorsan teszteljék a bevezetett biztonsági intézkedések hatékonyságát. A keretrendszer így skálázható alapot kínál az autonóm AI-rendszerek biztonságának folyamatos fejlesztéséhez.
Kapcsolódó: SWE-bench mérés
A RIFT-Bench eredményeit az arXiv-on publikálták, a 2606.23927v1 azonosítóval.
Kapcsolódó: BenchJack hibakeresés