ÉlőUtoljára: 5 órájaMa: 6
Kutatásfrissítve: 08:30

Új módszer teszteli az AI-ügynökök biztonságát — 45 rendszeren vizsgálták a RIFT-Bench hatékonyságát

A RIFT-Bench nevű új keretrendszer egységesen képes vizsgálni a különböző autonóm AI-rendszerek biztonsági réseit, a szerzők szerint a módszer 45 különböző ügynökön bizonyult hatékonynak.

Új módszer teszteli az AI-ügynökök biztonságát — 45 rendszeren vizsgálták a RIFT-Bench hatékonyságát
Fotó: AI Forradalom
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az autonóm AI-ügynökök egyre kifinomultabbá válnak, ami új támadási vektorokat nyit meg a hagyományos LLM-ek sebezhetőségein túl. A Stanford és a Google Robotics kutatói által kifejlesztett RIFT-Bench nevű módszer célja, hogy egységes értékelést biztosítson a heterogén rendszerek biztonsági szintjéről — írja az arXiv.

A RIFT-Bench egy grafikus reprezentáción alapuló, kétfázisú automatizált folyamat. Az első, Discovery fázis a rendszer szerkezetét tárja fel, majd a második, Scanning fázisban adaptív támadásokat indít, hogy átfogó értékelést adjon a vizsgált rendszerről. A módszer a rendszer sajátosságait kihasználva, dinamikusan alkalmazkodó támadó szondákat vet be különböző célpontok ellen.

Kapcsolódó: Agent-BOM rendszer

Tesztelés 45 ügynökön

A kutatók 45 különböző, heterogén architektúrájú AI-ügynökrendszeren demonstrálták a RIFT-Bench hatékonyságát és általánosíthatóságát. Az eredmények azt mutatják, hogy a keretrendszer képes megbízhatóan azonosítani a biztonsági réseket a sokféle rendszerben. A tesztek eredményeit a szerzők saját kísérletei támasztják alá.

Kapcsolódó: telekommunikációs teszt

Mitigációs stratégiák értékelése

A RIFT-Bench nem csupán a támadások azonosítására alkalmas, hanem a védekezési stratégiák közvetlen értékelésére is lehetőséget ad. Ez lehetővé teszi a fejlesztők számára, hogy gyorsan teszteljék a bevezetett biztonsági intézkedések hatékonyságát. A keretrendszer így skálázható alapot kínál az autonóm AI-rendszerek biztonságának folyamatos fejlesztéséhez.

Kapcsolódó: SWE-bench mérés

A RIFT-Bench eredményeit az arXiv-on publikálták, a 2606.23927v1 azonosítóval.

Kapcsolódó: BenchJack hibakeresés

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom