Új teljesítményteszt teszteli az AI-ügynökök hosszú távú figyelmét
Az új SentinelBench teljesítményteszt 100 feladatot és 10 szimulált webes környezetet használ az AI-ügynökök hosszú távú figyelmének és reagálási idejének mérésére.

Az AI-ügynökök egyre hosszabb ideig futó feladatokat végeznek, de eddig nem létezett olyan mérőeszköz, ami ezt pontosan tesztelte volna. A kutatók most bemutatták a SentinelBench-et, egy nyílt forráskódú teljesítménytesztet, amely az időben fejlődő monitorozási feladatokra fókuszál.
A SentinelBench 100 különböző feladatot foglal magában, 10 szimulált webes környezetben. Ezek között megtalálható e-mail, naptár, pénzügy, szakmai közösségi oldalak és szórakoztató platformok is. A környezetek élő webes felületet biztosítanak, és események leírt sorozatát játsszák le, így az ügynököknek navigálniuk és érvelniük kell a folyamatosan változó weboldalakon.
Kapcsolódó: Anchor rendszer
A teljesítmény mérése
A teljesítményteszt a feladatok teljesítését, a reakcióidőt és az erőforrás-felhasználást méri. Ez lehetővé teszi a válaszkészség és a költségek közötti kompromisszumok feltárását. A kutatók három különböző modellt és két böngésző-ügynök rendszert teszteltek, megállapítva a teljesítmény alapvonalait a jövőbeli összehasonlításokhoz.
Kapcsolódó: HORIZON teljesítményteszt
Jelentős különbségek kimutatása
Az eredmények azt mutatják, hogy a SentinelBench képes megkülönböztetni a különböző ügynökviselkedések közötti érdemi különbségeket. Az ügynök tervezési döntései drámaian befolyásolhatják a kulcsfontosságú mérőszámokat, ami alátámasztja a teljesítményteszt fontosságát az AI-fejlesztésben.
Kapcsolódó: BenchJack rendszer
A SentinelBench eredményeit 2024. március 10-én tették közzé az arXiv-en, ahol a kutatók további információkat is megosztottak a projekt részleteiről.
Kapcsolódó: SWE-bench Verified