ÉlőUtoljára: 15 órájaMa: 0
Kutatásfrissítve: 23:30

2,6%-os átlagos sikerrel zárnak az AI-ügynökök az új 'Agents' Last Exam' teljesítményteszten

Az új Agents' Last Exam (ALE) teljesítményteszt 1000-nél is több feladattal méri az AI-ügynökök valós idejű, gazdaságilag értékes teljesítményét, 2,6%-os átlagos sikerrel.

2,6%-os átlagos sikerrel zárnak az AI-ügynökök az új 'Agents' Last Exam' teljesítményteszten
Fotó: Vitaly Gariev / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az eddigi AI-tesztek eredményei nem tükrözik a valós gazdasági teljesítményt, mert hiányzik a hosszú távú, gazdaságilag értékes munkafolyamatok mérése. Ezt a problémát hivatott orvosolni az új Agents' Last Exam (ALE) teljesítményteszt – közölték a kutatók az arXiv-on.

Valós feladatokra szabva

Az ALE-t 250-nél is több iparági szakértő közreműködésével fejlesztették ki. A tesztrendszer 55 alrésszel és 13 iparági klaszterre bontva több mint 1000 feladatot foglal magában, amelyek a nem fizikai szektorokra fókuszálnak, az amerikai O*NET / SOC 2018 szakmai taxonómia alapján. A cél, hogy hidat építsenek az elméleti teljesítményteszt-sikerek és a GDP-hez érdemben hozzájáruló hatások között.

Kapcsolódó: AI-ügynök benchmarkok

Alacsony átlagos teljesítmény

A mainstream rendszerek és alapkonfigurációk átlagos teljes pass rate-je mindössze 2,6%. Ez azt jelzi, hogy az AI-ügynökök még messze vannak attól, hogy a legnehezebb feladatokat megbízhatóan teljesítsék. Az ALE-t folyamatosan bővítik új munkafolyamatokkal és iparágakkal, így élő benchmarkként funkcionál.

Kapcsolódó: AI ügynökök értékelése

A kutatás előnyomtatott formában érhető el az arXiv-on. A következő lépésként a kutatók az iparági partnerekkel közösen dolgozzák fel a 2026 márciusában esedékes IRS Enrolled Agent Special Enrollment Exam (EA-SEE) eredményeit, amelyek a valós adózási ügynökök teljesítményét mérik.

Kapcsolódó: LLM-alapú ügynökök

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom