ÉlőUtoljára: 3 órájaMa: 0
Kutatás

Bemutatták a SciConBench-et, az új tudományos teljesítménytesztet, amelyen az AI-ügynökök csak 33,7%-os pontosságot értek el

A legfejlettebb AI-ügynökök is csak 33,7%-os pontosságot értek el tudományos következtetések szintetizálásában, még ellenőrzött körülmények között is — derül ki egy új, 9.11K kérdéses benchmarkból.

Bemutatták a SciConBench-et, az új tudományos teljesítménytesztet, amelyen az AI-ügynökök csak 33,7%-os pontosságot értek el
Fotó: Sasun Bughdaryan / Unsplash
forrás: ArXiv AI·AI Forradalom szerk.·
Megosztás

Az AI-ügynökök egyre inkább képesek bizonyítékokat gyűjteni, forrásokat elemezni és következtetéseket szintetizálni, amelyeket fontos döntésekhez használnak. Azonban magas tétű területeken, mint az egészségügy, képességeik még mindig bizonytalanok — írja az arXiv kutatóinak tanulmánya.

SciConBench: Az új tudományos teljesítményteszt

A kutatók bemutatták a SciConBench-et, egy nagyszabású, élő teljesítménytesztet 9.11K kérdéssel és szakértők által írt következtetésekkel, amelyeket szisztematikus áttekintésekből gyűjtöttek. A teljesítményteszt egy szakértő által validált automatizált értékelési folyamatot használ, amely a következtetéseket atomi tényekre bontja, és a pontosságot, valamint a teljességet méri.

Kapcsolódó: tudományos adatelemzés

Teljesítmény a tiszta környezetben

Az adatvesztés elkerülése érdekében bevezették a SciConHarness-t, egy ellenőrzött értékelési rendszert, amely kontrollált webes interakcióval látja el az ügynököket. Nyolc fejlett modell és kutatóügynök értékelése során kiderült, hogy a ténybeli minőség alacsony maradt: tiszta környezetben a legjobb ügynök mindössze 0,337-es F1 pontszámot ért el.

Kapcsolódó: LLM értékelés

Az AI-ügynökök korlátai

A tiszta értékelési környezet következetesen csökkenti a teljesítményt a korlátozatlan értékeléshez képest, ami arra utal, hogy az adatvesztés felfújja a modellek valódi szintetizálási képességeire vonatkozó becsléseket. A kutatók auditálták a fogyasztóknak szánt ügynököket, mint a Google AI Overview és az OpenEvidence, és azt találták, hogy gyakran hiányos és néha ellentmondásos következtetéseket generálnak, még akkor is, ha a helyes válasz rendelkezésre áll.

Kapcsolódó: tudományos állítások ellenőrzése

A SciConBench-ben elért 0,337-es F1 pontszám az arXiv kutatóinak tanulmányában szerepel.

Kapcsolódó: Mimosa Framework

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom