Bemutatták a SciConBench-et, az új tudományos teljesítménytesztet, amelyen az AI-ügynökök csak 33,7%-os pontosságot értek el
A legfejlettebb AI-ügynökök is csak 33,7%-os pontosságot értek el tudományos következtetések szintetizálásában, még ellenőrzött körülmények között is — derül ki egy új, 9.11K kérdéses benchmarkból.

Az AI-ügynökök egyre inkább képesek bizonyítékokat gyűjteni, forrásokat elemezni és következtetéseket szintetizálni, amelyeket fontos döntésekhez használnak. Azonban magas tétű területeken, mint az egészségügy, képességeik még mindig bizonytalanok — írja az arXiv kutatóinak tanulmánya.
SciConBench: Az új tudományos teljesítményteszt
A kutatók bemutatták a SciConBench-et, egy nagyszabású, élő teljesítménytesztet 9.11K kérdéssel és szakértők által írt következtetésekkel, amelyeket szisztematikus áttekintésekből gyűjtöttek. A teljesítményteszt egy szakértő által validált automatizált értékelési folyamatot használ, amely a következtetéseket atomi tényekre bontja, és a pontosságot, valamint a teljességet méri.
Kapcsolódó: tudományos adatelemzés
Teljesítmény a tiszta környezetben
Az adatvesztés elkerülése érdekében bevezették a SciConHarness-t, egy ellenőrzött értékelési rendszert, amely kontrollált webes interakcióval látja el az ügynököket. Nyolc fejlett modell és kutatóügynök értékelése során kiderült, hogy a ténybeli minőség alacsony maradt: tiszta környezetben a legjobb ügynök mindössze 0,337-es F1 pontszámot ért el.
Kapcsolódó: LLM értékelés
Az AI-ügynökök korlátai
A tiszta értékelési környezet következetesen csökkenti a teljesítményt a korlátozatlan értékeléshez képest, ami arra utal, hogy az adatvesztés felfújja a modellek valódi szintetizálási képességeire vonatkozó becsléseket. A kutatók auditálták a fogyasztóknak szánt ügynököket, mint a Google AI Overview és az OpenEvidence, és azt találták, hogy gyakran hiányos és néha ellentmondásos következtetéseket generálnak, még akkor is, ha a helyes válasz rendelkezésre áll.
Kapcsolódó: tudományos állítások ellenőrzése
A SciConBench-ben elért 0,337-es F1 pontszám az arXiv kutatóinak tanulmányában szerepel.
Kapcsolódó: Mimosa Framework