
Bemutatták a SciConBench-et, az új tudományos teljesítménytesztet, amelyen az AI-ügynökök csak 33,7%-os pontosságot értek el
A legfejlettebb AI-ügynökök is csak 33,7%-os pontosságot értek el tudományos következtetések szintetizálásában, még ellenőrzött körülmények között is — derül ki egy új, 9.11K kérdéses benchmarkból.



















