Két AI-modell együttműködése javítja a videóérthetőséget — 1,4%-kal pontosabb válaszok
A módszer a nehéz kérdések esetében 1,4%-kal pontosabb eredményeket hoz, és az ImplicitQA teljesítményteszten mutatta be hatékonyságát.

A kutatók új eljárást dolgoztak ki a videókban elrejtett információkat megértő AI-modellek pontosságának növelésére. Az ImplicitQA teljesítményteszten a feladat nehéz, mivel a helyes válasz sosem látható explicit módon, azt következtetni kell a háttérből, ok-okozati összefüggésekből és térbeli elrendezésből.
A hagyományos módszerek, mint a többszörös mintavételezés és szavazás, nem mindig segítenek, mert a modell hibái hasonlóak lehetnek. Az új, Disagreement-Based Cross-Model Routing eljárás ezt küszöböli ki, pusztán következtetési időben működik, nem igényel címkézést vagy újratanítást.
Kapcsolódó: VideoSEAL technológia
Két modell együttműködése
Az eljárás során a Gemini 3.1 Pro Preview modellt háromszor mintavételezik. Ezt követően azokat a kérdéseket, amelyeknél a három válasz eltér egymástól (ez a kérdések mintegy 20%-a), egy másik, eltérő családból származó modellnek, a Claude Opus 4.8-nak küldik. Ez utóbbi modell már egységesen mintavételezett képkockákat dolgoz fel, adaptív gondolkodással.
Kapcsolódó: KARMA-MV adatbázis
Eredmények a teljesítményteszten
A 1001 kérdéses validációs adathalmazon a módszer 1,43%-kal javította az átlagos pontosságot (AvgAcc) a Gemini modell legjobb önálló mintájához képest. A legnagyobb javulás a mozgás és trajektória (+5,49%), az infereált számlálás (+3,45%) és a függőleges térbeli érvelés (+1,82%) kategóriákban volt tapasztalható.
Kapcsolódó: LatentRouter modell
Az eljárást a CVPR ImplicitQA challenge tesztkészleten is tesztelték, ahol 82,03 AvgAcc és 79,71 MacroAvgAcc pontszámot ért el, ami 1,81%-os javulás a Gemini modellhez képest a Claude Opus 4.8 modell segítségével.
Kapcsolódó: GPAgen rendszer