ÉlőUtoljára: 3 perceMa: 28
Kutatásfrissítve: 10:10

Két AI-modell együttműködése javítja a videóérthetőséget — 1,4%-kal pontosabb válaszok

A módszer a nehéz kérdések esetében 1,4%-kal pontosabb eredményeket hoz, és az ImplicitQA teljesítményteszten mutatta be hatékonyságát.

Két AI-modell együttműködése javítja a videóérthetőséget — 1,4%-kal pontosabb válaszok
Fotó: Shubham Dhage / Unsplash
forrás: ArXiv CV·AI Forradalom szerk.·
Megosztás

A kutatók új eljárást dolgoztak ki a videókban elrejtett információkat megértő AI-modellek pontosságának növelésére. Az ImplicitQA teljesítményteszten a feladat nehéz, mivel a helyes válasz sosem látható explicit módon, azt következtetni kell a háttérből, ok-okozati összefüggésekből és térbeli elrendezésből.

A hagyományos módszerek, mint a többszörös mintavételezés és szavazás, nem mindig segítenek, mert a modell hibái hasonlóak lehetnek. Az új, Disagreement-Based Cross-Model Routing eljárás ezt küszöböli ki, pusztán következtetési időben működik, nem igényel címkézést vagy újratanítást.

Kapcsolódó: VideoSEAL technológia

Két modell együttműködése

Az eljárás során a Gemini 3.1 Pro Preview modellt háromszor mintavételezik. Ezt követően azokat a kérdéseket, amelyeknél a három válasz eltér egymástól (ez a kérdések mintegy 20%-a), egy másik, eltérő családból származó modellnek, a Claude Opus 4.8-nak küldik. Ez utóbbi modell már egységesen mintavételezett képkockákat dolgoz fel, adaptív gondolkodással.

Kapcsolódó: KARMA-MV adatbázis

Eredmények a teljesítményteszten

A 1001 kérdéses validációs adathalmazon a módszer 1,43%-kal javította az átlagos pontosságot (AvgAcc) a Gemini modell legjobb önálló mintájához képest. A legnagyobb javulás a mozgás és trajektória (+5,49%), az infereált számlálás (+3,45%) és a függőleges térbeli érvelés (+1,82%) kategóriákban volt tapasztalható.

Kapcsolódó: LatentRouter modell

Az eljárást a CVPR ImplicitQA challenge tesztkészleten is tesztelték, ahol 82,03 AvgAcc és 79,71 MacroAvgAcc pontszámot ért el, ami 1,81%-os javulás a Gemini modellhez képest a Claude Opus 4.8 modell segítségével.

Kapcsolódó: GPAgen rendszer

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom