Új keretrendszer segíti a vizuális okoskodást — 18 millió paraméteres modell
A L-VARC modell nyelvvezérelt tanulással javítja a vizuális okoskodást, és felülmúlja a jelenlegi élvonalbeli megoldásokat. A modell 18 millió paraméterrel dolgozik.

Új keretrendszerrel, a L-VARC-kal rukkolt elő a GZHU-DVL kutatócsoport, amely a vizuális okoskodás terén hozhat áttörést. A modell a vizuális feladatok megoldásához nyelvi útmutatást használ, így képes absztrakciós és átalakítási szabályokat tanulni kevés példából, és általánosítani az új feladatokra.
A hagyományos módszerek vagy nagy, milliárdos paraméterű nyelvi modellekre támaszkodnak, vagy a képi mintázatokra túlságosan is ráfókuszálva, magas szintű szemantikai megértés nélkül működnek. A L-VARC egy nyelvvezérelt, privilégiált információkon alapuló tanulási (LUPI) ágat használ, hogy ezt a problémát orvosolja.
Kapcsolódó: Vizuális érvelés fejlesztése
A vizuális és nyelvi információk összehangolása
A L-VARC egy kereszt-attenciós projektort is tartalmaz, amely a vizuális jellemzőket a szemantikai beágyazásokkal hangolja össze. Ez a lépés kulcsfontosságú a vizuális feladatok megoldásához szükséges mélyebb megértés elősegítésében.
Kapcsolódó: Neuro-szimbolikus architektúra
Teljesítmény és eredmények
Kiterjedt kísérletek igazolják, hogy a L-VARC hatékonyan hasznosítja a nyelvi előzményeket a vizuális okoskodás javítására. A kutatás eredményei szerint a L-VARC felülmúlja a jelenlegi élvonalbeli modellek teljesítményét, és az arXiv-on érhetők el.
Kapcsolódó: Vizuális fókusz javítása