Nyelvi modellek tanítják a képfeldolgozókat új módszerrel
A LaViD keretrendszerrel a nyelvi modellek képeket feldolgozó társaikat tanítják, anélkül, hogy maguk látnák a képeket. A módszer több teljesítményteszten is felülmúlja a Vision-Language modelleket.

Új módszert dolgoztak ki a kutatók, amellyel a nagy nyelvi modellek (LLM) vizuális tudást adhatnak át képeket feldolgozó társaiknak. A LaViD (Language-to-Visual Knowledge Distillation) keretrendszer a nyelvi modell magas szintű szemantikai tudását használja fel, anélkül, hogy a modellnek hozzáférése lenne képi adatokhoz. Ezt úgy érik el, hogy az LLM-et kérdések generálására ösztönzik, amelyek a vizuális osztályok közötti szemantikai különbségeket vizsgálják. Az így kapott információból a diákmodell, egy csak vizuális adatokkal dolgozó modell, tanul — írja az arXiv.
A LaViD jelentős előrelépést jelent a multimodális tanulásban, mivel a nyelvi modell, amely csak szövegből tanult, képes vizuális feladatokhoz szükséges tudást átadni. A keretrendszer a vizuális osztályokat egy kérdésekre adott válaszok eloszlásához rendeli, így hozva létre egy gazdag „konceptuális aláírást”. Ez az aláírás irányítja a diákmodellt egy kiegészítő desztillációs veszteségen keresztül.
Kapcsolódó: Vizuális bizonyítékok értelmezése
A kutatók szerint a LaViD következetesen felülmúlja a legújabb módszereket, mint például a MaKD, amelyek látás-nyelvi modellektől (vision-language models) tanulnak. Ezenkívül versenyképes vagy jobb teljesítményt nyújt olyan fejlett vizuális desztillációs módszerekkel szemben, mint a DKD és a MLKD. A logit-standardizációval kombinálva további javulás érhető el.
Kapcsolódó: Vizuális érvelés LLM-eknél
A Waterbirds adatkészleten végzett kísérletek során a LaViD jelentősen javította a legrosszabbul teljesítő csoport pontosságát. Ez azt mutatja, hogy a módszer robusztusabbá teszi a modelleket a téves korrelációkkal szemben, ami kulcsfontosságú a valós világban való megbízható működéshez.
Kapcsolódó: Tudás explicit szabályokra
A kutatás eredményeit a szerzők jelentették, és független ellenőrzés még nem történt. A LaViD forráskódja elérhető a GitHubon.
Kapcsolódó: Offline desztilláció kisebb LLM-eknél