ÉlőUtoljára: 1 órájaMa: 1
Kutatásfrissítve: 00:50

Visszajelzés alapján választ példákat a GRIP — javítja a multimodális modellek tanulását

A GRIP keretrendszer a multimodális AI-modellek in-context learning képességét javítja, visszajelzésalapú példaválasztással — a módszer átültethető más modellekre is, mint a GPT-4o vagy a Gemini.

Visszajelzés alapján választ példákat a GRIP — javítja a multimodális modellek tanulását
Fotó: Jesper Aggergaard / Unsplash
forrás: ArXiv CV·AI Forradalom szerk.·
Megosztás

A GRIP, azaz a Guided Retrieval of In-context Prompts egy új, tanuló alapú kép-visszakereső keretrendszer. A módszer a multimodális modellek (LMM) in-context learning (ICL) képességét fejleszti, ami lehetővé teszi új feladatokhoz való adaptációjukat finomhangolás nélkül. A GRIP a modell visszajelzései alapján azonosítja azokat a példákat — képeket, feliratokat vagy kérdés-válasz párokat —, amelyek valóban javítják a modell előrejelzéseit.

A hagyományos megközelítések jellemzően a szolgáltatott példák és a feladat közötti jellemzőtérbeli hasonlóság alapján választanak ki kontextus-példákat. A kutatók azonban kimutatták, hogy ez az elv nem mindig helytálló: a vizuálisan hasonló példák nem feltétlenül járulnak hozzá a leghatékonyabban az in-context learning teljesítményének növeléséhez.

Kapcsolódó: alacsony erőforrású nyelvek

Mire képes a modell

A GRIP ezt a problémát orvosolja azáltal, hogy kontrasztív tanítással tanulja meg megkülönböztetni a hasznos és a káros példákat, így a visszakeresés túlmutat a puszta hasonlóságon.

Kapcsolódó: multimodális RAG hibák

Árazás és elérhetőség

A GRIP keretrendszer három multimodális feladaton — osztályozás, képaláírás és vizuális kérdés-válaszadás (VQA) — tesztelve következetesen felülmúlta a hasonlóság-alapú visszakeresést a Qwen2.5-VL-7B modellen. A legnagyobb javulást osztályozási feladatokon érte el az Idefics2-8B modellen.

Kapcsolódó: dokumentum megértés

Különösen figyelemre méltó, hogy a GRIP-retrieverek, amelyeket egy nyílt forráskódú LMM visszajelzéseivel tanítottak, átültethetők más modellekre, beleértve a zárt forráskódú GPT-4o-t és a Geminit is, anélkül, hogy újratanításra lenne szükségük. A GRIP-et a Qwen2.5-VL-7B modell segítségével tesztelték.

Kapcsolódó: nyelvi modellek tesztelése

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom