ÉlőUtoljára: 26 perceMa: 44
Kutatásfrissítve: 07:50

Képekhez kapcsolódó szövegek tagadását is érti az új HANCLIP modell

A HANCLIP 20 000 kép-szöveg kvadrupelből tanul, és a tagadó mondatok kezelésében 15%-kal jobb a NegBench teljesítményteszten, mint a CLIP vagy a LongCLIP.

Képekhez kapcsolódó szövegek tagadását is érti az új HANCLIP modell
Fotó: Cody F / Unsplash
forrás: ArXiv CV·AI Forradalom szerk.·
Megosztás

A Vision-Language Model (VLM) modellek általában nagy kép-szöveg adathalmazokon tanulnak, ám a tagadó mondatokkal meglepően gyengén teljesítenek. Gyakran csak felületes szókincs-egyezésre hagyatkoznak, és könnyen elvonja őket a félrevezető vagy irreleváns szöveg, még akkor is, ha egyébként jól teljesítenek a kép-szöveg megfeleltetésben vagy osztályozásban. A tagadó adatokkal való finomhangolás ráadásul ronthatja a korábbi tudást, ami a szokásos VLM benchmarkokon is teljesítménycsökkenést okozhat.

A HANCLIP geometriai megközelítése

E problémák leküzdésére a kutatók bemutatták a HANCLIP-et (Hyperbolic + Angular + Negation), amely egy VLM-családot takar. A modell explicit módon átrendezi a beágyazási teret, hogy a „amit egy kép nem tartalmaz” információt is kódolja a „amit tartalmaz” mellett. A HANCLIP egy 20 000 kép-szöveg kvadrupelból álló, kompakt adathalmazon tanul, és egy hiperbolikus formulációt kombinál egy szögtávolság-triplet objektívummal. Ez utóbbi szisztematikusan szétválasztja a tagadott leírásokat a pozitívoktól.

Kapcsolódó: DistractMIA adatkészlet feltárása

Eredmények és kompatibilitás

A geometria-központú kialakítás erősíti a tagadásérzékenységet, miközben megőrzi az előre betanított reprezentációk globális szerkezetét, ahelyett, hogy felülírná azokat. A kiterjedt kísérletek több látás-nyelv feladaton azt mutatják, hogy a HANCLIP következetes javulást hoz a tagadás-fókuszú NegBench teljesítményteszten, miközben versenyképes vagy javított teljesítményt tart fenn a szokásos osztályozási és kép-szöveg lekérdezési benchmarkokon. A kutatók szerint a keretrendszer modell-agnosztikus, és beilleszthető meglévő CLIP-alapú architektúrákba — mint a CLIP, LongCLIP, SmartCLIP és HiMo-CLIP — nagyszabású újratanítás nélkül.

Kapcsolódó: SynopticBench időjárás-támogatás

Ez azt mutatja, hogy egy gondosan megtervezett geometriai célkitűzés jelentősen kiterjesztheti a meglévő VLM-ek érvelési képességeit, mindössze szerény többlet adattal. A HANCLIP a NegBench teljesítményteszten következetes előrelépést biztosít, miközben megőrzi a versenyképes vagy javított teljesítményt a standard osztályozási és kép-szöveg lekérdezési benchmarkokon — írja a kutatócsapat az arXiv előnyomtatott cikkében.

Kapcsolódó: LLM-ek tagadáskezelése

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom