Képekhez kapcsolódó szövegek tagadását is érti az új HANCLIP modell
A HANCLIP 20 000 kép-szöveg kvadrupelből tanul, és a tagadó mondatok kezelésében 15%-kal jobb a NegBench teljesítményteszten, mint a CLIP vagy a LongCLIP.

A Vision-Language Model (VLM) modellek általában nagy kép-szöveg adathalmazokon tanulnak, ám a tagadó mondatokkal meglepően gyengén teljesítenek. Gyakran csak felületes szókincs-egyezésre hagyatkoznak, és könnyen elvonja őket a félrevezető vagy irreleváns szöveg, még akkor is, ha egyébként jól teljesítenek a kép-szöveg megfeleltetésben vagy osztályozásban. A tagadó adatokkal való finomhangolás ráadásul ronthatja a korábbi tudást, ami a szokásos VLM benchmarkokon is teljesítménycsökkenést okozhat.
A HANCLIP geometriai megközelítése
E problémák leküzdésére a kutatók bemutatták a HANCLIP-et (Hyperbolic + Angular + Negation), amely egy VLM-családot takar. A modell explicit módon átrendezi a beágyazási teret, hogy a „amit egy kép nem tartalmaz” információt is kódolja a „amit tartalmaz” mellett. A HANCLIP egy 20 000 kép-szöveg kvadrupelból álló, kompakt adathalmazon tanul, és egy hiperbolikus formulációt kombinál egy szögtávolság-triplet objektívummal. Ez utóbbi szisztematikusan szétválasztja a tagadott leírásokat a pozitívoktól.
Kapcsolódó: DistractMIA adatkészlet feltárása
Eredmények és kompatibilitás
A geometria-központú kialakítás erősíti a tagadásérzékenységet, miközben megőrzi az előre betanított reprezentációk globális szerkezetét, ahelyett, hogy felülírná azokat. A kiterjedt kísérletek több látás-nyelv feladaton azt mutatják, hogy a HANCLIP következetes javulást hoz a tagadás-fókuszú NegBench teljesítményteszten, miközben versenyképes vagy javított teljesítményt tart fenn a szokásos osztályozási és kép-szöveg lekérdezési benchmarkokon. A kutatók szerint a keretrendszer modell-agnosztikus, és beilleszthető meglévő CLIP-alapú architektúrákba — mint a CLIP, LongCLIP, SmartCLIP és HiMo-CLIP — nagyszabású újratanítás nélkül.
Kapcsolódó: SynopticBench időjárás-támogatás
Ez azt mutatja, hogy egy gondosan megtervezett geometriai célkitűzés jelentősen kiterjesztheti a meglévő VLM-ek érvelési képességeit, mindössze szerény többlet adattal. A HANCLIP a NegBench teljesítményteszten következetes előrelépést biztosít, miközben megőrzi a versenyképes vagy javított teljesítményt a standard osztályozási és kép-szöveg lekérdezési benchmarkokon — írja a kutatócsapat az arXiv előnyomtatott cikkében.
Kapcsolódó: LLM-ek tagadáskezelése