ÉlőUtoljára: 2 órájaMa: 5
Kutatásfrissítve: 21:15

Egyetlen réteg elég az Apple új képgeneráló modelljéhez

Az Apple kutatói bemutatták a FAE (Feature Auto-Encoder) keretrendszert, ami egyetlen figyelmi réteggel képes a pretréningelt vizuális kódolókat generálásra alkalmas, alacsony dimenziós latens térré alakítani.

Egyetlen réteg elég az Apple új képgeneráló modelljéhez
Fotó: BoliviaInteligente / Unsplash
forrás: Apple ML·AI Forradalom szerk.·
Megosztás

A vizuális generatív modellek, mint a diffúziós modellek, általában tömörített latens terekben működnek az edzés hatékonyságának és a minta minőségének egyensúlyozása érdekében. Ugyanakkor egyre nagyobb az érdeklődés a kiváló minőségű, előre betanított vizuális reprezentációk kihasználása iránt. Ezen reprezentációk adaptálása azonban kihívást jelentett a megértés-orientált funkciók és a generálás-barát latens terek közötti alapvető eltérések miatt. A reprezentáció-kódolók magas dimenziós latensekből profitálnak, amelyek a maszkolt régiókra vonatkozóan sokféle hipotézist rögzítenek, míg a generatív modellek alacsony dimenziós latenseket részesítenek előnyben, amelyeknek hűségesen meg kell őrizniük a befecskendezett zajt.

Két dekóder a minőségért

A FAE kulcsa két különálló mély dekóder összekapcsolása: az egyik az eredeti feature teret rekonstruálja, a másik pedig a rekonstruált feature-öket használja képgeneráláshoz. Ez a megközelítés lehetővé teszi, hogy a modell mindkét típusú latens tér igényeit kielégítse. A FAE generikus, így különféle önfelügyelt kódolókkal (például DINO, SigLIP) és két különböző generatív családba – diffúziós modellekbe és normalizáló áramlatokba – illeszthető.

Kapcsolódó: VAE-tömörítési fejlesztés

Erős teljesítmény benchmarkokon

Kapcsolódó: VLM és 3D-modellek

A FAE osztály-kondicionált és szöveg-kép generálási benchmarkokon is erős teljesítményt mutat. Az ImageNet 256×256 adathalmazon a CFG-vel ellátott diffúziós modellünk 1,29-es FID-t ért el 800 edzési epoch után, és 1,70-et 80 epoch után. CFG nélkül a FAE 1,48-as FID-t produkált 800 epoch alatt, és 2,08-at 80 epoch alatt, ami kiemelkedő minőséget és gyors tanulást demonstrál.

Kapcsolódó: RTM képfinomítás

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom