Egyetlen réteg elég az Apple új képgeneráló modelljéhez
Az Apple kutatói bemutatták a FAE (Feature Auto-Encoder) keretrendszert, ami egyetlen figyelmi réteggel képes a pretréningelt vizuális kódolókat generálásra alkalmas, alacsony dimenziós latens térré alakítani.

A vizuális generatív modellek, mint a diffúziós modellek, általában tömörített latens terekben működnek az edzés hatékonyságának és a minta minőségének egyensúlyozása érdekében. Ugyanakkor egyre nagyobb az érdeklődés a kiváló minőségű, előre betanított vizuális reprezentációk kihasználása iránt. Ezen reprezentációk adaptálása azonban kihívást jelentett a megértés-orientált funkciók és a generálás-barát latens terek közötti alapvető eltérések miatt. A reprezentáció-kódolók magas dimenziós latensekből profitálnak, amelyek a maszkolt régiókra vonatkozóan sokféle hipotézist rögzítenek, míg a generatív modellek alacsony dimenziós latenseket részesítenek előnyben, amelyeknek hűségesen meg kell őrizniük a befecskendezett zajt.
Két dekóder a minőségért
A FAE kulcsa két különálló mély dekóder összekapcsolása: az egyik az eredeti feature teret rekonstruálja, a másik pedig a rekonstruált feature-öket használja képgeneráláshoz. Ez a megközelítés lehetővé teszi, hogy a modell mindkét típusú latens tér igényeit kielégítse. A FAE generikus, így különféle önfelügyelt kódolókkal (például DINO, SigLIP) és két különböző generatív családba – diffúziós modellekbe és normalizáló áramlatokba – illeszthető.
Kapcsolódó: VAE-tömörítési fejlesztés
Erős teljesítmény benchmarkokon
Kapcsolódó: VLM és 3D-modellek
A FAE osztály-kondicionált és szöveg-kép generálási benchmarkokon is erős teljesítményt mutat. Az ImageNet 256×256 adathalmazon a CFG-vel ellátott diffúziós modellünk 1,29-es FID-t ért el 800 edzési epoch után, és 1,70-et 80 epoch után. CFG nélkül a FAE 1,48-as FID-t produkált 800 epoch alatt, és 2,08-at 80 epoch alatt, ami kiemelkedő minőséget és gyors tanulást demonstrál.
Kapcsolódó: RTM képfinomítás