ÉlőUtoljára: 4 órájaMa: 2
Modellek & LLMfrissítve: 18:15

Képgeneráló AI-t dobott piacra a Microsoft, jóval kisebb a versenytársainál

A Microsoft Mage-Flow egy 4 milliárd paraméteres AI-modell, amely hatékonyan képes képeket generálni és szerkeszteni, miközben jóval kisebb a versenytársainál.

Képgeneráló AI-t dobott piacra a Microsoft, jóval kisebb a versenytársainál
Fotó: BoliviaInteligente / Unsplash
forrás: Hetzner: Hugging Face Models (trending)·AI Forradalom szerk.·
Megosztás

A Microsoft Mage-Flow egy új, 4 milliárd paraméteres AI-modellcsalád, amely a szöveges leírások alapján képes képeket generálni és szerkeszteni. A modell kiemelkedő minőséget ér el, miközben gyors, memóriatakarékos és könnyen finomhangolható, még korlátozott számítási kapacitás mellett is.

A Mage-Flow megalkotásakor a fejlesztők a paraméterek számának növelése helyett a tokenizer, a backbone és a rendszer együttes optimalizálására összpontosítottak. A rendszer két fő részből áll: a Mage-VAE, egy könnyű, nagy felbontású latent tokenizer, és a NR-MMDiT, egy 4 milliárd paraméteres Native-Resolution Multimodal Diffusion Transformer. Ezek együtt teszik lehetővé a natív felbontású képgenerálást 512 és 2048 pixeles méret között, bármilyen képarányban.

Kapcsolódó: Krea.ai új modellje

Kisebb, de erősebb

A Mage-Flow képes felvenni a versenyt olyan sokkal nagyobb, nyílt forráskódú rendszerekkel, mint a Qwen-Image (20 milliárd paraméter), a Z-Image (6 milliárd paraméter) vagy a FLUX.2 (32 milliárd paraméter). A Mage-VAE tokenizer a FLUX.2-VAE rekonstrukciós hűségét hozza, miközben 12-szer, illetve 22-szer kevesebb számítási műveletet igényel a képpontok kódolásához és dekódolásához. Ez kiküszöböli a VAE-t, mint a nagy felbontású feldolgozás szűk keresztmetszetét.

Kapcsolódó: OBLITERATUS új modellje

Gyors képalkotás és sokoldalú szerkesztés

A rendszer optimalizált betanítási infrastruktúrája, beleértve a natív felbontású csomagolást és az összevont CUDA kernel-képességeket, a lépésenkénti betanítási időt körülbelül 1,93 másodpercről 0,78 másodpercre csökkentette, ami több mint 2,5-szeres gyorsulást jelent. A Mage-Flow-Edit verzió képes szemantikai tartalom szerkesztésére, megjelenés átalakítására, képhelyreállításra és struktúratudatos kimenetek létrehozására egyetlen, kép- és szövegfeltételes modellben. A 1024² felbontáson, egyetlen A100 GPU-n futtatva a Mage-Flow-Turbo 0,59 másodperc alatt generál képet, míg a Mage-Flow-Edit-Turbo 1,02 másodperc alatt végez egy szerkesztést, minimális, 18–20 GB memóriahasználattal.

Kapcsolódó: Photoroom képalkotója

A modellcsalád Base, RL-aligned és 4-lépéses Turbo változatokban érhető el mind generáláshoz, mind szerkesztéshez. A Mage-Flow képes az utasítások pontos követésére, finom részletek megjelenítésére, valamint olvasható angol és kínai szöveg renderelésére. A Mage-Flow-Edit pedig egyedi kimeneteket képes generálni egyetlen referenciaképből.

Kapcsolódó: Microsoft GPT-5 modellje

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom