ÉlőUtoljára: 1 órájaMa: 6
Modellek & LLMfrissítve: 04:15

Átalakítás nélkül finomhangolhatók a diffúziós modellek az NVIDIA és a Hugging Face újításával

Az új fejlesztés révén a mesterséges intelligencia kutatók és fejlesztők jelentősen felgyorsíthatják a diffúziós modellek testreszabását, anélkül, hogy bonyolult átalakítási folyamatokkal kellene foglalkozniuk. Az integráció számos népszerű modelltípust támogat, és rugalmasan skálázható, akár egyetlen GPU-tól kezdve.

Átalakítás nélkül finomhangolhatók a diffúziós modellek az NVIDIA és a Hugging Face újításával
Fotó: Thomas Foster / Unsplash
forrás: Hugging Face·AI Forradalom szerk.·
Megosztás

Az NVIDIA és a Hugging Face közös fejlesztése, a NeMo Automodel, új lehetőségeket nyit a diffúziós modellek finomhangolásában. A megoldás lehetővé teszi, hogy bármely, a Hugging Face Hubon elérhető Diffusers formátumú modellt átalakítás vagy újrakódolás nélkül tréningezzünk, egészen egyetlen GPU-tól több százig skálázva.

A NeMo Automodel a Hugging Face ökosztémájával natívan integrálódik. Bármely Diffusers modell azonosítóját megadva elkezdhetjük a tréninget, a NeMo Automodel pedig a Diffusers modellosztályokat és folyamatokat használja a betöltéshez és generáláshoz. Az elkészült checkpointok problémamentesen visszailleszthetők a Diffusers ökoszisztémájába, így a kvantálás, fordítás, LoRA adapterek és egyéni mintavevők is tovább működnek. Ez a megközelítés jelentősen leegyszerűsíti az új modellek támogatását is: egy új modell hozzáadása mindössze egy kis, elkülönített kódbővítést igényel.

Kapcsolódó: NVIDIA Model Optimizer

Skálázhatóság és paraméterhatékony módszerek

A rendszer támogatja mind a teljes finomhangolást (full finomhangolás), mind a paraméterhatékony módszereket, mint a LoRA. Ez lehetővé teszi a felhasználók számára, hogy a minőség és a hatékonyság között válasszanak, akár egyetlen csomóponton, akár egy nagyméretű klaszteren. A NeMo Automodel olyan skálázhatósági funkciókat kínál, mint a FSDP2, tenzor-, kontextus- és folyamat-párhuzamosság, valamint a többcsomópontos vezérlés (jelenleg SLURM, később Kubernetes). Ezek a képességek teszik lehetővé nagyobb modellek, mint a 12 milliárdos FLUX.1-dev vagy a 13 milliárdos HunyuanVideo tréningezését.

Kapcsolódó: valós idejű ASR-modell

Finomhangolási folyamat és memóriahatékonyság

A finomhangolási folyamat magában foglalja az adathalmaz előzetes kódolását, amely során a VAE latens reprezentációkat és szöveges embeddingeket gyorsítótárazunk. Ezt követően a tréning elindítható a meglévő FLUX YAML konfigurációk felhasználásával, parancssori felülírásokkal. A generálás a finomhangolt checkpointból történik a Diffusers folyamatokon keresztül. A rendszer memóriahatékony funkciókat is kínál, mint a latent caching, multiresolution bucketing és DTensor-native sharding.

Kapcsolódó: NVIDIA Star Elastic

A NeMo Automodel integrációja készenlétben álló finomhangolási recepteket tartalmaz olyan nyílt diffúziós modellekhez, mint a FLUX.1-dev (12B paraméter), FLUX.2-dev (32B paraméter), Wan 2.1 T2V (1.3B / 14B), Wan 2.2 T2V (27B összesen, 14B aktív lépésenként), HunyuanVideo 1.5 (13B) és Qwen-Image (20B MMDiT). A Wan 2.1 T2V 1.3B modell például egyetlen 40 GB-os A100 GPU-n is elfér.

Kapcsolódó: NVFP4 formátum előnyei

A NeMo Automodel Docker konténer (nvcr.io/nvidia/nemo-automodel:26.06) vagy pip telepítéssel érhető el. A fejlesztők a Hugging Face Hubon található bármely Diffusers modell azonosítójával indíthatják a tréninget. A receptkönyvtár Apache 2.0 licenc alatt nyílt forráskódú, és tartalmazza a FLUX.1-dev, Wan 2.1/2.2, HunyuanVideo és Qwen-Image modellekhez szükséges példákat.

Kapcsolódó: xAI Grok Imagine 1.5

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom