ÉlőUtoljára: 34 perceMa: 6
Modellek & LLMfrissítve: 18:15

Zenére táncoló videókat generál perces hosszúságban a Wan-Dancer-14B

A Wan-Dancer-14B modell perces hosszúságú, koherens táncvideókat generál zenére, globális szerkezettel és időbeli folytonossággal. A Wan-AI által fejlesztett AI súlyait és futtatási kódját nyíltan elérhetővé tették.

Zenére táncoló videókat generál perces hosszúságban a Wan-Dancer-14B
Fotó: Zulfugar Karimov / Unsplash
forrás: Hetzner: Hugging Face Models (trending)·AI Forradalom szerk.·
Megosztás

A Wan-AI bemutatta a Wan-Dancer-14B modellt, amely képes hosszú, kiváló minőségű, ritmikus táncvideók létrehozására zenéből. A modell globális szerkezetet és időbeli folytonosságot biztosít a generált táncok során, így perces hosszúságú koreográfiákat is képes előállítani.

A fejlesztők a modell súlyait és a futtatási kódot is közzétették, így bárki kipróbálhatja a HuggingFace Space vagy a ModelScope Studio felületeken. A Wan-Dancer-14B egy hierarchikus keretrendszeren alapul, amely kettéosztja a folyamatot globális kulcskocka tervezésre és helyi időbeli finomításra, kihasználva a teljes zeneszám kontextusát a hosszú távú koherencia érdekében.

Kapcsolódó: Krea-2 Raw modell

Táncstílusok és paraméterek

A modell különféle táncstílusok generálását támogatja, beleértve a kínai klasszikus táncot, a K-Popot, a street dance-t, a tap dance-t és a latin táncot. A felhasználók a prompt fájlokon keresztül határozhatják meg a kívánt stílust, valamint beállíthatnak olyan paramétereket, mint a véletlenszám-generátor magja (seed), a referenciakép útvonala, a zene fájlja és a diffúziós lépések száma (num_inference_steps).

Kapcsolódó: Gemma-4-12B modell

Telepítés és futtatás

A Wan-Dancer telepítése magában foglalja a GitHub repozitórium klónozását és a szükséges függőségek, köztük a PyTorch, torchvision és diffusers telepítését. A generálási folyamat két fő lépésből áll: először egy globális kulcskocka videót hoz létre a `gen_video_global.sh` szkript futtatásával, majd ezt követően egy helyi finomítási szakasz állítja elő a végső, nagy felbontású videót a `gen_video_local.sh` szkript segítségével. A helyi finomításhoz szükséges a korábban generált globális videó elérhetősége.

Kapcsolódó: Wan-Image AI-rendszer

A modell 14 milliárd paraméterrel rendelkezik, és a Hugging Face-en már több mint 2400 letöltést regisztráltak. A fejlesztők a kódot Apache 2.0 licenc alatt tették elérhetővé, és idézési javaslatot is megfogalmaztak a kutatási célú felhasználáshoz. A modell 2026. július 13-án jelent meg.

Kapcsolódó: Seedance 2.5 videómodell

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom