Akár 15-ször gyorsabb lehet a nagy nyelvi modellek futtatása NVIDIA Blackwell GPU-kon a DFlash-sel
A DFlash bevezetésével az NVIDIA Blackwell GPU-kon futó nyelvi modellek nemcsak gyorsabbak lesznek, de a vállalat tervei szerint a technológia közeljövőben más GPU-architektúrákra is kiterjeszthető.

Az NVIDIA DFlash nevű új technológiája jelentősen felgyorsítja a nagy nyelvi modellek (LLM) futtatását NVIDIA Blackwell GPU-kon. A DFlash blokk-speculatív dekódolással dolgozik, párhuzamosan több tokent draftol, majd hatékonyan ellenőrzi azokat a célmodellel, ami akár 15-szörös sebességnövekedést eredményezhet bizonyos tesztekben.
A DFlash akár 15-szörös átviteli sebességet biztosít a gpt-oss-120b modell esetében NVIDIA Blackwell GPU-kon, és megduplázza a Llama 3.1 8B interaktivitását a korábbi EAGLE-3 technológiához képest. További sebességnövekedést mértek Gemma 4 31B modelleknél (akár 5,8x) és Qwen3 8-B modelleknél (akár 5,1x) is — közölte az NVIDIA Developer Blog.
Kapcsolódó: PayPal AI gyorsítása
Az újítás különösen fontos a többügynökös munkafolyamatokban, ahol az alacsony késleltetésű inferencia kulcsfontosságú. Az autoregresszív LLM-ek ugyanis szekvenciálisan generálnak tokeneket, ami korlátozhatja a GPU-kihasználtságot. A DFlash egy könnyűsúlyú blokk-diffúziós draftert használ, amely egyetlen előre passzban generál egy teljes blokk jelölt tokent, így a szekvenciális draftolás helyett párhuzamos GPU-munkavégzést tesz lehetővé, miközben a célmodell ellenőrzése megőrzi a kimeneti minőséget.
Kapcsolódó: CLIP-kódolók méretcsökkentése
Párhuzamosítás és GPU-kihasználtság
Az NVIDIA Blackwell GPU-k architektúrája, amely két nagy méretű chipet köt össze 10 TB/s sebességű összeköttetéssel, kiválóan alkalmas a DFlash párhuzamos munkavégzésére. A technológia jobban ki tudja használni a Blackwell 15 PFLOPS-os számítási kapacitását, így akár 15-ször több felhasználót tud kiszolgálni azonos interaktivitási szint mellett. A tesztek szerint a DFlash magasabb átviteli sebességet kínál a hagyományos autoregresszív dekódoláshoz képest, különösen magas interaktivitási szinteken, mint például 500-600 token/másodperc.
Kapcsolódó: NVIDIA NVFP4 sebességnövekedés
Integráció és elérhetőség
A DFlash kutatási eredményei gyorsan bekerülnek a fejlesztői munkafolyamatokba. A kutatócsapat 20 DFlash modellt tett közzé a Hugging Face-en, NVIDIA Blackwell és Hopper GPU-kra optimalizálva. A technológia könnyen integrálható olyan népszerű inferencia keretrendszerekbe, mint a SGLang, a vLLM és a TensorRT-LLM, jelentős kódmódosítások nélkül. Ez lehetővé teszi a fejlesztők számára, hogy a DFlash-t a saját kiszolgáló infrastruktúrájukba építsék be.
Kapcsolódó: MiniMax M3 modell
A DFlash a Hugging Face-en keresztül elérhetővé vált a Blackwell és Hopper architektúrákhoz, beleértve olyan modellcsaládokat, mint a Qwen, Kimi K2.6, Llama, Gemma és gpt-oss. Az NVIDIA ökoszisztémája biztosítja a zökkenőmentes integrációt, így a fejlesztők gyorsan kihasználhatják az új technológia előnyeit.
Kapcsolódó: Google Gemma 4 sebességnövekedése