ÉlőUtoljára: 1 órájaMa: 2
Modellek & LLMfrissítve: 17:30

Akár 15-ször gyorsabb lehet a nagy nyelvi modellek futtatása NVIDIA Blackwell GPU-kon a DFlash-sel

A DFlash bevezetésével az NVIDIA Blackwell GPU-kon futó nyelvi modellek nemcsak gyorsabbak lesznek, de a vállalat tervei szerint a technológia közeljövőben más GPU-architektúrákra is kiterjeszthető.

Akár 15-ször gyorsabb lehet a nagy nyelvi modellek futtatása NVIDIA Blackwell GPU-kon a DFlash-sel
Fotó: Đào Hiếu / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Az NVIDIA DFlash nevű új technológiája jelentősen felgyorsítja a nagy nyelvi modellek (LLM) futtatását NVIDIA Blackwell GPU-kon. A DFlash blokk-speculatív dekódolással dolgozik, párhuzamosan több tokent draftol, majd hatékonyan ellenőrzi azokat a célmodellel, ami akár 15-szörös sebességnövekedést eredményezhet bizonyos tesztekben.

A DFlash akár 15-szörös átviteli sebességet biztosít a gpt-oss-120b modell esetében NVIDIA Blackwell GPU-kon, és megduplázza a Llama 3.1 8B interaktivitását a korábbi EAGLE-3 technológiához képest. További sebességnövekedést mértek Gemma 4 31B modelleknél (akár 5,8x) és Qwen3 8-B modelleknél (akár 5,1x) is — közölte az NVIDIA Developer Blog.

Kapcsolódó: PayPal AI gyorsítása

Az újítás különösen fontos a többügynökös munkafolyamatokban, ahol az alacsony késleltetésű inferencia kulcsfontosságú. Az autoregresszív LLM-ek ugyanis szekvenciálisan generálnak tokeneket, ami korlátozhatja a GPU-kihasználtságot. A DFlash egy könnyűsúlyú blokk-diffúziós draftert használ, amely egyetlen előre passzban generál egy teljes blokk jelölt tokent, így a szekvenciális draftolás helyett párhuzamos GPU-munkavégzést tesz lehetővé, miközben a célmodell ellenőrzése megőrzi a kimeneti minőséget.

Kapcsolódó: CLIP-kódolók méretcsökkentése

Párhuzamosítás és GPU-kihasználtság

Az NVIDIA Blackwell GPU-k architektúrája, amely két nagy méretű chipet köt össze 10 TB/s sebességű összeköttetéssel, kiválóan alkalmas a DFlash párhuzamos munkavégzésére. A technológia jobban ki tudja használni a Blackwell 15 PFLOPS-os számítási kapacitását, így akár 15-ször több felhasználót tud kiszolgálni azonos interaktivitási szint mellett. A tesztek szerint a DFlash magasabb átviteli sebességet kínál a hagyományos autoregresszív dekódoláshoz képest, különösen magas interaktivitási szinteken, mint például 500-600 token/másodperc.

Kapcsolódó: NVIDIA NVFP4 sebességnövekedés

Integráció és elérhetőség

A DFlash kutatási eredményei gyorsan bekerülnek a fejlesztői munkafolyamatokba. A kutatócsapat 20 DFlash modellt tett közzé a Hugging Face-en, NVIDIA Blackwell és Hopper GPU-kra optimalizálva. A technológia könnyen integrálható olyan népszerű inferencia keretrendszerekbe, mint a SGLang, a vLLM és a TensorRT-LLM, jelentős kódmódosítások nélkül. Ez lehetővé teszi a fejlesztők számára, hogy a DFlash-t a saját kiszolgáló infrastruktúrájukba építsék be.

Kapcsolódó: MiniMax M3 modell

A DFlash a Hugging Face-en keresztül elérhetővé vált a Blackwell és Hopper architektúrákhoz, beleértve olyan modellcsaládokat, mint a Qwen, Kimi K2.6, Llama, Gemma és gpt-oss. Az NVIDIA ökoszisztémája biztosítja a zökkenőmentes integrációt, így a fejlesztők gyorsan kihasználhatják az új technológia előnyeit.

Kapcsolódó: Google Gemma 4 sebességnövekedése

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom