ÉlőUtoljára: 42 perceMa: 2
Modellek & LLMfrissítve: 20:10

60-85%-os gyorsulást ígér a DeepSeek DSpark kerete

A DeepSeek DSpark keretrendszere 60-85%-kal gyorsítja a DeepSeek-V4 modell per-felhasználó generálását, miközben 26-31%-kal növeli az elfogadott tokenek hosszát.

60-85%-os gyorsulást ígér a DeepSeek DSpark kerete
Fotó: Solen Feyissa / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A DeepSeek megnyitotta a DSpark keretrendszer forráskódját és előre betanított modelljeit. A DSpark egy spekulatív dekódolási technika, amely nem új modell, hanem a meglévő nagy nyelvi modellek (LLM) kiszolgálási sebességét optimalizálja. A DeepSeek-V4-Pro-DSpark és DeepSeek-V4-Flash-DSpark ellenőrzőpontok az eredeti V4 súlyokat használják, kiegészítve egy draft modullal. A kutatók emellett publikálták a DeepSpec nevű, MIT-licencelt kódbázist is, amely a spekulatív dekódoláshoz szükséges drafterek betanítására és kiértékelésére szolgál. A fejlesztés célja a nagy modellek inference-sebességének növelése zsúfolt termelési környezetben.

A DSpark egy párhuzamos draft hátteret és egy kis méretű, szekvenciális fejet kombinál, hogy csökkentse a szuffixumok bomlási sebességét. Egy confidence fej és egy terhelésfüggő ütemező több tokent ellenőriz, amikor a GPU-k kihasználatlanok, és kevesebbet, amikor elfoglaltak. Offline tesztek alapján az elfogadott tokenek hossza 26–31%-kal nőtt az Eagle3, illetve 16–18%-kal a DFlash rendszerekhez képest. A DeepSeek-V4 modellen végzett éles tesztek szerint a per-felhasználó generálás 60–85%-kal gyorsabb, mint a MTP-1 alapmodell. A kimenet minősége változatlan marad, és a DeepSeek-V4 ellenőrzőpontok, valamint a DeepSpec betanítási kód nyílt forráskódú.

Kapcsolódó: DeepSeek V3.2 teljesítményjavulás

Mi az a DSpark?

A spekulatív dekódolás két szerepre bontja a generálási folyamatot. Egy kisebb draft modell javasol egy tokentömböt, amelyet a teljes célmodell egyetlen előrehaladási (forward pass) lépésben ellenőriz. A rejection sampling elfogadja a leghosszabb érvényes előtagot, és hozzáad egy bónusz tokent. Mivel a szabály pontosan megőrzi a céleloszlást, nincs minőségvesztés. A DSpark ezt a garanciát tartja fenn, miközben megváltoztatja a tokenek draftolásának és ellenőrzésének módját.

Kapcsolódó: DeepSeek V4 Flash llama.cpp

A sebességoptimalizálás matematikai alapjai

A tokonkénti késleltetés (latency) egy egyenlet szerint alakul: L = (T draft + T verify ) / τ. Itt τ az elfogadott tokenek száma ciklusonként. A sebességnövekedés három tényezőn keresztül érhető el: gyorsabb draftolással (T draft csökkentése), jobb draftolással (τ növelése), vagy okosabb ellenőrzéssel (felesleges T verify csökkentése). A DSpark mindhárom tényezőt egyszerre használja ki.

Kapcsolódó: DeepSeek V4 Huawei optimalizálás

Hogyan működik: Félig-autoregresszív generálás

A korábbi draftolási módszerek kompromisszumot kényszerítettek ki. Az autoregresszív draftolók, mint az Eagle3, minden tokent az előzőkre alapoznak, ami erős elfogadást eredményez, de a draftolási költség a blokkmérettel nő. A párhuzamos draftolók, mint a DFlash, egyetlen lépésben állítják elő a teljes blokkot, így a draftolás olcsó marad, de az elfogadási arány gyorsan csökken a szuffixumban. A DSpark két szakaszra bontja a draftolást: egy párhuzamos hátteret (DFlash) használ az alap logitok előállítására, majd egy kis méretű, szekvenciális fejet, amely egy előtag-függő bias-t ad hozzá minden token mintavétele előtt. Az alapértelmezett fej egy Markov-fej, amely csak az előző tokent veszi figyelembe, és alacsony rangú faktorizálással (rank 256) tartja olcsón. A célmodell embedding és kimeneti feje változatlan marad, míg a total-variation loss maximalizálja a draft elfogadási arányát.

Hogyan működik: Confidence-Scheduled Verification

A több draftolt token nem mindig jelent nagyobb sebességet, mivel a feleslegesen ellenőrzött tokenek pazarlják a kapacitást. A DSpark erre két újítással reagál: egy confidence fejjel, amely megbecsüli az elfogadás esélyét, és egy hardver-specifikus ütemezővel, amely a GPU kihasználtságához igazítja az ellenőrzések számát. A confidence fej pontosságát Sequential Temperature skálázás technika javítja, a scheduler pedig a GPU-k kihasználtságához igazítja az ellenőrzések számát, hogy elkerülje a túlterhelést és a minőségromlást.

Kapcsolódó: Diffusion LLM válaszgyorsítás

Teljesítménytesztek és eredmények

Offline tesztek matematikai, kódolási és általános csevegési területeken zajlottak, többek között Qwen3-4B, 8B, 14B és Gemma4-12B modellekkel. A DSpark minden tartományban felülmúlja az Eagle3-at és a DFlash-t az elfogadott tokenek hosszában. A DeepSeek-V4-Flash és V4-Pro éles tesztjei 60–85%-os sebességnövekedést mutattak a MTP-1 alapmodellhez képest. A DSpark-5 konfiguráció, egy öttokonos draft blokkal és Markov fejjel, jelentős gyorsulást eredményezett.

Kapcsolódó: GPT-OSS Google Colab futtatás

Felhasználási esetek és kipróbálás

A DSpark különösen a kódgenerálásban és a hosszú, lépésről-lépésre történő matematikai érvelésben mutatkozik hatékonynak. A chat-alkalmazásokban a confidence fejjel a konfidencia-küszöb emelésével 45,7%-ról 95,7%-ra nőtt az elfogadási arány. A DeepSpec betanítási folyamata három lépésből áll: adat-előkészítés, betanítás és kiértékelés. A kód a Hugging Face-en érhető el, és nem igényel a célmodell újratanítását.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom