60-85%-os gyorsulást ígér a DeepSeek DSpark kerete
A DeepSeek DSpark keretrendszere 60-85%-kal gyorsítja a DeepSeek-V4 modell per-felhasználó generálását, miközben 26-31%-kal növeli az elfogadott tokenek hosszát.

A DeepSeek megnyitotta a DSpark keretrendszer forráskódját és előre betanított modelljeit. A DSpark egy spekulatív dekódolási technika, amely nem új modell, hanem a meglévő nagy nyelvi modellek (LLM) kiszolgálási sebességét optimalizálja. A DeepSeek-V4-Pro-DSpark és DeepSeek-V4-Flash-DSpark ellenőrzőpontok az eredeti V4 súlyokat használják, kiegészítve egy draft modullal. A kutatók emellett publikálták a DeepSpec nevű, MIT-licencelt kódbázist is, amely a spekulatív dekódoláshoz szükséges drafterek betanítására és kiértékelésére szolgál. A fejlesztés célja a nagy modellek inference-sebességének növelése zsúfolt termelési környezetben.
A DSpark egy párhuzamos draft hátteret és egy kis méretű, szekvenciális fejet kombinál, hogy csökkentse a szuffixumok bomlási sebességét. Egy confidence fej és egy terhelésfüggő ütemező több tokent ellenőriz, amikor a GPU-k kihasználatlanok, és kevesebbet, amikor elfoglaltak. Offline tesztek alapján az elfogadott tokenek hossza 26–31%-kal nőtt az Eagle3, illetve 16–18%-kal a DFlash rendszerekhez képest. A DeepSeek-V4 modellen végzett éles tesztek szerint a per-felhasználó generálás 60–85%-kal gyorsabb, mint a MTP-1 alapmodell. A kimenet minősége változatlan marad, és a DeepSeek-V4 ellenőrzőpontok, valamint a DeepSpec betanítási kód nyílt forráskódú.
Kapcsolódó: DeepSeek V3.2 teljesítményjavulás
Mi az a DSpark?
A spekulatív dekódolás két szerepre bontja a generálási folyamatot. Egy kisebb draft modell javasol egy tokentömböt, amelyet a teljes célmodell egyetlen előrehaladási (forward pass) lépésben ellenőriz. A rejection sampling elfogadja a leghosszabb érvényes előtagot, és hozzáad egy bónusz tokent. Mivel a szabály pontosan megőrzi a céleloszlást, nincs minőségvesztés. A DSpark ezt a garanciát tartja fenn, miközben megváltoztatja a tokenek draftolásának és ellenőrzésének módját.
Kapcsolódó: DeepSeek V4 Flash llama.cpp
A sebességoptimalizálás matematikai alapjai
A tokonkénti késleltetés (latency) egy egyenlet szerint alakul: L = (T draft + T verify ) / τ. Itt τ az elfogadott tokenek száma ciklusonként. A sebességnövekedés három tényezőn keresztül érhető el: gyorsabb draftolással (T draft csökkentése), jobb draftolással (τ növelése), vagy okosabb ellenőrzéssel (felesleges T verify csökkentése). A DSpark mindhárom tényezőt egyszerre használja ki.
Kapcsolódó: DeepSeek V4 Huawei optimalizálás
Hogyan működik: Félig-autoregresszív generálás
A korábbi draftolási módszerek kompromisszumot kényszerítettek ki. Az autoregresszív draftolók, mint az Eagle3, minden tokent az előzőkre alapoznak, ami erős elfogadást eredményez, de a draftolási költség a blokkmérettel nő. A párhuzamos draftolók, mint a DFlash, egyetlen lépésben állítják elő a teljes blokkot, így a draftolás olcsó marad, de az elfogadási arány gyorsan csökken a szuffixumban. A DSpark két szakaszra bontja a draftolást: egy párhuzamos hátteret (DFlash) használ az alap logitok előállítására, majd egy kis méretű, szekvenciális fejet, amely egy előtag-függő bias-t ad hozzá minden token mintavétele előtt. Az alapértelmezett fej egy Markov-fej, amely csak az előző tokent veszi figyelembe, és alacsony rangú faktorizálással (rank 256) tartja olcsón. A célmodell embedding és kimeneti feje változatlan marad, míg a total-variation loss maximalizálja a draft elfogadási arányát.
Hogyan működik: Confidence-Scheduled Verification
A több draftolt token nem mindig jelent nagyobb sebességet, mivel a feleslegesen ellenőrzött tokenek pazarlják a kapacitást. A DSpark erre két újítással reagál: egy confidence fejjel, amely megbecsüli az elfogadás esélyét, és egy hardver-specifikus ütemezővel, amely a GPU kihasználtságához igazítja az ellenőrzések számát. A confidence fej pontosságát Sequential Temperature skálázás technika javítja, a scheduler pedig a GPU-k kihasználtságához igazítja az ellenőrzések számát, hogy elkerülje a túlterhelést és a minőségromlást.
Kapcsolódó: Diffusion LLM válaszgyorsítás
Teljesítménytesztek és eredmények
Offline tesztek matematikai, kódolási és általános csevegési területeken zajlottak, többek között Qwen3-4B, 8B, 14B és Gemma4-12B modellekkel. A DSpark minden tartományban felülmúlja az Eagle3-at és a DFlash-t az elfogadott tokenek hosszában. A DeepSeek-V4-Flash és V4-Pro éles tesztjei 60–85%-os sebességnövekedést mutattak a MTP-1 alapmodellhez képest. A DSpark-5 konfiguráció, egy öttokonos draft blokkal és Markov fejjel, jelentős gyorsulást eredményezett.
Kapcsolódó: GPT-OSS Google Colab futtatás
Felhasználási esetek és kipróbálás
A DSpark különösen a kódgenerálásban és a hosszú, lépésről-lépésre történő matematikai érvelésben mutatkozik hatékonynak. A chat-alkalmazásokban a confidence fejjel a konfidencia-küszöb emelésével 45,7%-ról 95,7%-ra nőtt az elfogadási arány. A DeepSpec betanítási folyamata három lépésből áll: adat-előkészítés, betanítás és kiértékelés. A kód a Hugging Face-en érhető el, és nem igényel a célmodell újratanítását.