ÉlőUtoljára: 6 órájaMa: 2
Kutatásfrissítve: 01:50

A KVarN metódus akár 3-5-ször több kontextust ígér az új tesztek szerint

A Qwen 3.6 27B modellhez új kvantálási teljesítménytesztek érkeztek. A tesztek a KVarN és Turbo/TCQ metódusokat is vizsgálják, ígéretes eredményekkel.

A KVarN metódus akár 3-5-ször több kontextust ígér az új tesztek szerint
Fotó: Rukma Pratista / Unsplash
forrás: Reddit LocalLLaMA·AI Forradalom szerk.·
Megosztás

A KVarN, egy natív vLLM KV-cache kvantálási backend, akár 3-5-ször több kontextust, FP16 feletti átvitelt és FP16-szintű pontosságot ígér. A kvantálás nélküli q8_0/q8_0 alapvonal is degradálódik nagyobb, 32B méretű modelleknél, ami a GTM (Go-to-Market) vakfoltját is megnöveli.

Kvantálási teljesítmény összehasonlítás

A korábbi, Qwen3-32B modellel végzett tesztek alapján a 32B méret drámaian felerősíti a trajektória-eltérést, 3-6-szor alacsonyabb pontszámokat produkálva, mint a 27B modell azonos kvantálás mellett. A tesztek arra is kitérnek, hogy a 262K kontextus nem használható ki teljesen a modellben.

Kapcsolódó: TurboQuant technika

Teszt eredmények és következtetések

A Qwen 3.6 27B modell tesztelése során az egyik legfontosabb megfigyelés az volt, hogy a 27B modell jobb teljesítményt nyújtott, mint a 32B modell, ami a modell fejlesztésében fontos szempont lehet. A tesztek a Qwen 3.6 27B modell és a KVarN metódus kombinációjának hatékonyságát is igazolták.

Kapcsolódó: TurboQuant korlátai

Forrás

Feldolgozott sajtóforrás·Reddit LocalLLaMA

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom