ÉlőUtoljára: 1 órájaMa: 1
Kutatásfrissítve: 09:30

A Huawei KVarN technológiája forradalmasítja az AI-modellek teljesítményét

A technológia nemcsak a kontextus méretét növeli, hanem a válaszidőt is csökkenti, így az AI-modellek gyorsabban és pontosabban dolgozhatnak

A Huawei KVarN technológiája forradalmasítja az AI-modellek teljesítményét
Fotó: Dmitry Rodionov / Unsplash
forrás: Reddit LocalLLaMA·AI Forradalom szerk.·
Megosztás

A Huawei KVarN nevű technológiája 3-5-szörösére növeli a KV cache méretét, ami több kontextust tesz lehetővé az AI-modellek számára. A kvantálási eljárás ígéretes teljesítményt mutat, miközben megőrzi a FP16-szintű pontosságot.

Gyorsabb válaszok és több kontextus

A KVarN egy natív vLLM KV-cache kvantálási backend, amelyet ügynökök számára terveztek. A technológia célja, hogy növelje a feldolgozható kontextus hosszát és javítsa a válaszadás sebességét, miközben a pontosság nem szenved csorbát.

Kapcsolódó: memóriaigény csökkentése

Kvantálás a helyi modelleknek

A Kvantálási módszer külön kezeli a K és V cache-t, ami jelentős előnyökkel járhat a kódolási, csevegési és RAG-feladatoknál, különösen korlátozott VRAM esetén. A KVarN kalibrációmentes és egyetlen kapcsolóval aktiválható.

Kapcsolódó: TurboQuant technika

Ígéretes eredmények a benchmarkokon

Egy Reddit felhasználó a llama.cpp egy forkjában implementálta a KVarN-t, és KLD benchmarkokat futtatott. Az eredmények biztatóak, bár a pontos teljesítménybeli előnyök még további vizsgálatot igényelnek. A TurboQuant tesztjei szerint a Turbo3 a V cache-en 33 ponttal rontja a generációs trajektóriákat, a KVarN technológia pedig a Huawei által végzett tesztek során 3-5-szörös teljesítménynövekedést mutatott.

Kapcsolódó: KV cache tömörítés

Forrás

Feldolgozott sajtóforrás·Reddit LocalLLaMA

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom