ÉlőUtoljára: 4 órájaMa: 2
Modellek & LLMfrissítve: 18:30

Jelentősen növeli a kontextus ablak méretét a Qwen3.6 27B modell a KV cache RAM-ba mentésével

Egy felhasználó tapasztalatai szerint a Qwen3.6 27B modell 16 GB VRAM-mal és 32 GB DDR5 RAM-mal futtatva a KV cache RAM-ba mentésével jelentősen növelhető a kontextus ablak mérete. A sebességcsökkenés minimális, 14 tps érhető el.

Jelentősen növeli a kontextus ablak méretét a Qwen3.6 27B modell a KV cache RAM-ba mentésével
Fotó: Bartosz Kwitkowski / Unsplash
forrás: Reddit LocalLLaMA·AI Forradalom szerk.·
Megosztás

A llama.cpp `-nkvo` (--no-kv-offload) opciója lehetővé teszi a KV cache RAM-ba való mentését a VRAM helyett. Sokan kerülik ezt a módszert a teljesítményromlás miatt, ám bizonyos esetekben megérheti a kompromisszumot kötni.

A Qwen3.6 27B modell (IQ4_XS) 16 GB VRAM-mal és 32 GB DDR5 RAM-mal futtatva a KV cache RAM-ba mentésével jelentősen növelhető a kontextus ablak mérete. A 65k kontextus eléréséhez a KV cache q4_0 kvantálása és 58 réteg GPU-n tartása szükséges, ami 16-23 tps sebességet eredményezett.

Kapcsolódó: Llama.cpp fejlesztés

RAM-ba offloadolva is használható a KV cache

A `-nkvo` opció használatával a teljes modell elfér a GPU-n, alapértelmezett f16 kvantálással a KV cache számára. A sebesség ugyan 19 tps-re csökkent csúcsidőben, és 14 tps-re hosszú generálás során, de ez elfogadható ár a megnövelt kontextusért — írja a Reddit LocalLLaMA felhasználója.

Kapcsolódó: TurboQuant modell

128k kontextus ablak 14 tps sebességgel

Az érdekes fejlemény, hogy a kontextus ablak akár 128k-ra is duplázható, miközben 63 réteg marad a GPU-n. Ez a módszer lehetővé teszi a nagyobb kontextusablakok kezelését, ami bizonyos feladatoknál, mint például hosszabb dokumentumok elemzése vagy összetett kódgenerálás, kulcsfontosságú lehet. A Qwen3.6 modell 14 tps sebességet ért el a 128k kontextus ablak használata során.

Kapcsolódó: Raspberry Pi 5

Forrás

Feldolgozott sajtóforrás·Reddit LocalLLaMA

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom