Jelentősen növeli a kontextus ablak méretét a Qwen3.6 27B modell a KV cache RAM-ba mentésével
Egy felhasználó tapasztalatai szerint a Qwen3.6 27B modell 16 GB VRAM-mal és 32 GB DDR5 RAM-mal futtatva a KV cache RAM-ba mentésével jelentősen növelhető a kontextus ablak mérete. A sebességcsökkenés minimális, 14 tps érhető el.

A llama.cpp `-nkvo` (--no-kv-offload) opciója lehetővé teszi a KV cache RAM-ba való mentését a VRAM helyett. Sokan kerülik ezt a módszert a teljesítményromlás miatt, ám bizonyos esetekben megérheti a kompromisszumot kötni.
A Qwen3.6 27B modell (IQ4_XS) 16 GB VRAM-mal és 32 GB DDR5 RAM-mal futtatva a KV cache RAM-ba mentésével jelentősen növelhető a kontextus ablak mérete. A 65k kontextus eléréséhez a KV cache q4_0 kvantálása és 58 réteg GPU-n tartása szükséges, ami 16-23 tps sebességet eredményezett.
Kapcsolódó: Llama.cpp fejlesztés
RAM-ba offloadolva is használható a KV cache
A `-nkvo` opció használatával a teljes modell elfér a GPU-n, alapértelmezett f16 kvantálással a KV cache számára. A sebesség ugyan 19 tps-re csökkent csúcsidőben, és 14 tps-re hosszú generálás során, de ez elfogadható ár a megnövelt kontextusért — írja a Reddit LocalLLaMA felhasználója.
Kapcsolódó: TurboQuant modell
128k kontextus ablak 14 tps sebességgel
Az érdekes fejlemény, hogy a kontextus ablak akár 128k-ra is duplázható, miközben 63 réteg marad a GPU-n. Ez a módszer lehetővé teszi a nagyobb kontextusablakok kezelését, ami bizonyos feladatoknál, mint például hosszabb dokumentumok elemzése vagy összetett kódgenerálás, kulcsfontosságú lehet. A Qwen3.6 modell 14 tps sebességet ért el a 128k kontextus ablak használata során.
Kapcsolódó: Raspberry Pi 5