Új Gemma 4 modellek kevesebb memóriát használnak minőségromlás nélkül
A Google új Gemma 4 modelljei 2024-ben jelentek meg, és a fejlesztésnek köszönhetően akár 50%-kal kevesebb memóriát is igényelhetnek.

A Google bemutatta a Gemma 4 modelljeinek új verzióit, amelyek kvantizációs tudatossággal (Quantization-Aware Training, QAT) készülnek. Ez a fejlesztés lehetővé teszi, hogy a modellek kevesebb memóriát használjanak, miközben megőrzik magas minőségű teljesítményüket.
A kvantizációs tudatosság azt jelenti, hogy a súlyok kvantizációját már a betanítási folyamat során figyelembe veszik. Ezáltal a Q4-es futtatás nem jár olyan jelentős minőségromlással, mint egy hagyományos, bf16-tal betanított modell esetében.
Kapcsolódó: Gemma 4 VLA
A Google AI for Developers szerint ezek a modellek ideálisak olyan telepítésekhez, amelyek maximális hatékonyságot igényelnek minimális minőségkompromisszummal. A Reddit LocalLLaMA közösségében felmerült, hogy ez a technika lényegesen csökkenti az on-device memóriahasználatot.
Kapcsolódó: H2O.ai modell