Új módszerrel csökkentik a nagy nyelvi modellek kvantálási hibáit
Kutatók kidolgoztak egy új, kétfázisú módszert, a FAIR-Calib-ot, amely csökkenti a Diffusion LLM-ek kvantálási hibáit. Ez a módszer jobb eredményeket hoz, mint a jelenlegi csúcsteljesítményű megoldások.

Új kvantálási módszert dolgoztak ki a nagy nyelvi modellek (LLM) hatékonyabb futtatásához. A Diffusion LLM-ek (dLLM) iteratív token-finomítást végeznek, de ezek a döntések véglegesek, ami „stabilitási lemaradást” okoz. A Post-Training Quantization (PTQ) hibái könnyen megváltoztathatják ezeket a határon lévő döntéseket, rögzítve és felerősítve a hibákat.
A probléma orvoslására a kutatók bemutatták a Frontier-Aware Instability-Reweighted Calibration (FAIR-Calib) nevű, kétfázisú PTQ keretrendszert dLLM-ekhez. Az első szakaszban egy teljes pontosságú tanár modellt vizsgálnak, hogy megbecsüljék a pozíciós előzményeket, amelyek ötvözik a határfelületi találatokat és a maszkolt szakasz megbízhatóságát. A második szakaszban réteg-alapú kalibrációt végeznek, minimalizálva a súlyozott rejtett-állapotú MSE-t, így prioritást élvez a törékeny határállapotok védelme anélkül, hogy költséges diffúziós visszatekerésre lenne szükség.
Kapcsolódó: LLM-ek elfogultsága
Az új módszer elméletileg is alátámasztja a súlyozott célfüggvényt, mint a kimeneti KL-divergencia helyettesítőjét. Az arXiv kutatói által leírt FAIR-Calib következetesen felülmúlja a jelenlegi csúcsteljesítményű alapmodelleket a LLaDA és a Dream (W4A4) benchmarkokon. Ez jelentősen csökkenti a határfelületi döntések megváltozását és elnyomja a rögzítés utáni eltéréseket.
Kapcsolódó: Diffúziós nyelvi modellek
A FAIR-Calib keretrendszer célja, hogy a kvantálás során keletkező hibákat minimalizálja, különös tekintettel a diffúziós modellek sajátosságaira. A módszer két fő lépésben, a tanítás és a kalibráció során igyekszik stabilabbá tenni a modellek működését.
Kapcsolódó: GPT-modellek fejlesztése
A kutatás eredményeit előnyomtatott formában tették közzé az arXiv-on. A FAIR-Calib a LLaDA és a Dream (W4A4) modelleken végzett tesztek alapján ígéretesnek bizonyult, jelentősen javítva a korábbi kvantálási technikákhoz képest.
Kapcsolódó: Nyelvmodellezési áttörés