Új módszerrel 85%-kal csökkenthető a nyelvi modellek memóriahasználata
A WikiText adathalmazon a módszer akár 21%-kal csökkentette a perplexitást, a memóriahasználatot pedig 85%-kal lehet vele csökkenteni.

Új, end-to-end keretrendszert dolgoztak ki a kutatók a nagy nyelvi modellek (LLM) hatékonyabb telepítésére. A módszer a strukturális metszést és a vegyes-precíziós kvantálást ötvözi, hogy csökkentse a modell memórialábnyomát és gyorsítsa az inferenciát.
A korábbi eljárások gyakran rétegenként optimalizálták a kvantálási hibákat, figyelmen kívül hagyva azok globális terjedését. Az új keretrendszer ezt kiküszöböli azáltal, hogy a hibákat az egész modellen keresztül minimalizálja, nem csupán lokálisan.
Kapcsolódó: LLM-elfogultság növekedése
Ultra-alacsony bitmélységű kvantálás
A kutatók által kifejlesztett új, egyidejű optimalizálási megközelítés a strukturális metszési döntéseket és a vegyes-precíziós kvantálási szabályokat egységes keresési térben tanulja meg. Ez a módszer különösen hatékonynak bizonyul ultra-alacsony, 1-3 bites precizitás mellett.
Kapcsolódó: LLM-méret csökkentése
Rekordteljesítmény a perplexitás csökkentésében
Kiterjedt kísérletek igazolják az új eljárás fölényét. A WikiText adathalmazon a módszer akár 21%-kal csökkentette a perplexitást a legfejlettebb súly-aktiváció kvantálási alapvonalakhoz képest. Súly-alapú kvantálási módszerekkel szemben 59%-kal, illetve 85%-kal alacsonyabb perplexitást ért el WikiTexten és C4-en.
Kapcsolódó: LLM-bizonytalanság
A kutatás eredményei az arXiv-on érhetők el, ahol a legfrissebb publikációk között szerepel.
Kapcsolódó: LLM-általánosítás