Memóriatakarékosabbá válik a nagy nyelvi modellek finomhangolása az AdaNAGED technika segítségével
Az AdaNAGED nevű új technika memóriatakarékosabbá teszi a nagy nyelvi modellek (LLM) finomhangolását, miközben a hagyományos módszereknél olcsóbb lehet a feladat-specifikus beállítás.

Az arXiv-on publikált kutatás egy új, AdaNAGED nevű módszert mutat be, amely a nagy nyelvi modellek (LLM) finomhangolásának memóriaigényét hivatott csökkenteni. A nulladik-rendű (ZO) optimalizálás memóriatakarékos alternatívát kínál a hagyományos visszaterjesztéses (backpropagation) módszerekkel szemben, amelyek jelentős memóriaterhelést okoznak a nagy adathalmazok feldolgozása során — írja az arXiv.
A memóriahatékonyság új dimenziója
A nagy nyelvi modellek betanítása hatalmas számítási kapacitást és memóriát igényel. A finomhangolás, amely során a modelleket specifikus feladatokra vagy adatokra igazítják, különösen memóriaintenzív lehet a visszaterjesztéses algoritmusok miatt. A nulladik-rendű optimalizálás előnye, hogy a gradiens becsléséhez elegendőek az előre irányuló számítások (forward passes), így elkerülhető a köztes aktivációk és gradiensállapotok tárolása.
Kapcsolódó: LLM-ek mérete
Paramétermentes adaptáció és geometriai szempontok
Az AdaNAGED módszer a paramétermentes (PF) adaptációt is egyesíti, ami azt jelenti, hogy az algoritmus paraméterei előzetes feladat-specifikus ismeretek nélkül, automatikusan alkalmazkodnak. Ez csökkenti a finomhangolás költségeit és idejét. A kutatás továbbá kihasználja a lineáris minimalizáló őr (LMO) alapú módszereket, amelyek figyelembe veszik a modell paraméterblokkjainak heterogén szerkezetét, és geometriailag tudatos frissítéseket tesznek lehetővé.
Kapcsolódó: LLM-optimalizálás
Eredmények az OPT-1.3B modellen
A kutatók a konvergenciagarantákat is megállapították az AdaNAGED módszerre. A technika hatékonyságát nagyméretű LLM-finomhangolási feladatokon tesztelték az OPT-1.3B modell segítségével. Az eredmények azt mutatják, hogy az új megközelítés ígéretes alternatívát jelenthet a memóriahatékony és költséghatékony LLM-fejlesztésben.
Kapcsolódó: GPT-4 toxicitása
A teljesítményérzékenység és a jövőbeli kutatások
Fontos megjegyezni, hogy a nulladik-rendű optimalizálási módszerek teljesítménye rendkívül érzékeny lehet a lépésméretre és a simítási paraméterre. Az arXiv:2606.14970v1 publikációban a kutatók további vizsgálatokat terveznek a módszer finomhangolására és skálázhatóságának elemzésére.
Kapcsolódó: LLM-koordináció
Az AdaNAGED módszerrel végzett kísérletek az OPT-1.3B modellen 2026-ban folytatódtak.
Kapcsolódó: LLM-általánosítás