ÉlőUtoljára: 13 perceMa: 10
Kutatásfrissítve: 06:50

Muon optimalizáló: Új törvényszerűségek a nagy nyelvi modellek betanításában

A momentum mátrixok szingularitás spektruma kiszámíthatóan változik a modellmérettel. A Muon optimalizáló algoritmusban a szingularitás spektrum változása fontos szerepet játszik a nagy nyelvi modellek betanításában.

Muon optimalizáló: Új törvényszerűségek a nagy nyelvi modellek betanításában
Fotó: Barez Omer / Unsplash
forrás: ArXiv ML·AI Forradalom szerk.·
Megosztás

A Muon, egy új optimalizáló algoritmus, amely a nagy nyelvi modellek (LLM) betanításában vált népszerűvé, a Newton--Schulz (NS) iterációt használja az ortogonalizációhoz. Azonban a NS csak közelítő, így a kis szingularitású irányok nem lesznek tökéletesen ortogonálisak. Az arXiv-on megjelent tanulmány elsőként vizsgálja szisztematikusan, hogyan viselkedik a momentum mátrixok szingularitás spektruma a betanítás során, és hogyan változik ez a modellmérettel.

A kutatók 77 millió és 2.8 milliárd paraméteres modelleket elemeztek. Megfigyelték, hogy a momentum puffer szingularitás kvantilisai a rétegekben egy rövid bemelegedési fázis után stabilizálódnak. Ezek a stabilizációs értékek a modellmérettel követnek tiszta hatványtörvényeket, amelyek rétegenként eltérő kitevővel rendelkeznek.

Kapcsolódó: látens spektrum

A modellméret hatása a rétegekre

A tanulmány szerint a közép-késői mélységű rétegek a modellmérettel (M) nagyon enyhén, körülbelül $M^{-0.25}$-es kitevővel skálázódnak. Ez azt jelenti, hogy a jelenleg elterjedt, 5-lépéses NS konfiguráció továbbra is hatékonyan ortogonalizálja őket nagyobb méreteknél is. Ez a felfedezés segít elkerülni a felesleges számítási kapacitást.

Kapcsolódó: Hebatron modell

A jövőbeli kihívások és megoldások

Néhány késői réteg azonban sokkal agresszívebben skálázódik, akár $M^{-0.96}$-ig. Ezek a rétegek a frontier méretnél már a NS hibás tartományába eshetnek, hacsak nem használnak több NS iterációt vagy jobban hangolt együtthatókat. A kutatók által feltárt törvényszerűségek lehetővé teszik a gyakorlati szakemberek számára, hogy rétegspecifikusan válasszák meg a minimális NS konfigurációt, amely még ortogonalizálja a fontos irányokat, így nem áldozzák fel a minőséget a sebességért. A kutatás eredményeit előnyomtatott formában tették közzé az arXiv-on.

Kapcsolódó: Szorzásmentes LLM

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom