A Grok mostantól 39-249-szor jobb a súlynorma-vágásban
Az xAI modellje hatékonyabban képes kezelni a matematikai feladatokat, például a moduláris aritmetikát és a vegyes műveleteket.

A Grok modell frissítésében a kutatók a Clip to Grok nevű eljárással növelték a súlynorma‑vágás hatékonyságát 39‑249‑szorosra. A módosítás hat feladatra lett tesztelve: moduláris aritmetika, vegyes műveletek, S5 permutáció és három további tesztre. Minden feladatra külön‑max_norm értéket mértek.
A súlynorma‑vágás a modell súlyainak nagyságát korlátozza, ezáltal csökkenti a túlzott tanulást és javítja a stabilitást. Matematikai feladatoknál ez kulcsfontosságú, mert a súlyok növekedése gyorsan felhalmozódó hibákat eredményezhet.
A technikai megoldásban a kutatók per‑task max_norm mérést vezettek be. A moduláris aritmetika és a vegyes műveletek esetében a szigorúbb vágás lehetővé tette a pontosabb eredményeket anélkül, hogy a modell kapacitása jelentősen csökkent volna. Az S5 permutáció feladat a sorozatkezelést teszteli, és a finomhangolt vágás szintén javította a teljesítményt.
Az új súlynorma‑vágás révén a Grok már most jobb matematikai következtetéseket ad, ami a fejlesztők számára fontos, ha általános célú LLM-et szeretnének használni számítási feladatokra. A fejlesztés azt mutatja, hogy a finomhangolás és a regulációs technikák egyre inkább meghatározzák a nagy nyelvi modellek gyakorlati használhatóságát.
A következő frissítésben a kutatók azt tervezzék, hogy a súlynorma‑vágást kiterjék további feladatokra, és nyilvánosan közzétegyék a teljesítmény‑ és latencia‑adatokat. Milyen hatással lesz ez a Grok valós idejű válaszidejére?