ÉlőUtoljára: 1 órájaMa: 9
Eszközökfrissítve: 10:30

Prime Intellect új rendszerrel gyorsítja a trillióparaméteres modellek betanítását

A Prime Intellect prime-rl 0.6.0 keretrendszere lehetővé teszi trillióparaméteres MoE modellek betanítását, miközben a lépésidő 5 perc alatt marad, mindössze 28 NVIDIA H200 node-ot használva.

Prime Intellect új rendszerrel gyorsítja a trillióparaméteres modellek betanítását
Fotó: Florian Olivo / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

A Prime Intellect kiadta a prime-rl keretrendszer 0.6.0 verzióját, amely kifejezetten a trillióparaméteres Mixture-of-Experts (MoE) modellek aszinkron megerősítéses tanulási (RL) feladatainak betanítására fókuszál. Az újítás különösen a hosszú távú, összetett feladatokat igénylő agentic workloadok, mint például a szoftverfejlesztési (SWE) feladatok esetében jelentős előrelépést.

A kutatócsapat a GLM-5 modellt 131 ezer token hosszúságú SWE feladatokon tesztelte. A tesztek során a lépésidő (step time) öt perc alatt maradt, miközben a batch mérete 256 bevezetés volt, mindössze 28 NVIDIA H200 node-ot igénybe véve. Ez az eredmény jelentősen csökkenti a korábban szükséges számítási kapacitást.

Kapcsolódó: MoE-gyorsítótár fejlesztése

Az aszinkron RL megközelítés lehetővé teszi az edző (trainer) és az inferencia (inference) rendszerek független optimalizálását. Mivel az agentic feladatok gyakran tartalmaznak hosszú futásidejű, váratlan kiugrásokat (outlier), a hagyományos szinkron megközelítés jelentős GPU-időzést okozna. Az aszinkron RL megoldja ezt azzal, hogy az edző és az inferencia külön fut, és csak a policy frissítésekor szinkronizálnak.

Kapcsolódó: MoE LLM következtetés

Inferencia-optimalizálások

A prime-rl 0.6.0 számos optimalizálást tartalmaz az inferencia sebességének növelésére, miközben a válaszidőt elfogadható szinten tartja. Ezek közé tartozik az FP8 precizitás használata a gyorsabb prefill és decode műveletekhez, a Széles Szakértői Párhuzamosság (Wide Expert Parallelism, ≥32 GPU), a prefill és decode szétválasztása, a KV-cache leterhelése (CPU-ra és tárolóra), valamint a fejlett útválasztási (routing) mechanizmusok, mint a router replay (R3), amely jelentősen csökkenti az edző és az inferencia közötti KL-eltérést.

Kapcsolódó: GLM-5.1 kódolóképessége

Betanítási optimalizálások

A keretrendszer a torchtitanra épül, amely egy PyTorch-alapú betanítási kódbázis. Háromdimenziós párhuzamosságot (FSDP, EP, CP) használ, kiegészítve blokk-skálázott FP8 betanítással. Ez a megközelítés, különösen az Expert Parallelism és a Context Parallelism, lehetővé teszi a hatalmas, 131 ezer token hosszúságú szekvenciák hatékony feldolgozását. A GLM-5 esettanulmányban a 3D párhuzamosság és az FP8 használata stabilizálta a tréninget és csökkentette a KL-eltérést.

Kapcsolódó: VLM-ügynökök gyorsítása

A prime-rl 0.6.0 a GLM-5.1 mellett más nagy MoE modellekkel is kompatibilis, mint például a moonshotai/Kimi-K2.7-Code és a nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16. A keretrendszer a Prime Intellect blogbejegyzése szerint a szoftverfejlesztési feladatok mellett más hosszú távú agentic feladatoknál is hasznos lehet, ahol a modelleknek több száz lépésen át kell megőrizniük a kontextust.

Kapcsolódó: LFM2.5-350M tanulási méret

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom