ÉlőUtoljára: 3 órájaMa: 1
Hardver & Infrafrissítve: 03:45

NVIDIA új módszere csökkenti a GPU-kiesés hatását LLM-tréningeknél

Az NVIDIA új Nonuniform Tensor Parallelism (NTP) eljárása dinamikusan alkalmazkodik a GPU-kiesésekhez, így csökkenti az LLM-tréningek leállásait és növeli a hatékonyságot.

NVIDIA új módszere csökkenti a GPU-kiesés hatását LLM-tréningeknél
Fotó: Brecht Corbeel / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Az LLM-modellek hatalmas méretű betanítása egyre nagyobb kihívást jelent az infrastruktúra szempontjából, különösen, ha több ezer GPU-n futnak hosszabb ideig. Az ilyen feladatoknál még az alkalmi eszközleállások is jelentős lassulást okozhatnak. A NTP célja, hogy a kieső erőforrások ellenére is fenntartsa a betanítási folyamat sebességét, a Goodputot, ami a hasznos, konvergenciát segítő munka mértéke.

Hogyan működik a NTP?

A NTP lényege, hogy a kieső GPU-k esetén automatikusan átkonfigurálja a tensor parallelizmust (TP). Ha például egy nyolc GPU-s csoportból egy kiesik, a rendszer dinamikusan átáll hét GPU-s működésre. A megmaradó GPU-k növelik az egyedi munkaterhelésüket, így a betanítási feladat továbbra is magas Goodputot tud fenntartani.

Kapcsolódó: Decoupled DiLoCo

A kieső GPU-k teljesítményét dinamikus teljesítménynöveléssel (dynamic power boosting) kompenzálják. A kiesés miatt csökkentett TP-fokozatú replikák felzárkózását az érintett GPU-k megnövelt órajellel és számítási teljesítménnyel segítik. Ez megakadályozza a globális szinkronizációs problémákat, és biztosítja, hogy a rendszer Goodputja optimalizált maradjon.

Kapcsolódó: Unsloth és NVIDIA fejlesztése

Hatékony erőforrás-kihasználás

A NTP hatékony, átfedő tensor-resharding technikákat alkalmaz, amelyek a bevezetett többletterhelést kevesebb mint 1%-ra korlátozzák. Ez megőrzi a számítási hatékonyságot, és lehetővé teszi a rugalmas működést akár 72 GPU-s rendszereken is, amelyeket NVIDIA NVLink-kapcsolatok kötnek össze NVIDIA Blackwell és Blackwell Ultra platformokon.

Kapcsolódó: TwELL CUDA-kernel

Az eljárás a tranziens hardverhibákat kezelhetővé és helyrehozhatóvá teszi, így a kiesések nem okoznak drasztikus lassulást a betanítási folyamatban. Az NVIDIA szerint ez a technika kulcsfontosságú lehet a jövőbeli, nagyméretű LLM-modellek hatékony betanításához.

Kapcsolódó: NVIDIA NVFP4 formátum

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom