NVIDIA új módszere csökkenti a GPU-kiesés hatását LLM-tréningeknél
Az NVIDIA új Nonuniform Tensor Parallelism (NTP) eljárása dinamikusan alkalmazkodik a GPU-kiesésekhez, így csökkenti az LLM-tréningek leállásait és növeli a hatékonyságot.

Az LLM-modellek hatalmas méretű betanítása egyre nagyobb kihívást jelent az infrastruktúra szempontjából, különösen, ha több ezer GPU-n futnak hosszabb ideig. Az ilyen feladatoknál még az alkalmi eszközleállások is jelentős lassulást okozhatnak. A NTP célja, hogy a kieső erőforrások ellenére is fenntartsa a betanítási folyamat sebességét, a Goodputot, ami a hasznos, konvergenciát segítő munka mértéke.
Hogyan működik a NTP?
A NTP lényege, hogy a kieső GPU-k esetén automatikusan átkonfigurálja a tensor parallelizmust (TP). Ha például egy nyolc GPU-s csoportból egy kiesik, a rendszer dinamikusan átáll hét GPU-s működésre. A megmaradó GPU-k növelik az egyedi munkaterhelésüket, így a betanítási feladat továbbra is magas Goodputot tud fenntartani.
Kapcsolódó: Decoupled DiLoCo
A kieső GPU-k teljesítményét dinamikus teljesítménynöveléssel (dynamic power boosting) kompenzálják. A kiesés miatt csökkentett TP-fokozatú replikák felzárkózását az érintett GPU-k megnövelt órajellel és számítási teljesítménnyel segítik. Ez megakadályozza a globális szinkronizációs problémákat, és biztosítja, hogy a rendszer Goodputja optimalizált maradjon.
Kapcsolódó: Unsloth és NVIDIA fejlesztése
Hatékony erőforrás-kihasználás
A NTP hatékony, átfedő tensor-resharding technikákat alkalmaz, amelyek a bevezetett többletterhelést kevesebb mint 1%-ra korlátozzák. Ez megőrzi a számítási hatékonyságot, és lehetővé teszi a rugalmas működést akár 72 GPU-s rendszereken is, amelyeket NVIDIA NVLink-kapcsolatok kötnek össze NVIDIA Blackwell és Blackwell Ultra platformokon.
Kapcsolódó: TwELL CUDA-kernel
Az eljárás a tranziens hardverhibákat kezelhetővé és helyrehozhatóvá teszi, így a kiesések nem okoznak drasztikus lassulást a betanítási folyamatban. Az NVIDIA szerint ez a technika kulcsfontosságú lehet a jövőbeli, nagyméretű LLM-modellek hatékony betanításához.
Kapcsolódó: NVIDIA NVFP4 formátum