Automatikus hibaelhárítás és jobb irányítás a Together AI új GPU-klaszter-frissítéseivel
A Together AI új funkciókkal javítja GPU-klasztereinek megbízhatóságát: passzív állapotellenőrzést és négyféle automatikus hibajavítást vezet be, órákról percekre csökkentve a hibaelhárítási időt.

A Together AI új funkciókkal teszi megbízhatóbbá és könnyebben irányíthatóvá a nagy léptékű AI-képzéshez és -inferenciához használt GPU-klasztereit. A fejlesztések két fő területre összpontosítanak: a platform egészségére és az operatív vezérlésre.
Hibák elkapása és javítása valós időben
A nagyméretű, többnapos képzési feladatoknál gyakori, hogy hardverhibák, Xid-hibák vagy termikus throttling lassítja a folyamatot, gyakran észrevétlenül. A korábbi aktív állapotellenőrzések mellett a platform mostantól passzív állapotellenőrzéseket is végez. Ezek folyamatosan figyelik a csomópontokat, naplókat és metrikákat futtatás közben, így szinte nulla többletterheléssel képesek észlelni a hibákat, mint például a GPU-k leválása, termikus problémák vagy Slurm-hibák.
Kapcsolódó: NVIDIA Slurm integráció
Az észleléshez párosítva érkezik az automatikus csomópontjavítás. A rendszer négyféle javítási javaslatot tesz: újraindítás (Reboot), újrakonfigurálás (Reprovision), átkapcsolás (Failover) és eltávolítás (Remove). A felhasználó végül dönt a javaslatokról, így biztosítva a kontrollt a folyamat felett, miközben a hibaelhárítási idő órákról percekre csökkenhet – állítja a Together AI.
Kapcsolódó: OpenAI MRC protokoll
Megbízhatóbb Slurm a Kubernetesen
A Slurm-on-Kubernetes (Slurm-on-K8s) 2.0-ás verziója alapjaiban újult meg. A rendszer önjavító worker daemonokat kapott, amelyek automatikusan újraindítják magukat, így a hosszú képzések is ellenállóbbak lesznek. Megszűnnek a zombi folyamatok és az elárvult processzek, a `sacct` történeti adatok pedig tartós tárolóba kerültek, így a pod-újraindítások nem törlik azokat. A felügyelt Slurm-fürtök esetében a migrálás ingyenesen, egy karbantartási ablakon keresztül lehetséges.
Kapcsolódó: F5 AI infrastruktúra
Operatív vezérlés és láthatóság
A növekvő klaszterekhez új funkciók érkeznek az operatív vezérléshez. A továbbfejlesztett klaszternézet (cluster details view) áttekintést nyújt a csomópontok állapotáról, kihasználtságáról és a közelmúltbeli eseményekről. Külső OIDC-támogatás és startup scriptek teszik lehetővé a csapatok számára a jobb hozzáférést és testreszabást, ahogy a szervezet növekszik.
Kapcsolódó: NVIDIA AI élettartam-kezelés
A Together AI új funkciókkal javítja GPU-klasztereinek megbízhatóságát: passzív állapotellenőrzést és négyféle automatikus hibajavítást vezet be, órákról percekre csökkentve a hibaelhárítási időt. A Slurm-on-K8s 2.0 verziója önjavító worker daemonokat kapott, a `sacct` történeti adatok pedig tartós tárolóba kerültek.
Kapcsolódó: Nvidia Mission Control