ÉlőUtoljára: 1 órájaMa: 1
Hardver & Infrafrissítve: 04:15

Automatikus hibaelhárítás és jobb irányítás a Together AI új GPU-klaszter-frissítéseivel

A Together AI új funkciókkal javítja GPU-klasztereinek megbízhatóságát: passzív állapotellenőrzést és négyféle automatikus hibajavítást vezet be, órákról percekre csökkentve a hibaelhárítási időt.

Automatikus hibaelhárítás és jobb irányítás a Together AI új GPU-klaszter-frissítéseivel
Fotó: Dimitris Chapsoulas / Unsplash
forrás: Hetzner: Together AI·AI Forradalom szerk.·
Megosztás

A Together AI új funkciókkal teszi megbízhatóbbá és könnyebben irányíthatóvá a nagy léptékű AI-képzéshez és -inferenciához használt GPU-klasztereit. A fejlesztések két fő területre összpontosítanak: a platform egészségére és az operatív vezérlésre.

Hibák elkapása és javítása valós időben

A nagyméretű, többnapos képzési feladatoknál gyakori, hogy hardverhibák, Xid-hibák vagy termikus throttling lassítja a folyamatot, gyakran észrevétlenül. A korábbi aktív állapotellenőrzések mellett a platform mostantól passzív állapotellenőrzéseket is végez. Ezek folyamatosan figyelik a csomópontokat, naplókat és metrikákat futtatás közben, így szinte nulla többletterheléssel képesek észlelni a hibákat, mint például a GPU-k leválása, termikus problémák vagy Slurm-hibák.

Kapcsolódó: NVIDIA Slurm integráció

Az észleléshez párosítva érkezik az automatikus csomópontjavítás. A rendszer négyféle javítási javaslatot tesz: újraindítás (Reboot), újrakonfigurálás (Reprovision), átkapcsolás (Failover) és eltávolítás (Remove). A felhasználó végül dönt a javaslatokról, így biztosítva a kontrollt a folyamat felett, miközben a hibaelhárítási idő órákról percekre csökkenhet – állítja a Together AI.

Kapcsolódó: OpenAI MRC protokoll

Megbízhatóbb Slurm a Kubernetesen

A Slurm-on-Kubernetes (Slurm-on-K8s) 2.0-ás verziója alapjaiban újult meg. A rendszer önjavító worker daemonokat kapott, amelyek automatikusan újraindítják magukat, így a hosszú képzések is ellenállóbbak lesznek. Megszűnnek a zombi folyamatok és az elárvult processzek, a `sacct` történeti adatok pedig tartós tárolóba kerültek, így a pod-újraindítások nem törlik azokat. A felügyelt Slurm-fürtök esetében a migrálás ingyenesen, egy karbantartási ablakon keresztül lehetséges.

Kapcsolódó: F5 AI infrastruktúra

Operatív vezérlés és láthatóság

A növekvő klaszterekhez új funkciók érkeznek az operatív vezérléshez. A továbbfejlesztett klaszternézet (cluster details view) áttekintést nyújt a csomópontok állapotáról, kihasználtságáról és a közelmúltbeli eseményekről. Külső OIDC-támogatás és startup scriptek teszik lehetővé a csapatok számára a jobb hozzáférést és testreszabást, ahogy a szervezet növekszik.

Kapcsolódó: NVIDIA AI élettartam-kezelés

A Together AI új funkciókkal javítja GPU-klasztereinek megbízhatóságát: passzív állapotellenőrzést és négyféle automatikus hibajavítást vezet be, órákról percekre csökkentve a hibaelhárítási időt. A Slurm-on-K8s 2.0 verziója önjavító worker daemonokat kapott, a `sacct` történeti adatok pedig tartós tárolóba kerültek.

Kapcsolódó: Nvidia Mission Control

Forrás

Feldolgozott sajtóforrás·Hetzner: Together AI

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom