Ingyenes adattárolás a Hugging Face Hubon: SkyPilot-tal bárhol futtathat GPU-s feladatokat
Az új integráció révén az AI-modellek és adathalmazok a Hugging Face Hubon maradhatnak, míg a SkyPilot a compute-feladatokat (fejlesztés, képzés, kiszolgálás) bármelyik GPU-val rendelkező fürtön futtathatja.

A legtöbb csapat számára a modellek és adathalmazok egyetlen felhő egyetlen régiójában találhatóak. Azonban a GPU-k, legyen szó fejlesztésről, képzésről vagy kiszolgálásról, egyre gyakrabban ülnek egy másik felhőn, mint az adatok. Amint ez a kettő szétválik, keresztfelhő átviteli díjat kell fizetni csak azért, hogy saját adatainkat olvashassuk a saját GPU-inkra.
A Hugging Face-szel közösen összeillesztettük a két felet: a modellek és adathalmazok a Hubon maradnak, a SkyPilot pedig a compute-feladatokat futtatja bármelyik fürtön, amelyik rendelkezik GPU-val. Egy Hugging Face Bucket vagy bármely Hub repo csatolható egy SkyPilot feladathoz egyetlen hf:// URL-lel és a már meglévő HF_TOKEN-nal, majd indítható bárhol, ahol van kapacitás. A Hugging Face nem számít fel egress díjat, így az adatok olvasása a GPU-kra semmibe sem kerül, bármelyik felhőben is fut a feladat.
Kapcsolódó: AI-generált jegyzetek
Az új lehetőségek: Adatok bármely feladatban
A Hugging Face Hub adatai mostantól bármely SkyPilot feladatban elérhetőek. A store: hf parancs egy Hugging Face Bucketet (olvasás-írás) vagy bármely modell/adathalmaz/Space repót (csak olvasható) csatol be egy SkyPilot feladatba egy hf:// URL és a meglévő HF_TOKEN segítségével, MOUNT vagy COPY módban. Ez lehetővé teszi, hogy a feladatot bármelyik GPU-n futtassuk, bármelyik felhőben. A SkyPilot 20+ felhőn, Kubernetes, Slurm és on-prem rendszereken is megtalálja a feladat futtatásához szükséges compute-ot, így ugyanaz a futtatás azt használja, amelyik a lefoglalt vagy igény szerinti GPU-k közül elérhető.
Kapcsolódó: JetPack 7.2
A Hugging Face Storage nem számít fel egress vagy CDN díjakat, így bárhol is fut a feladat, az adatok közvetlenül ugyanabból a bucketből olvashatóak, minden felhőspecifikus másolat és adatátviteli számla nélkül. A rendszerek Xet-alapú deduplikációt is használnak, ami azt jelenti, hogy az inkrementális ellenőrzőpontok és modellváltozatok csak a megváltozott részeket tárolják és továbbítják, csökkentve ezzel az adatforgalmat.
Kapcsolódó: GLM-5.2 API
Egységes hozzáférés és költséghatékonyság
A Hugging Face és a SkyPilot közösen fejlesztette ki ezt a funkciót. A Hugging Face Storage mostantól első osztályú SkyPilot backendként funkcionál, lehetővé téve az adatok csatolását helyi útvonalakként. Ez a megközelítés lefedi a teljes életciklust: az adatok olvasása a repókból, az ellenőrzőpontok írása a Bucketbe képzés közben, a kész modell közzététele, majd az inference szerverekre való lehívása kiszolgáláskor. Mivel a legtöbb csapat már a Hubon tartja modelljeit és adathalmazait, nincs szükség migrációra vagy új tárolószámla létrehozására.
A MOUNT mód a Hugging Face hf-mount FUSE backendjét használja, így a bucket vagy repo helyi útvonalként jelenik meg. Az adatok lekérése a fájlrendszer szintjén történik: amikor a kód egy olvasási kérést intéz, a driver csak azokat a byte-okat húzza be a Xet backendből. Ez azt jelenti, hogy csak az érintett adatok lépik át a hálózatot, és az on-disk cache biztosítja, hogy az ismételt olvasások helyben maradjanak. Ez a megközelítés lehetővé teszi, hogy a GPU szinte azonnal elkezdjen dolgozni az adatokkal, ahogy azok streamelődnek, ahelyett, hogy a teljes adathalmaz letöltésére várna.
Kapcsolódó: AI-Q Blueprint
A COPY mód a huggingface_hub könyvtáron keresztül tölti le az adatokat előre, különleges követelmények nélkül. Az autentikációhoz a már meglévő token használható, ami minden felhőn működik, így nincs szükség felhőspecifikus kulcsok kezelésére. Az egress díjak eltörlése jelentős költségmegtakarítást eredményez, mivel az adatok olvasása ingyenes, függetlenül attól, hogy hol futnak a GPU-k. Az írás továbbra is a compute felhő szokásos egress díjait vonja maga után, de az AI munkák többségében az olvasás dominál.
Kapcsolódó: Storage Buckets
Egy gyors teszt során a Qwen/Qwen3.5-4B modellt a HuggingFaceH4/Multilingual-Thinking adathalmazzal finomhangolták. A SkyPilot YAML ugyanazon a futtatáson AWS-en, GCP-n és Lambda-n futott, csak az infrastruktúra változott. A SkyPilot mindenhol ingyen töltötte be a modellt, és az adatok olvasása semmibe sem került, mivel a Hugging Face nem számít fel egress díjat.