ÉlőUtoljára: 16 perceMa: 2
Hardver & Infrafrissítve: 22:15

NVIDIA GPU-gyorsított Presto 8-szor alacsonyabb késleltetést ér el

Az NVIDIA DGX B200 és GB200 NVL72 rendszereken futó GPU-gyorsított Presto akár 8-szor alacsonyabb lekérdezési késleltetést és 64%-kal gyorsabb futási időt ér el a CPU-klaszterekhez képest.

NVIDIA GPU-gyorsított Presto 8-szor alacsonyabb késleltetést ér el
Fotó: Mariia Shalabaieva / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Az NVIDIA GPU-gyorsított Presto jelentősen felgyorsítja az elemzési lekérdezéseket, akár 8-szor alacsonyabb késleltetést kínálva a hagyományos CPU-klaszterekhez képest. Az eredmények a TPC-H benchmarkokon láthatók, ahol a teljesítményjavulás a GPU-k számától és az adathalmaz méretétől függően változik — közölte az NVIDIA.

Technológiák a teljesítményjavulás mögött

A sebességnövekedést olyan NVIDIA technológiák biztosítják, mint a cuDF a lekérdezések végrehajtásához, a NVLink 5.0 a gyors GPU-k közötti kommunikációhoz, valamint a GPUDirect Storage (GDS) az IBM Storage Scale és a GPU memória közötti közvetlen adatátvitelhez. Ezek csökkentik a CPU terhelését és a NUMA-átmenetekkel járó késedelmeket.

Kapcsolódó: Nvidia GB200 AI-ütemezés

GPU-k és CPU-k teljesítményösszehasonlítása

A tesztek szerint egyetlen DGX B200 csomópont nyolc GPU-val képes felvenni a versenyt vagy felülmúlni 8-10 Intel Xeon 6642Y szerverből álló CPU-klaszterek teljesítményét. A TPC-H benchmarkokon, amely 22 analitikai lekérdezést foglal magában, a GPU-gyorsított Presto 2,5-szeres és 8-szoros futási időbeli javulást mutatott a skálázási tényezőtől függően.

Kapcsolódó: AWS G7 GPU-gyorsítás

Az NVIDIA GB200 NVL72 rendszeren végzett tesztek kimutatták, hogy az I/O és kommunikációs optimalizálások, mint például a 16 MiB I/O feladatméret és 16 I/O szál használata, valamint a Q11 lekérdezés átírása, összesen 64%-kal gyorsabb lekérdezési futási időt eredményeztek. A Q11 lekérdezés átírása például 50 másodpercről 2 másodpercre csökkentette a futási időt.

Kapcsolódó: NVIDIA Slinky Kubernetes

A GPU-gyorsított Presto a GB200 NVL72 rendszereken is kiválóan skálázódik, ahol az IBM Storage Scale integrációja tovább növeli az I/O teljesítményt. Az optimalizálásokkal a lekérdezési futási idők jelentősen csökkentek, lehetővé téve az adattudósok és elemzők számára a gyorsabb iterációt.

Kapcsolódó: RTX PRO 4500 Blackwell

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom