ÉlőUtoljára: 4 órájaMa: 2
Modellek & LLMfrissítve: 21:10

Az NVIDIA 50%-kal csökkenti a CLIP-kódolók méretét az FP8 kvantálással

Az NVIDIA bejelentette, hogy az FP8 kvantálás segítségével akár 50%-kal csökkentheti a CLIP-kódolók méretét. Ez a technológia az NVIDIA TensorRT motorral kombinálva 1,39-1,45-szörös sebességnövekedést eredményez az FP16-hoz képest.

Az NVIDIA 50%-kal csökkenti a CLIP-kódolók méretét az FP8 kvantálással
Fotó: sıtkı aksoy / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Az NVIDIA TensorRT motor FP8 kvantálással gyorsítja a modellinferenciát, miközben csökkenti a méretet és a VRAM-használatot. Az FP8-alapú CLIP-kódolók ONNX-fájljai akár 50%-kal is kisebbek lehetnek a korábbi FP16-os verziókhoz képest.

A TensorRT motor a QuantizeLinear/DequantizeLinear (Q/DQ) csomópontokat közvetlenül az adjacens rétegekbe integrálja. Ez lehetővé teszi az FP8 Tensor Cores és speciális kernelfüggvények közvetlen használatát, ami magasabb számítási átvitelt és alacsonyabb memória-sávszélesség-használatot eredményez. Az Ada architektúrájú GPU-kon ez különösen a GEMM és MHA rétegeket gyorsítja.

Kapcsolódó: NVIDIA Star Elastic

Az FP8 kvantálás sebességnövekedést biztosít

Az NVIDIA RTX 6000 Ada GPU-n végzett tesztek és a Nsight Deep Learning Designer profilozása kimutatta, hogy az FP8 kvantálás 1.39x-1.45x sebességnövekedést biztosít a FP16-os verzióhoz képest a CLIP-kódolók inferencia-késleltetése terén. A legtöbb gyorsulás az optimalizált FP8 matmul és attention kernelfüggvények végrehajtásából származik.

Kapcsolódó: NVIDIA Model Optimizer

A modelloptimalizálás és a gyártásbeli telepítés

A kvantált ellenőrzőpontok TensorRT motorrá alakítása az NVIDIA RTX 6000 Ada GPU-n történő végrehajtás során 1,39-1,45-szörös sebességnövekedést eredményez a CLIP-kódolók esetében.

Kapcsolódó: GPT-OSS modell

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom