Az NVIDIA 50%-kal csökkenti a CLIP-kódolók méretét az FP8 kvantálással
Az NVIDIA bejelentette, hogy az FP8 kvantálás segítségével akár 50%-kal csökkentheti a CLIP-kódolók méretét. Ez a technológia az NVIDIA TensorRT motorral kombinálva 1,39-1,45-szörös sebességnövekedést eredményez az FP16-hoz képest.

Az NVIDIA TensorRT motor FP8 kvantálással gyorsítja a modellinferenciát, miközben csökkenti a méretet és a VRAM-használatot. Az FP8-alapú CLIP-kódolók ONNX-fájljai akár 50%-kal is kisebbek lehetnek a korábbi FP16-os verziókhoz képest.
A TensorRT motor a QuantizeLinear/DequantizeLinear (Q/DQ) csomópontokat közvetlenül az adjacens rétegekbe integrálja. Ez lehetővé teszi az FP8 Tensor Cores és speciális kernelfüggvények közvetlen használatát, ami magasabb számítási átvitelt és alacsonyabb memória-sávszélesség-használatot eredményez. Az Ada architektúrájú GPU-kon ez különösen a GEMM és MHA rétegeket gyorsítja.
Kapcsolódó: NVIDIA Star Elastic
Az FP8 kvantálás sebességnövekedést biztosít
Az NVIDIA RTX 6000 Ada GPU-n végzett tesztek és a Nsight Deep Learning Designer profilozása kimutatta, hogy az FP8 kvantálás 1.39x-1.45x sebességnövekedést biztosít a FP16-os verzióhoz képest a CLIP-kódolók inferencia-késleltetése terén. A legtöbb gyorsulás az optimalizált FP8 matmul és attention kernelfüggvények végrehajtásából származik.
Kapcsolódó: NVIDIA Model Optimizer
A modelloptimalizálás és a gyártásbeli telepítés
A kvantált ellenőrzőpontok TensorRT motorrá alakítása az NVIDIA RTX 6000 Ada GPU-n történő végrehajtás során 1,39-1,45-szörös sebességnövekedést eredményez a CLIP-kódolók esetében.
Kapcsolódó: GPT-OSS modell