NVIDIA új BEVPoolV3-az akár 42-szer gyorsabb a robotok és önvezető autók látásrendszereiben
Az algoritmus bevezetésével az NVIDIA a jövőbeni autonóm rendszerek hatékonyságát is növelni tudja, például az érzékelők és az AI közötti kommunikáció optimalizálásán keresztül.

Az NVIDIA új BEVPoolV3 algoritmusa négy kulcsfontosságú változtatást vezet be a BEV poolingban, ami jelentős sebességnövekedést eredményez az NVIDIA GPU-kon. Ezek a fejlesztések csökkentik a késleltetést a különböző GPU memóriaregiszterekben, így gyorsabbá téve a fizikai AI alkalmazásokat.
A BEV pooling kulcsfontosságú művelet az autonóm járművek, robotok és térbeli AI rendszerek látórendszereiben. Ez a folyamat vetíti a többkamerás képi információkat egy közös, felülnézetes rácsba, ami lehetővé teszi a sávok, járművek és gyalogosok elemzését. A BEVPoolV3 optimalizálja ezt a lépést, csökkentve a memória-hozzáférések és a számítások idejét.
Kapcsolódó: Nvidia radarfeldolgozás
A fejlesztők számára a BEVPoolV3 akár 22-szeres sebességnövekedést kínál FP16 módban a DRAM-alapú útvonalon, és akár 42-szeres gyorsulást FP8 módban a L2-cache-alapú útvonalon az előző verzióhoz képest — közölte az NVIDIA Developer Blog.
Kapcsolódó: Nvidia arcfelismerés
A BEVPoolV3 újdonságai
Az új algoritmus négy fő változtatást tartalmaz: csökkentett ismétlődő mélységi terhelések, egy öt tömbös INT32 scatter map, előre kiszámított indexek, amelyek kiküszöbölik a futásidejű egész számú osztást, és intervallum-tulajdonú kimeneti írások. Ezek a módosítások együttesen járulnak hozzá a BEV pooling késleltetésének csökkentéséhez.
Kapcsolódó: Nvidia Mission Control
Optimalizálási munkafolyamat és eredmények
Az NVIDIA bemutatott egy munkafolyamatot a BEV pooling operátorok optimalizálásához. Ez magában foglalja a munkaterhelés memóriaregiszter szerinti osztályozását (DRAM-bound vagy L2-resident), a redundáns scatter forgalom megszüntetését, a kernel implementáció illesztését a cél GPU architektúrához, valamint a szűk keresztmetszetek validálását az NVIDIA Nsight Compute segítségével. A tesztek NVIDIA RTX A6000 (Ampere) és NVIDIA RTX PRO 6000 Blackwell Max-Q GPU-kon végezve kimutatták a jelentős sebességnövekedést.
Kapcsolódó: RTX PRO 4500 Blackwell
FP8 és az edge platformok
Az FP8 számítási mód további késleltetési előnyöket kínál a L2-cache-alapú scatter-reduce feladatoknál. Azonban az NVIDIA kiemeli, hogy az edge-eszközökön történő FP8 használata előtt architektúraspecifikus értékelésre van szükség. Ez a megközelítés biztosítja a legjobb teljesítményt a különböző hardverkörnyezetekben. A BEVPoolV3 az NVIDIA Developer Blogon érhető el.
Kapcsolódó: AI-infrastruktúra élettartam