ÉlőUtoljára: 1 órájaMa: 2
Hardver & Infrafrissítve: 19:30

NVIDIA új BEVPoolV3-az akár 42-szer gyorsabb a robotok és önvezető autók látásrendszereiben

Az algoritmus bevezetésével az NVIDIA a jövőbeni autonóm rendszerek hatékonyságát is növelni tudja, például az érzékelők és az AI közötti kommunikáció optimalizálásán keresztül.

NVIDIA új BEVPoolV3-az akár 42-szer gyorsabb a robotok és önvezető autók látásrendszereiben
Fotó: BoliviaInteligente / Unsplash
forrás: Nvidia Developer·AI Forradalom szerk.·
Megosztás

Az NVIDIA új BEVPoolV3 algoritmusa négy kulcsfontosságú változtatást vezet be a BEV poolingban, ami jelentős sebességnövekedést eredményez az NVIDIA GPU-kon. Ezek a fejlesztések csökkentik a késleltetést a különböző GPU memóriaregiszterekben, így gyorsabbá téve a fizikai AI alkalmazásokat.

A BEV pooling kulcsfontosságú művelet az autonóm járművek, robotok és térbeli AI rendszerek látórendszereiben. Ez a folyamat vetíti a többkamerás képi információkat egy közös, felülnézetes rácsba, ami lehetővé teszi a sávok, járművek és gyalogosok elemzését. A BEVPoolV3 optimalizálja ezt a lépést, csökkentve a memória-hozzáférések és a számítások idejét.

Kapcsolódó: Nvidia radarfeldolgozás

A fejlesztők számára a BEVPoolV3 akár 22-szeres sebességnövekedést kínál FP16 módban a DRAM-alapú útvonalon, és akár 42-szeres gyorsulást FP8 módban a L2-cache-alapú útvonalon az előző verzióhoz képest — közölte az NVIDIA Developer Blog.

Kapcsolódó: Nvidia arcfelismerés

A BEVPoolV3 újdonságai

Az új algoritmus négy fő változtatást tartalmaz: csökkentett ismétlődő mélységi terhelések, egy öt tömbös INT32 scatter map, előre kiszámított indexek, amelyek kiküszöbölik a futásidejű egész számú osztást, és intervallum-tulajdonú kimeneti írások. Ezek a módosítások együttesen járulnak hozzá a BEV pooling késleltetésének csökkentéséhez.

Kapcsolódó: Nvidia Mission Control

Optimalizálási munkafolyamat és eredmények

Az NVIDIA bemutatott egy munkafolyamatot a BEV pooling operátorok optimalizálásához. Ez magában foglalja a munkaterhelés memóriaregiszter szerinti osztályozását (DRAM-bound vagy L2-resident), a redundáns scatter forgalom megszüntetését, a kernel implementáció illesztését a cél GPU architektúrához, valamint a szűk keresztmetszetek validálását az NVIDIA Nsight Compute segítségével. A tesztek NVIDIA RTX A6000 (Ampere) és NVIDIA RTX PRO 6000 Blackwell Max-Q GPU-kon végezve kimutatták a jelentős sebességnövekedést.

Kapcsolódó: RTX PRO 4500 Blackwell

FP8 és az edge platformok

Az FP8 számítási mód további késleltetési előnyöket kínál a L2-cache-alapú scatter-reduce feladatoknál. Azonban az NVIDIA kiemeli, hogy az edge-eszközökön történő FP8 használata előtt architektúraspecifikus értékelésre van szükség. Ez a megközelítés biztosítja a legjobb teljesítményt a különböző hardverkörnyezetekben. A BEVPoolV3 az NVIDIA Developer Blogon érhető el.

Kapcsolódó: AI-infrastruktúra élettartam

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom