Új AI-modell vezeti az autót a világ minden táján — a DriveStack-VLA 91%-os pontossággal dolgozik
A DriveStack-VLA egy új AI-keretrendszer, amely 91,6%-os pontossággal képes navigálni autóvezetésben, miközben a zárt tesztekben 56,36%-os sikeraránnyal teljesít.

Egy névtelen kutatócsoport bemutatta a DriveStack-VLA nevű új AI-keretrendszert, amely a jelenlegi vizuális-nyelvi-akció (VLA) modellek korlátait hivatott áthidalni az autóvezetésben. A modell a világ tudását és nyelvi útmutatásokat használva alakítja át a VLM-eket vezetési politikákká.
A korábbi modellek elsősorban a képi adatokra és nyelvi előfeltevésekre támaszkodtak, ami gyenge vizuális geometriai modellezéshez és a biztonsági szempontok figyelmen kívül hagyásához vezetett. A DriveStack-VLA ezt úgy küszöböli ki, hogy egy madártávlati (Bird-Eye-View, BEV) reprezentációt injektál a modellbe egy DeepStack-stílusú kapcsolaton keresztül. Emellett bevezették a Render-Teacher Alignment eljárást, amely a valós és a raszterizált képek észlelési fókusza között teremt összhangot.
Kapcsolódó: Autonóm vezetési adatok egységesítése
A pálya jobb megértése
A fejlesztők egy fej-alapú önelemző modult is implementáltak. Ez a modul rangsorolja a mintavételezett útvonalakat, és feltételesen finomítja a legjobban teljesítő opciót. Ez a megközelítés hidat képez a multimodális trajektóriakiválasztásban, lehetővé téve a pontosabb mozgástervezést, amely a metrikai geometriára és a top-down jelenetszerkezetre épít.
Kapcsolódó: VLM-ügynökök feladatgyorsítása
Rekorderedmények a teszteken
A DriveStack-VLA a NAVSIMv1 teszten 91,6 PDMS, a NAVSIMv2-n pedig 91,0 EPDMS pontszámot ért el, utóbbin az emberi büntetési szűrő engedélyezve volt. A zártkörű Bench2Drive teszten a modell 79,49-es vezetési pontszámot és 56,36%-os sikerarányt produkált. Ezek az eredmények jelentős előrelépést jelentenek a VLA-vezetés kutatásában — közölte az arXiv.
Kapcsolódó: Streamelt asszisztensek benchmarkja