Valós idejű, 40 nyelvet átírásra képes ASR-modell a NVIDIÁ-tól
Az NVIDIA új, 600 millió paraméteres ASR-modelljével egyetlen ellenőrzőpontból 40 nyelvet lehet valós időben átírni. A modell a Hugging Face-en érhető el, nyílt súlyokkal és OpenMDW-1.1 licenc alatt.

Cache-Aware FastConformer-RNNT architektúra
A Nemotron 3.5 ASR a korábbi nvidia/nemotron-speech-streaming-en-0.6b modell kiterjesztése, amely prompt-alapú nyelvazonosítással bővült. Ez teszi lehetővé, hogy egyetlen 600M paraméteres modell kezeljen 40 nyelvet anélkül, hogy külön nyelvi modellekre vagy modellek cseréjére lenne szükség. A rendszer két fő feladatra optimalizált: alacsony késleltetésű élő hangátvitelre és magas átviteli sebességű kötegelt átírásra. A kimenet producálásra kész szöveg, megfelelő formázással, külön írásjel-helyreállítási lépés nélkül.
A késleltetés szabályozása
A modell működését az úgynevezett Cache-Aware FastConformer-RNNT architektúra biztosítja. Ez egy 24 rétegű FastConformer enkóderből és egy RNNT dekóderből áll. A „cache-aware” kialakítás lényege, hogy ahelyett, hogy minden új hangablakot újra feldolgozna, a modell gyorsítótárazza az enkóder önfigyelmes és konvolúciós aktivációit. Így minden hangkockát pontosan egyszer dolgoz fel, csökkentve a számítási igényt és a késleltetést pontosságvesztés nélkül. Az inference során a att_context_size paraméter állításával szabályozható a késleltetés és a pontosság közötti kompromisszum, 80 ms-tól 1,12 másodpercig terjedő tartományban.
Kapcsolódó: NVIDIA Star Elastic
Nyelvi lefedettség és finomhangolás
A 40 nyelvi változat között szerepelnek angol, spanyol, német és francia variánsok, valamint arab, japán, koreai, mandarin, hindi és thai nyelvek. A auto módban a modell képes felismerni a nyelvet, és a végleges írásjel után kiírja a nyelv címkéjét, ami vegyes nyelvű forgalom átírását is lehetővé teszi külön nyelvazonosító komponens nélkül. A nyílt súlyoknak köszönhetően a modellek finomhangolhatók specifikus nyelvekre, doménokra vagy akcentusokra. Egy görög és bolgár nyelvű finomhangolási példában a görög WER 35%-ról 24%-ra, a bolgár pedig 22%-ról 15%-ra csökkent, ami 31-32%-os relatív javulást jelent a 80 ms-os beállítás mellett.
Kapcsolódó: Nemotron-Labs modell
Előnyök és megfontolások
A Nemotron 3.5 ASR fő előnye, hogy egyetlen 600M paraméteres modell 40 nyelvet fed le, csökkentve a telepítési komplexitást. A cache-aware streaming jelentősen növeli a párhuzamos streamelési képességet egy H100-as GPU-n. A késleltetés rugalmasan állítható inference időben, újratanítás nélkül. Az NVIDIA a Nemotron 3.5 ASR-t a Hugging Face-en tette elérhetővé OpenMDW-1.1 licenc alatt, az NVIDIA H100-as GPU-val való használatra optimalizálva.
Kapcsolódó: EAGLE3 dekódolás