ÉlőUtoljára: 7 órájaMa: 2
Modellek & LLMfrissítve: 13:08

Valós idejű, 40 nyelvet átírásra képes ASR-modell a NVIDIÁ-tól

Az NVIDIA új, 600 millió paraméteres ASR-modelljével egyetlen ellenőrzőpontból 40 nyelvet lehet valós időben átírni. A modell a Hugging Face-en érhető el, nyílt súlyokkal és OpenMDW-1.1 licenc alatt.

Valós idejű, 40 nyelvet átírásra képes ASR-modell a NVIDIÁ-tól
Fotó: Randall Bruder / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

Cache-Aware FastConformer-RNNT architektúra

A Nemotron 3.5 ASR a korábbi nvidia/nemotron-speech-streaming-en-0.6b modell kiterjesztése, amely prompt-alapú nyelvazonosítással bővült. Ez teszi lehetővé, hogy egyetlen 600M paraméteres modell kezeljen 40 nyelvet anélkül, hogy külön nyelvi modellekre vagy modellek cseréjére lenne szükség. A rendszer két fő feladatra optimalizált: alacsony késleltetésű élő hangátvitelre és magas átviteli sebességű kötegelt átírásra. A kimenet producálásra kész szöveg, megfelelő formázással, külön írásjel-helyreállítási lépés nélkül.

A késleltetés szabályozása

A modell működését az úgynevezett Cache-Aware FastConformer-RNNT architektúra biztosítja. Ez egy 24 rétegű FastConformer enkóderből és egy RNNT dekóderből áll. A „cache-aware” kialakítás lényege, hogy ahelyett, hogy minden új hangablakot újra feldolgozna, a modell gyorsítótárazza az enkóder önfigyelmes és konvolúciós aktivációit. Így minden hangkockát pontosan egyszer dolgoz fel, csökkentve a számítási igényt és a késleltetést pontosságvesztés nélkül. Az inference során a att_context_size paraméter állításával szabályozható a késleltetés és a pontosság közötti kompromisszum, 80 ms-tól 1,12 másodpercig terjedő tartományban.

Kapcsolódó: NVIDIA Star Elastic

Nyelvi lefedettség és finomhangolás

A 40 nyelvi változat között szerepelnek angol, spanyol, német és francia variánsok, valamint arab, japán, koreai, mandarin, hindi és thai nyelvek. A auto módban a modell képes felismerni a nyelvet, és a végleges írásjel után kiírja a nyelv címkéjét, ami vegyes nyelvű forgalom átírását is lehetővé teszi külön nyelvazonosító komponens nélkül. A nyílt súlyoknak köszönhetően a modellek finomhangolhatók specifikus nyelvekre, doménokra vagy akcentusokra. Egy görög és bolgár nyelvű finomhangolási példában a görög WER 35%-ról 24%-ra, a bolgár pedig 22%-ról 15%-ra csökkent, ami 31-32%-os relatív javulást jelent a 80 ms-os beállítás mellett.

Kapcsolódó: Nemotron-Labs modell

Előnyök és megfontolások

A Nemotron 3.5 ASR fő előnye, hogy egyetlen 600M paraméteres modell 40 nyelvet fed le, csökkentve a telepítési komplexitást. A cache-aware streaming jelentősen növeli a párhuzamos streamelési képességet egy H100-as GPU-n. A késleltetés rugalmasan állítható inference időben, újratanítás nélkül. Az NVIDIA a Nemotron 3.5 ASR-t a Hugging Face-en tette elérhetővé OpenMDW-1.1 licenc alatt, az NVIDIA H100-as GPU-val való használatra optimalizálva.

Kapcsolódó: EAGLE3 dekódolás

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom