Beszédfelismerő AI-t mutatott be az NVIDIA, készít magyar feliratokat is
Az NVIDIA új, Canary-1B-v2 nevű modellje angol beszédet képes felismerni és franciára, németre, spanyolra vagy olaszra fordítani, feliratokat generálva.

Az NVIDIA bemutatta Canary-1B-v2 modelljét, amely egy új, GPU-gyorsított munkafolyamatot kínál a beszédfelismeréshez (ASR) és fordításhoz. A NeMo toolkit részeként elérhető modell képes angol hanganyagot feldolgozni, szöveggé alakítani, majd azt több európai nyelvre lefordítani.
A fejlesztők számára készült útmutató lépésről lépésre mutatja be a Canary-1B-v2 beállítását Python környezetben. A folyamat magában foglalja a szükséges audio- és NeMo-függőségek telepítését, valamint a modell betöltését GPU-gyorsított futtatókörnyezetbe a hatékony működés érdekében. A modell támogatja a 16 kHz mintavételezésű mono audio formátumot, és képes szegmens- és szószintű időbélyegeket is generálni.
Kapcsolódó: NVIDIA ASR-modell 40 nyelv
Automatikus feliratozás SRT formátumban
A Canary-1B-v2 nemcsak a beszédet azonosítja és fordítja, hanem képes a fordított szöveget automatikusan SRT formátumú feliratfájlként exportálni. Ez a funkció különösen hasznos lehet tartalomgyártók és videószerkesztők számára, akik gyorsan szeretnének feliratozott videókat készíteni.
Kapcsolódó: Google Gemini expresszív TTS
Többnyelvű támogatás és sebességteszt
A modell széleskörű nyelvi támogatást kínál, beleértve a bolgárt, horvátot, csehet, dánt, németet, görögöt, magyart, olaszt, lengyelt, portugált, románt, szlovákot, szlovént, spanyolt, svédet, oroszt és ukránt. Az NVIDIA közleménye szerint a munkafolyamat GPU-gyorsítással fut, ami gyorsabb feldolgozást tesz lehetővé. A pontos sebesség- és késleltetési adatok ugyanakkor nem kerültek publikálásra, csak a modell betöltési és feldolgozási lépéseinek relatív időzítését említik.
Kapcsolódó: NVIDIA CLIP kvantálás FP8
A tesztek során a Canary-1B-v2 hosszú hanganyagok feldolgozását és kötegelt feldolgozást is bemutatott, bár ezek teljesítményét nem kvantifikálták. A modell rugalmasan adaptálható valós audiofájlokhoz, feliratgeneráláshoz és nagyszabású transzkripciós kísérletekhez.
Kapcsolódó: NVIDIA Star Elastic változatok
Az NVIDIA Canary-1B-v2 modellje már elérhető a NeMo toolkit részeként, lehetővé téve a fejlesztők számára, hogy fejlett ASR és fordítási képességeket építsenek be alkalmazásaikba.
Kapcsolódó: OpenAI Whisper beszédfelismerés