ÉlőUtoljára: 2 órájaMa: 10
Modellek & LLMfrissítve: 21:30

Beszédfelismerő AI-t mutatott be az NVIDIA, készít magyar feliratokat is

Az NVIDIA új, Canary-1B-v2 nevű modellje angol beszédet képes felismerni és franciára, németre, spanyolra vagy olaszra fordítani, feliratokat generálva.

Beszédfelismerő AI-t mutatott be az NVIDIA, készít magyar feliratokat is
Fotó: Kamil Switalski / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

Az NVIDIA bemutatta Canary-1B-v2 modelljét, amely egy új, GPU-gyorsított munkafolyamatot kínál a beszédfelismeréshez (ASR) és fordításhoz. A NeMo toolkit részeként elérhető modell képes angol hanganyagot feldolgozni, szöveggé alakítani, majd azt több európai nyelvre lefordítani.

A fejlesztők számára készült útmutató lépésről lépésre mutatja be a Canary-1B-v2 beállítását Python környezetben. A folyamat magában foglalja a szükséges audio- és NeMo-függőségek telepítését, valamint a modell betöltését GPU-gyorsított futtatókörnyezetbe a hatékony működés érdekében. A modell támogatja a 16 kHz mintavételezésű mono audio formátumot, és képes szegmens- és szószintű időbélyegeket is generálni.

Kapcsolódó: NVIDIA ASR-modell 40 nyelv

Automatikus feliratozás SRT formátumban

A Canary-1B-v2 nemcsak a beszédet azonosítja és fordítja, hanem képes a fordított szöveget automatikusan SRT formátumú feliratfájlként exportálni. Ez a funkció különösen hasznos lehet tartalomgyártók és videószerkesztők számára, akik gyorsan szeretnének feliratozott videókat készíteni.

Kapcsolódó: Google Gemini expresszív TTS

Többnyelvű támogatás és sebességteszt

A modell széleskörű nyelvi támogatást kínál, beleértve a bolgárt, horvátot, csehet, dánt, németet, görögöt, magyart, olaszt, lengyelt, portugált, románt, szlovákot, szlovént, spanyolt, svédet, oroszt és ukránt. Az NVIDIA közleménye szerint a munkafolyamat GPU-gyorsítással fut, ami gyorsabb feldolgozást tesz lehetővé. A pontos sebesség- és késleltetési adatok ugyanakkor nem kerültek publikálásra, csak a modell betöltési és feldolgozási lépéseinek relatív időzítését említik.

Kapcsolódó: NVIDIA CLIP kvantálás FP8

A tesztek során a Canary-1B-v2 hosszú hanganyagok feldolgozását és kötegelt feldolgozást is bemutatott, bár ezek teljesítményét nem kvantifikálták. A modell rugalmasan adaptálható valós audiofájlokhoz, feliratgeneráláshoz és nagyszabású transzkripciós kísérletekhez.

Kapcsolódó: NVIDIA Star Elastic változatok

Az NVIDIA Canary-1B-v2 modellje már elérhető a NeMo toolkit részeként, lehetővé téve a fejlesztők számára, hogy fejlett ASR és fordítási képességeket építsenek be alkalmazásaikba.

Kapcsolódó: OpenAI Whisper beszédfelismerés

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom