Nyílt forráskódú diffúziós ASR modellt adott ki az Interfaze hat nyelven
Az Interfaze új, nyílt forráskódú ASR modellje, a diffusion-gemma-asr-small, egyetlen, 42 millió paraméteres adapterrel hat nyelven képes beszédet felismerni.

Az Interfaze startup kiadta a diffusion-gemma-asr-small modellt, amely az első ismert nyílt forráskódú, többnyelvű diffúziós ASR (Automatic Speech Recognition) megoldás. A modell egyetlen, körülbelül 42 millió paraméteres adaptert használ, ami a Google 26 milliárd paraméteres DiffusionGemma modelljére épül, és hat különböző nyelven képes hangot szöveggé alakítani.
A megoldás a diffúziós modellek párhuzamos dekódolási képességét használja, szemben az autoregresszív modellekkel, amelyek tokenenként haladnak. Az Interfaze fejlesztői szerint a modell 6.6%-os Word Error Rate (WER) értéket ért el a LibriSpeech teszten, ami jobb, mint a Whisfusion 8.3%-os eredménye, de elmarad az autoregresszív Whisper modelltől. Az adapter Apache-2.0 licenc alatt érhető el, míg a DiffusionGemma és a Whisper-small külön licenccel rendelkeznek.
Kapcsolódó: Dynin-Omni 19 multimodális teszt
Hogyan működik a modell?
A diffusion-gemma-asr-small nem nyers hanghullámokat dolgoz fel, hanem egy Whisper-small encoder segítségével alakítja át azokat akusztikus jellemzővé. Ez a 30 másodpercnyi hangból 1500 keretet generál, amelyek 768 dimenziósak. Ezt követően egy betanított projektor tömöríti ezeket az adatokat 188 darab 2816 dimenziós „audio tokenre”. Ezeket a tokeneket aztán beillesztik a DiffusionGemma dekóder promptjába, amely egy 192 tokenes „transcript canvas”-t alakít át szöveggé körülbelül 16 párhuzamos lépésben.
Kapcsolódó: Diffusion LLM válaszidő gyorsítása
A betanítás kihívásai és megoldásai
Az első betanítási kísérletek sikertelenek voltak, mivel a projektor véletlenszerű kimenete miatt a modell figyelmen kívül hagyta az audio bemenetet. A probléma megoldására a kutatók közvetlenül felügyelték a projektort egy Connectionist Temporal Classification (CTC) veszteségfüggvénnyel, amely jobban igazítja az audio jellemzőket a szöveghez. Ez a módszer jelentősen javította a projektor teljesítményét, és lehetővé tette a modell hatékony betanítását.
Kapcsolódó: Google DiffusionGemma modell
Teljesítmény és összehasonlítás
A modell a LibriSpeech teszt-clean adathalmazon 6.6%-os WER értéket ért el. Más diffúziós modellekkel összehasonlítva ez az eredmény vezetőnek számít, azonban az autoregresszív Whisper modellek, mint a Whisper-small (~3.4% WER) vagy a Whisper-large-v3 (~2.0% WER), továbbra is jobb pontosságot mutatnak. A csapat szerint ez a különbség inkább az adatokban, mintsem az architektúrában rejlik.
Kapcsolódó: Gradium valós idejű beszédfordítás
Felhasználási esetek és elérhetőség
A modell párhuzamos dekódolási képessége miatt ideális lehet kötegelt feldolgozásra, ahol a költség nem a transzkribált szöveg hosszától, hanem a denoisolási lépések számától függ. Az egyetlen adapterrel hat nyelvet (angol, német, francia, spanyol, hindi és mandarin) képes felismerni, ami megkönnyíti a többnyelvű alkalmazások fejlesztését. Az adapter a Hugging Face Hubon érhető el, és a `transformers` könyvtár legújabb verziójával használható.
Kapcsolódó: NVIDIA beszédfelismerő AI
A modell a Hugging Face Hubon található, és a `pip install` paranccsal telepíthető. A DiffusionGemma és a Whisper-small alapmodellek külön tölthetők le.