ÉlőUtoljára: 12 órájaMa: 11
Modellek & LLMfrissítve: 06:45

Nyílt forráskódú diffúziós ASR modellt adott ki az Interfaze hat nyelven

Az Interfaze új, nyílt forráskódú ASR modellje, a diffusion-gemma-asr-small, egyetlen, 42 millió paraméteres adapterrel hat nyelven képes beszédet felismerni.

Nyílt forráskódú diffúziós ASR modellt adott ki az Interfaze hat nyelven
Fotó: Nicholas Santoianni / Unsplash
forrás: MarkTechPost·AI Forradalom szerk.·
Megosztás

Az Interfaze startup kiadta a diffusion-gemma-asr-small modellt, amely az első ismert nyílt forráskódú, többnyelvű diffúziós ASR (Automatic Speech Recognition) megoldás. A modell egyetlen, körülbelül 42 millió paraméteres adaptert használ, ami a Google 26 milliárd paraméteres DiffusionGemma modelljére épül, és hat különböző nyelven képes hangot szöveggé alakítani.

A megoldás a diffúziós modellek párhuzamos dekódolási képességét használja, szemben az autoregresszív modellekkel, amelyek tokenenként haladnak. Az Interfaze fejlesztői szerint a modell 6.6%-os Word Error Rate (WER) értéket ért el a LibriSpeech teszten, ami jobb, mint a Whisfusion 8.3%-os eredménye, de elmarad az autoregresszív Whisper modelltől. Az adapter Apache-2.0 licenc alatt érhető el, míg a DiffusionGemma és a Whisper-small külön licenccel rendelkeznek.

Kapcsolódó: Dynin-Omni 19 multimodális teszt

Hogyan működik a modell?

A diffusion-gemma-asr-small nem nyers hanghullámokat dolgoz fel, hanem egy Whisper-small encoder segítségével alakítja át azokat akusztikus jellemzővé. Ez a 30 másodpercnyi hangból 1500 keretet generál, amelyek 768 dimenziósak. Ezt követően egy betanított projektor tömöríti ezeket az adatokat 188 darab 2816 dimenziós „audio tokenre”. Ezeket a tokeneket aztán beillesztik a DiffusionGemma dekóder promptjába, amely egy 192 tokenes „transcript canvas”-t alakít át szöveggé körülbelül 16 párhuzamos lépésben.

Kapcsolódó: Diffusion LLM válaszidő gyorsítása

A betanítás kihívásai és megoldásai

Az első betanítási kísérletek sikertelenek voltak, mivel a projektor véletlenszerű kimenete miatt a modell figyelmen kívül hagyta az audio bemenetet. A probléma megoldására a kutatók közvetlenül felügyelték a projektort egy Connectionist Temporal Classification (CTC) veszteségfüggvénnyel, amely jobban igazítja az audio jellemzőket a szöveghez. Ez a módszer jelentősen javította a projektor teljesítményét, és lehetővé tette a modell hatékony betanítását.

Kapcsolódó: Google DiffusionGemma modell

Teljesítmény és összehasonlítás

A modell a LibriSpeech teszt-clean adathalmazon 6.6%-os WER értéket ért el. Más diffúziós modellekkel összehasonlítva ez az eredmény vezetőnek számít, azonban az autoregresszív Whisper modellek, mint a Whisper-small (~3.4% WER) vagy a Whisper-large-v3 (~2.0% WER), továbbra is jobb pontosságot mutatnak. A csapat szerint ez a különbség inkább az adatokban, mintsem az architektúrában rejlik.

Kapcsolódó: Gradium valós idejű beszédfordítás

Felhasználási esetek és elérhetőség

A modell párhuzamos dekódolási képessége miatt ideális lehet kötegelt feldolgozásra, ahol a költség nem a transzkribált szöveg hosszától, hanem a denoisolási lépések számától függ. Az egyetlen adapterrel hat nyelvet (angol, német, francia, spanyol, hindi és mandarin) képes felismerni, ami megkönnyíti a többnyelvű alkalmazások fejlesztését. Az adapter a Hugging Face Hubon érhető el, és a `transformers` könyvtár legújabb verziójával használható.

Kapcsolódó: NVIDIA beszédfelismerő AI

A modell a Hugging Face Hubon található, és a `pip install` paranccsal telepíthető. A DiffusionGemma és a Whisper-small alapmodellek külön tölthetők le.

Forrás

Feldolgozott sajtóforrás·MarkTechPost

Eredeti cikk megnyitása →

Ez a cikk a fenti sajtóforrás alapján készült AI-összefoglalóval.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom