ÉlőUtoljára: 12 órájaMa: 0
Kutatásfrissítve: 06:45

Kisebb modellel veri a nagy nyelvi modelleket az Apple és a Google ASR-hibajavításban

Az Apple és a Google kutatói 15-szer kevesebb paraméterrel rendelkező, kompakt modellel javítják az automatikus beszédfelismerés hibáit, felülmúlva a nagy nyelvi modellek teljesítményét.

Kisebb modellel veri a nagy nyelvi modelleket az Apple és a Google ASR-hibajavításban
Fotó: Denis Cherkashin / Unsplash
forrás: Apple ML·AI Forradalom szerk.·
Megosztás

Az Apple és a Google kutatói egy új, kompakt szekvencia-szekvencia modellel dolgozzák fel az automatikus beszédfelismerés (ASR) hibáit. A módszerük kevesebb paramétert használ, mint a nagy nyelvi modellek (LLM), miközben pontosabb eredményeket ér el, és kiküszöböli az LLM-ekkel kapcsolatos késleltetési és hallucinációs problémákat. A kutatás eredményeit az arXiv-on publikálták előnyomtatott formában.

Kisebb modell, nagyobb pontosság

A hagyományos ASR-rendszerek gyakran használnak nyelvi modelleket a szöveg javítására, de ezek nem ismerik fel az ASR-specifikus hibákat. Az LLM-ek alkalmazása ígéretesnek bizonyult, ám számítási költségeik és a lehetséges hibák (hallucinációk) korlátozzák a használatukat. Az Apple és a Google kutatói által javasolt megközelítés egy speciális, kompakt szekvencia-szekvencia modellt használ, amelyet valós és szintetikusan generált ASR-hibákon tanítottak be. A modell 15-szer kevesebb paramétert igényel, mint az LLM-ek, mégis jobb eredményeket produkál a LibriSpeech tesztadatokon: 1,5%-os szótévesztési rátát (WER) ér el a test-clean, és 3,3%-ot a test-other adatkészleteken. Ez felülmúlja az LLM-alapú megközelítéseket.

Kapcsolódó: LLM hibaszázalék becslés

Szintetikus adatok és korrekciós dekódolás

A hatékony tanításhoz a kutatók szintetikus adatkészleteket hoztak létre hang-szöveg átalakító (TTS) és ASR rendszerek kaszkádolt alkalmazásával. Megállapították, hogy a valósághű hibaeloszlások sokszínűségének leképezése kulcsfontosságú a modell teljesítménye szempontjából. A kutatók bevezették a „correction-first” dekódolási stratégiát is, amelynek során a korrekciós modell jelöltjeit az ASR akusztikus pontszámai alapján rangsorolják újra. Ez a módszer lehetővé teszi a modell számára, hogy pontos korrekciókat végezzen alacsony hibaszámú esetekben is, ahol az LLM-ek hajlamosak téves információkat generálni.

Kapcsolódó: GPT-2 toxikus kimenet megszüntetése

Általánosíthatóság és jövőbeli hatások

A javasolt modell általánosítható különböző ASR architektúrákra, beleértve a CTC, a szekvencia-szekvencia és a Transducer modelleket, valamint különböző domain-ekre is. Ez azt jelenti, hogy a technológia széles körben alkalmazható lehet a beszédfelismerő rendszerekben. A kutatók, Zijin Gu, Tatiana Likhomanenko, Richard He Bai, Erik McDermott, Ronan Collobert és Navdeep Jaitly szerint ez a megközelítés jelentősen csökkentheti a valós idejű ASR rendszerek késleltetését és növelheti azok megbízhatóságát.

Kapcsolódó: LLM méretfelezés

A kutatás eredményeit az Apple és a Google közös tanulmánya mutatta be az arXiv-on, amely 2026. júliusában jelent meg.

Kapcsolódó: Írásjel helyreállítás 89%-os pontossággal

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom