Kisebb modellel veri a nagy nyelvi modelleket az Apple és a Google ASR-hibajavításban
Az Apple és a Google kutatói 15-szer kevesebb paraméterrel rendelkező, kompakt modellel javítják az automatikus beszédfelismerés hibáit, felülmúlva a nagy nyelvi modellek teljesítményét.

Az Apple és a Google kutatói egy új, kompakt szekvencia-szekvencia modellel dolgozzák fel az automatikus beszédfelismerés (ASR) hibáit. A módszerük kevesebb paramétert használ, mint a nagy nyelvi modellek (LLM), miközben pontosabb eredményeket ér el, és kiküszöböli az LLM-ekkel kapcsolatos késleltetési és hallucinációs problémákat. A kutatás eredményeit az arXiv-on publikálták előnyomtatott formában.
Kisebb modell, nagyobb pontosság
A hagyományos ASR-rendszerek gyakran használnak nyelvi modelleket a szöveg javítására, de ezek nem ismerik fel az ASR-specifikus hibákat. Az LLM-ek alkalmazása ígéretesnek bizonyult, ám számítási költségeik és a lehetséges hibák (hallucinációk) korlátozzák a használatukat. Az Apple és a Google kutatói által javasolt megközelítés egy speciális, kompakt szekvencia-szekvencia modellt használ, amelyet valós és szintetikusan generált ASR-hibákon tanítottak be. A modell 15-szer kevesebb paramétert igényel, mint az LLM-ek, mégis jobb eredményeket produkál a LibriSpeech tesztadatokon: 1,5%-os szótévesztési rátát (WER) ér el a test-clean, és 3,3%-ot a test-other adatkészleteken. Ez felülmúlja az LLM-alapú megközelítéseket.
Kapcsolódó: LLM hibaszázalék becslés
Szintetikus adatok és korrekciós dekódolás
A hatékony tanításhoz a kutatók szintetikus adatkészleteket hoztak létre hang-szöveg átalakító (TTS) és ASR rendszerek kaszkádolt alkalmazásával. Megállapították, hogy a valósághű hibaeloszlások sokszínűségének leképezése kulcsfontosságú a modell teljesítménye szempontjából. A kutatók bevezették a „correction-first” dekódolási stratégiát is, amelynek során a korrekciós modell jelöltjeit az ASR akusztikus pontszámai alapján rangsorolják újra. Ez a módszer lehetővé teszi a modell számára, hogy pontos korrekciókat végezzen alacsony hibaszámú esetekben is, ahol az LLM-ek hajlamosak téves információkat generálni.
Kapcsolódó: GPT-2 toxikus kimenet megszüntetése
Általánosíthatóság és jövőbeli hatások
A javasolt modell általánosítható különböző ASR architektúrákra, beleértve a CTC, a szekvencia-szekvencia és a Transducer modelleket, valamint különböző domain-ekre is. Ez azt jelenti, hogy a technológia széles körben alkalmazható lehet a beszédfelismerő rendszerekben. A kutatók, Zijin Gu, Tatiana Likhomanenko, Richard He Bai, Erik McDermott, Ronan Collobert és Navdeep Jaitly szerint ez a megközelítés jelentősen csökkentheti a valós idejű ASR rendszerek késleltetését és növelheti azok megbízhatóságát.
Kapcsolódó: LLM méretfelezés
A kutatás eredményeit az Apple és a Google közös tanulmánya mutatta be az arXiv-on, amely 2026. júliusában jelent meg.
Kapcsolódó: Írásjel helyreállítás 89%-os pontossággal