ÉlőUtoljára: 1 órájaMa: 12
Kutatásfrissítve: 01:15

Az Apple kifejlesztett új beszédszintézis-modellt, ami gyorsabb következtetést tesz lehetővé

Az Apple új kutatása szerint a folytonos diffúziós beszédszintézis modellek (CD SLM) skálázódási törvényeket mutatnak, hasonlóan a korábbi diszkrét modellekhez, ami gyorsabb következtetést tesz lehetővé.

Az Apple kifejlesztett új beszédszintézis-modellt, ami gyorsabb következtetést tesz lehetővé
Fotó: Carmen Nie / Unsplash
forrás: Apple ML·AI Forradalom szerk.·
Megosztás

Az Apple kutatói a folytonos diffúziós (CD) beszédszintézis modellek (SLM) skálázhatóságát vizsgálták, mivel a diszkrét autoregresszív (AR) SLM-ek jelentős számítási és adatigényt támasztanak. A kutatás kimutatta, hogy a CD SLM-ek, hasonlóan az AR modellekhez, skálázódási törvényeket követnek mind a validációs veszteség, mind a fonémák Jensen-Shannon divergenciája (pJSD) tekintetében. A pJSD-t az Apple fejlesztette ki a beszélt nyelvi modellek nyelvi minőségének kvantifikálására. — írja az Apple ML.

Az elemzés szerint a modell- és adatméretek optimális aránya csökken a számítási kapacitás növekedésével. Ez azt jelenti, hogy nagyobb számítási teljesítménnyel a veszteség kevésbé érzékeny a modell és az adatméretek megválasztására, ami a gyors következtetés (inference) lehetőségét nyitja meg. A kutatók 16 milliárd paraméteres CD SLM-eket teszteltek, több tízmillió órányi beszélgetési adattal.

Kapcsolódó: Bitstream diffúzió nyelvmodellezésben

Emotív és többnyelvű beszédgenerálás

A nagy méretű CD SLM-ek képesek érzelmekkel teli, prozódikus, többhangú és többnyelvű beszédet generálni. Ez jelentős előrelépést jelent a korábbi modellekhez képest, amelyek gyakran monoton és egysíkú kimenetet produkáltak. A modell képességei magukban foglalják a különböző beszédstílusok és akcentusok reprodukálását is.

Kapcsolódó: TraFL javít diffúziós nyelvi modelleken

A hosszú távú koherencia kihívása

Annak ellenére, hogy a modellek képesek magas minőségű, érzelmekkel teli beszédet generálni, a hosszú távú koherencia elérése továbbra is jelentős kihívást jelent. Ez azt jelenti, hogy a hosszabb beszédszakaszok során a modell hajlamos lehet elveszíteni a logikai kapcsolatot vagy ismétlődővé válni. A kutatók szerint ez a probléma a jövőbeli fejlesztések egyik fő fókusza lesz.

Kapcsolódó: Kvantálási hibák csökkentése LLM-eknél

A kutatás eredményeit a GitHubon tették közzé, és a publikáció a 2026-os Interspeech konferencián került bemutatásra. A munka az Apple-nél zajlott, de a kutatók között szerepel a Google és más intézmények képviselői is.

Kapcsolódó: FLUID adaptál GPT-modelleket diffúzióhoz

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom