Az Apple kifejlesztett új beszédszintézis-modellt, ami gyorsabb következtetést tesz lehetővé
Az Apple új kutatása szerint a folytonos diffúziós beszédszintézis modellek (CD SLM) skálázódási törvényeket mutatnak, hasonlóan a korábbi diszkrét modellekhez, ami gyorsabb következtetést tesz lehetővé.

Az Apple kutatói a folytonos diffúziós (CD) beszédszintézis modellek (SLM) skálázhatóságát vizsgálták, mivel a diszkrét autoregresszív (AR) SLM-ek jelentős számítási és adatigényt támasztanak. A kutatás kimutatta, hogy a CD SLM-ek, hasonlóan az AR modellekhez, skálázódási törvényeket követnek mind a validációs veszteség, mind a fonémák Jensen-Shannon divergenciája (pJSD) tekintetében. A pJSD-t az Apple fejlesztette ki a beszélt nyelvi modellek nyelvi minőségének kvantifikálására. — írja az Apple ML.
Az elemzés szerint a modell- és adatméretek optimális aránya csökken a számítási kapacitás növekedésével. Ez azt jelenti, hogy nagyobb számítási teljesítménnyel a veszteség kevésbé érzékeny a modell és az adatméretek megválasztására, ami a gyors következtetés (inference) lehetőségét nyitja meg. A kutatók 16 milliárd paraméteres CD SLM-eket teszteltek, több tízmillió órányi beszélgetési adattal.
Kapcsolódó: Bitstream diffúzió nyelvmodellezésben
Emotív és többnyelvű beszédgenerálás
A nagy méretű CD SLM-ek képesek érzelmekkel teli, prozódikus, többhangú és többnyelvű beszédet generálni. Ez jelentős előrelépést jelent a korábbi modellekhez képest, amelyek gyakran monoton és egysíkú kimenetet produkáltak. A modell képességei magukban foglalják a különböző beszédstílusok és akcentusok reprodukálását is.
Kapcsolódó: TraFL javít diffúziós nyelvi modelleken
A hosszú távú koherencia kihívása
Annak ellenére, hogy a modellek képesek magas minőségű, érzelmekkel teli beszédet generálni, a hosszú távú koherencia elérése továbbra is jelentős kihívást jelent. Ez azt jelenti, hogy a hosszabb beszédszakaszok során a modell hajlamos lehet elveszíteni a logikai kapcsolatot vagy ismétlődővé válni. A kutatók szerint ez a probléma a jövőbeli fejlesztések egyik fő fókusza lesz.
Kapcsolódó: Kvantálási hibák csökkentése LLM-eknél
A kutatás eredményeit a GitHubon tették közzé, és a publikáció a 2026-os Interspeech konferencián került bemutatásra. A munka az Apple-nél zajlott, de a kutatók között szerepel a Google és más intézmények képviselői is.
Kapcsolódó: FLUID adaptál GPT-modelleket diffúzióhoz