Valós idejű fordítást hoz a Google Gemini 3.5 Live Translate — 70+ nyelven
A Gemini 3.5 Live Translate modellje képes a beszéd természetes áramlását és hangsúlyait megtartani, ami jelentősen javítja a fordítás érthetőségét és természetességét.

A Google bemutatta a Gemini 3.5 Live Translate-et, legújabb hangalapú modelljét, amely valós idejű, hangról hangra történő fordítást kínál több mint 70 nyelven. A modell automatikusan felismeri a nyelveket, és sima, természetes hangzású fordítást generál, amely megőrzi a beszélő intonációját, ritmusát és hangmagasságát — közölte a Google AI Blog.
Az új rendszer nem várja meg, amíg a beszélő befejezi mondatát, hanem folyamatosan generálja a fordítást, egyensúlyozva a minőség javításához szükséges kontextus és a beszélővel való szinkronban maradás érdekében szükséges azonnali fordítás között.
Kapcsolódó: Google Gemini 3.1
A Gemini 3.5 Live Translate modelljének képességei
Ez akadozás nélküli, folyékony hangátvitelt tesz lehetővé, mindössze néhány másodperccel maradva el a beszélőtől. A modell támogatja a zajos környezeteket is, és képes több mint 2000 nyelvi kombinációt kezelni egyetlen találkozón belül.
Kapcsolódó: AI beszédtechnológia
Elérhetőség és partnerség
A fejlesztők olyan platformokon, mint az Agora, a Fishjam, a LiveKit, a Pipecat és a Vision Agents, már használhatják a Gemini Live API-t hangfordító alkalmazások létrehozásához. A Grab nevű partnerük teszteli a modellt a sofőrök és az utasok közötti valós idejű kommunikáció megkönnyítése érdekében. A Google Translate alkalmazásban a Live translate funkció használatakor a rendszer a beszélő hangszínét tükröző, zökkenőmentes fordítást biztosít, a SynthID vízjelzéssel ellátva a félretájékoztatás megakadályozása érdekében, a Gemini 3.5 Live Translate modellje a Google Meetben és a Google Translate alkalmazásban lesz elérhető.
Kapcsolódó: Csendes hangleváltás