Gemini 2.5 Flash emberi pontossággal bírál hangbeszélgetéseket
A Google DeepMind kutatása szerint a Gemini 2.5 Flash modell megbízhatóan értékeli a teljes duplex beszélgetéseket, így jelentősen csökkenhetnek az értékelési költségek.

A Google DeepMind kutatói kimutatták, hogy a Gemini 2.5 Flash modell képes emberi szintű pontossággal értékelni a teljes duplex hangügynökök beszélgetéseit. Az LLM-as-a-Judge módszerrel végzett tesztek azt mutatják, hogy a modell megbízhatósága a legtöbb dimenzióban megegyezik az emberi értékelőkkel, miközben a költségek töredékére csökkenthetők — állítja a kutatás, amelyet előnyomtatott formában az arXiv-on tettek közzé.
A vizsgálatban a Gemini 2.5 Flash modellt 209 sztereó ülésen, 152 teljes duplex beszélgetésen és 57 speciálisan injektált hibás klipszen tesztelték. Az eredmények szerint a modell teljesítménye 8 értékelési dimenzióból 5-ben legfeljebb 0,07-tel tért el a páros emberi értékeléstől, és 7 dimenzióban a 95%-os bootstrap konfidencia intervallumok átfedést mutattak. Hat dimenzióból 6-on a Gemini 2.5 Flash 60-92%-ban egyezett meg az emberi értékelők átlagával egy ponton belül — írja a Google DeepMind.
Kapcsolódó: Hangalapú ügynökök tesztelése
Költséghatékony értékelés
Az automatizált értékelés jelentősen csökkenti a költségeket: a kutatás becslései szerint az emberi értékelés nagyjából kétszerese a nagyságrendjének, mint az LLM-alapú munkafolyamat. Ez lehetővé teszi a fejlesztők számára, hogy gyorsabban és hatékonyabban finomítsák a hangügynökök teljesítményét. A kutatás ugyanakkor felhívja a figyelmet arra, hogy a modellváltások esetén mindig újra kell validálni az értékelést, mivel a puszta rangsorolási korreláció nem elegendő.
Kapcsolódó: LAM-értékelés preferenciákkal
A Gemini 3.5 Flash előrelépése
A Gemini család többi tagja közül a 3.5 Flash modell tovább javította az egyezést mind a 8 dimenzióban. Ezzel szemben a 3.1 Pro modell több dimenzióban is elmaradt az emberi értékelőktől, annak ellenére, hogy a rangsorolási korrelációja hasonló volt. A kutatók azonosítottak négy olyan területet, ahol a modell bevezetése különös óvatosságot igényel, és ahol a teljesítménye még nem éri el az emberi szintet. A Newcombe-Wilson 95%-os konfidencia intervallumok alapján a Gemini 2.5 Flash 48-ból 45 esetben mutatott hasonló vagy jobb érzékenységet, mint az emberi értékelők, bár ezek többsége nem bizonyított paritás, hanem alulméretezett nullhipotézis teszt volt.
Kapcsolódó: Kétnyelvű beszéd és költségek
A kutatás eredményei alátámasztják a Gemini 2.5 Flash használatát helyettesítő vagy negyedik értékelőként a támogatott dimenziókban, megnyitva az utat a megbízhatóbb és költséghatékonyabb hangügynökök fejlesztése előtt. A Google DeepMind a jövőben további teszteket tervez a 3.1 Pro modell kalibrálására.
Kapcsolódó: LLM-ügynökök minősége és felfedezések