Az OpenAI Whisper modellje felismeri és fordítja a beszédet
Az OpenAI bemutatta a Whisper modellt, amely egy általános célú beszédfelismerő rendszer. A modell hat különböző méretben érhető el, és képes többnyelvű beszédfelismerésre, beszédfordításra és nyelvazonosításra.

Több feladat egy modellben
A Whisper egy Transformer szekvencia-szekvencia modell, amelyet különféle beszédprocesszálási feladatokra optimalizáltak. Ezeket a feladatokat — mint a többnyelvű beszédfelismerés, beszédfordítás, beszélt nyelv azonosítása és hangaktivitás-detektálás — egyetlen modell képes kezelni, kiváltva ezzel a hagyományos beszédfeldolgozási folyamatok több lépcsős felépítését.
Hat modellméret a sebesség és pontosság egyensúlyáért
Az OpenAI hat különböző méretű modellt kínál a Whisperhez, amelyek sebesség és pontosság tekintetében eltérő kompromisszumokat kínálnak. A legkisebb, „tiny” modell körülbelül 1 GB VRAM-ot igényel, míg a „large” modell 10 GB-ot. A „turbo” modell a „large-v3” optimalizált változata, amely gyorsabb transzkripciós sebességet biztosít minimális pontosságvesztéssel.
Kapcsolódó: beszédfelismerési ranglista
Telepítés és használat
A Whisper telepítése Python 3.9.9 és PyTorch 1.10.1 környezetben történt, de kompatibilis a Python 3.8-3.11 verzióival. A telepítéshez szükséges a ffmpeg parancssori eszköz is. A parancssori felületen a whisper audio.flac --model turbo paranccsal indítható a hangfájlok transzkripciója. Pythonból a whisper.load_model() és model.transcribe() metódusokkal használható a modell.
Kapcsolódó: GPT-5 érvelés
Licenc és elérhetőség
A Whisper kódja és modell súlyai MIT licenc alatt érhetők el. A modell a PyTorch 1.10.1 és a Python 3.9.9-en keresztül érhető el, ahol a whisper.load_model() metódussal tölthető be a modell, és a model.transcribe() metódussal végezhető el a hangfájlok transzkripciója.