ÉlőUtoljára: 11 órájaMa: 0
Modellek & LLMfrissítve: 17:10

Az OpenAI Whisper modellje felismeri és fordítja a beszédet

Az OpenAI bemutatta a Whisper modellt, amely egy általános célú beszédfelismerő rendszer. A modell hat különböző méretben érhető el, és képes többnyelvű beszédfelismerésre, beszédfordításra és nyelvazonosításra.

Az OpenAI Whisper modellje felismeri és fordítja a beszédet
Fotó: Jan Antonin Kolar / Unsplash
forrás: Hetzner: GitHub Trending (AI)·AI Forradalom szerk.·
Megosztás

Több feladat egy modellben

A Whisper egy Transformer szekvencia-szekvencia modell, amelyet különféle beszédprocesszálási feladatokra optimalizáltak. Ezeket a feladatokat — mint a többnyelvű beszédfelismerés, beszédfordítás, beszélt nyelv azonosítása és hangaktivitás-detektálás — egyetlen modell képes kezelni, kiváltva ezzel a hagyományos beszédfeldolgozási folyamatok több lépcsős felépítését.

Hat modellméret a sebesség és pontosság egyensúlyáért

Az OpenAI hat különböző méretű modellt kínál a Whisperhez, amelyek sebesség és pontosság tekintetében eltérő kompromisszumokat kínálnak. A legkisebb, „tiny” modell körülbelül 1 GB VRAM-ot igényel, míg a „large” modell 10 GB-ot. A „turbo” modell a „large-v3” optimalizált változata, amely gyorsabb transzkripciós sebességet biztosít minimális pontosságvesztéssel.

Kapcsolódó: beszédfelismerési ranglista

Telepítés és használat

A Whisper telepítése Python 3.9.9 és PyTorch 1.10.1 környezetben történt, de kompatibilis a Python 3.8-3.11 verzióival. A telepítéshez szükséges a ffmpeg parancssori eszköz is. A parancssori felületen a whisper audio.flac --model turbo paranccsal indítható a hangfájlok transzkripciója. Pythonból a whisper.load_model() és model.transcribe() metódusokkal használható a modell.

Kapcsolódó: GPT-5 érvelés

Licenc és elérhetőség

A Whisper kódja és modell súlyai MIT licenc alatt érhetők el. A modell a PyTorch 1.10.1 és a Python 3.9.9-en keresztül érhető el, ahol a whisper.load_model() metódussal tölthető be a modell, és a model.transcribe() metódussal végezhető el a hangfájlok transzkripciója.

tetszett a cikk? oszd meg →
Megosztás

Tetszik az oldal? Támogasd a fejlesztést

Az AI Forradalom egy automatizált pipeline: napi adatgyűjtés, LLM-feldolgozás és infrastruktúra fenntartása valódi költségekkel jár. Ha értékesnek találod a tömör, naprakész AI-összefoglalókat, egy kávé sokat segít.

Támogatom