Suttogó beszédfelismerés
A Whisper a OpenAI nyílt forráskódú automatikus beszédfelismerő rendszere, amely a hangot szöveggé alakítja több mint 90 nyelven.
Áttekintés
It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.
Mély merülés
A OpenAI által 2022 szeptemberében kiadott Whisper egy Transformer-alapú kódoló-dekódoló modell, amely 680 000 órányi többnyelvű, többfeladatos hanganyagra van kiképezve az internetről. A korábbi rendszerekkel ellentétben, amelyekhez tiszta, címkézett adatokra volt szükség, a Whisper tanult a rendetlen valós felvételekből, így rendkívül ellenállóvá tette a hangsúlyokat, a zajt és az áthallást. Egyetlen modell kezeli az átírást, az angolra fordítást, a nyelvi azonosítást és az időbélyegzést. A „pici”-től (39 milliós paraméter) a „nagy”-ig (1,55 B) méretben szállítjuk, így a felhasználók a sebességet a pontosságra cserélhetik. Mivel a súlyok nyíltan engedélyezettek az MIT alatt, a Whisper szinte egyik napról a másikra lett számtalan podcast-átíró, feliratozó eszköz és hangalkalmazás alapértelmezett gerince.
Technikai betekintés
A Whisper 30 másodperces darabokra osztja a hangot, mindegyiket log-Mel spektrogrammá alakítja (80 frekvenciacsatorna), és egy Transformer kódolóba táplálja. A dekóder ezután autoregresszív módon előrejelzi a szövegjogkivonatokat, speciális tokenek vezérelve, amelyek meghatározzák a feladatot (átírás vagy fordítás), a nyelvet és azt, hogy kiadjon-e időbélyegeket. Ez a többfeladatos token-kondicionálás az okos trükk: egy súlykészlet sok feladatot hajt végre a dekódolás kezdetén megadott prompt tokentől függően.
Stratégiai hatás
Hozzáférés és elérés
Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.
Költség és költségvetés
A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.
Sebesség és méretarány
Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.
A suttogó beszédfelismerés jövője
A Whisper olyan gyorsabb származékok hullámát váltotta ki, mint a Whisper.cpp, a gyorsabb suttogás és a desztillált verziók, amelyek valós időben futnak telefonokon és laptopokon. Szorosabb streamelési (alacsony késleltetésű) változatokra, jobb hangszórópárosításra és jobb teljesítményre számíthat alacsony erőforrásigényű nyelveken. Ahogy az eszközön található audio AI növekszik, a könnyű Whisper-stílusú modellek valószínűleg teljesen offline módban jelenítik meg az élő feliratokat, a megbeszéléseket és a kisegítő eszközöket, megőrizve a magánélet védelmét, miközben a felhő szintű pontosságot is kielégítik.
Valós megvalósítás
Kereshető átiratok és feliratok automatikus generálása podcastokhoz és YouTube-videókhoz
Élő találkozó-jegyzet-alkalmazások működtetése, amelyek összefoglalókat készítenek a Zoom vagy a Teams hanganyagából
Idegen nyelvű interjúk közvetlenül angol szövegre fordítása újságírók számára
Hangvezérelt akadálymentesítési eszközök és diktálás létrehozása azon felhasználók számára, akik nem tudnak gépelni
Kockázatok és védőkorlátok
A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.
A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.
A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.
Végrehajtási ütemterv
Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.
Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.
Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.
Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Whisper Speech Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Beszéd Érzelem felismerés
Gyakran ismételt kérdések
What is Whisper Speech Recognition?
A Whisper a OpenAI nyílt forráskódú automatikus beszédfelismerő rendszere, amely a hangot szöveggé alakítja több mint 90 nyelven. Ez azért fontos, mert mindenki számára ingyenesen biztosította az emberhez közeli átírási minőséget, robusztusan dolgozva az akcentusokon, a háttérzajon és a szakzsargonon.
Körülbelül hány órányi hanganyagra képezték ki a Whispert?
A Whispert körülbelül 680 000 órányi többnyelvű, többfeladatos hanganyagra képezték ki, amelyet az internetről gyűjtöttek össze, ami egy szokatlanul nagy és sokszínű adathalmaz.
Milyen köztes reprezentációt számít ki a Whisper a kódoló előtti nyers hangból?
A Whisper minden 30 másodperces hangdarabot 80 csatornás log-Mel spektrogrammá alakít, amelyet a Transformer kódoló dolgoz fel.
Hogyan hajt végre egyetlen Whisper-modell több feladatot, például átírást és fordítást?
A dekódolás kezdetén olyan feltételeket suttogjon a speciális tokeneken, amelyek megmondják a nyelvet, a feladatot és azt, hogy küldjön-e időbélyeget.
Milyen általános neurális architektúrát használ a Whisper?
A Whisper egy kódoló-dekódoló Transformer: a kódoló beolvassa a spektrogramot, a dekódoló pedig autoregresszív módon generál szöveges tokeneket.
Miért tartják a Whispert különösen robusztusnak a korábbi ASR rendszerekhez képest?
A hatalmas mennyiségű változatos, valós hangzás (ékezetek, zaj, áthallás) képzése a Whispernek erős, azonnali robusztusságot adott tartományonkénti hangolás nélkül.