Hviske talegjenkjenning
Whisper er OpenAIs åpen kildekode automatiske talegjenkjenningssystem som gjør lyd til tekst på tvers av 90+ språk.
Oversikt
It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.
Dypdykk
Whisper ble utgitt av OpenAI i september 2022, og er en transformatorbasert koder-dekoder-modell som er trent på 680 000 timer med flerspråklig, multioppgavelyd skrapet fra nettet. I motsetning til tidligere systemer som trengte rene, merkede data, lærte Whisper fra rotete opptak fra den virkelige verden, noe som gjorde den bemerkelsesverdig motstandsdyktig mot aksenter, støy og krysstale. En enkelt modell håndterer transkripsjon, oversettelse til engelsk, språkidentifikasjon og tidsstempling. Den leveres i størrelser fra 'liten' (39M parametere) til 'stor' (1,55B), slik at brukerne kan bytte hastighet for nøyaktighet. Fordi vektene er åpent lisensiert under MIT, ble Whisper standard ryggraden for utallige podcast-transkriberere, tekstingsverktøy og stemmeapper nesten over natten.
Teknisk innsikt
Whisper deler opp lyden i 30-sekunders biter, konverterer hver til et log-Mel-spektrogram (80 frekvenskanaler) og mater det til en Transformer-koder. Dekoderen forutsier deretter tekstsymboler autoregressivt, styrt av spesielle tokens som spesifiserer oppgaven (transkribere vs. oversette), språk og om tidsstempler skal sendes ut. Denne multitask-token-kondisjoneringen er det smarte trikset: ett sett med vekter utfører mange jobber, avhengig av promptene som ble levert ved starten av dekodingen.
Strategisk innvirkning
Access and reach
Det forbedrer tilgjengeligheten gjennom transkripsjon, fortellerstemme og stemmegrensesnitt.
Cost and budget
Medieteam kan sende polert lyd raskere med mindre budsjetter.
Speed and scale
Kundevendte systemer kan behandle talte interaksjoner i større skala.
The Future of Whisper Speech Recognition
Whisper utløste en bølge av raskere derivater som Whisper.cpp, faster-whisper og destillerte versjoner som kjører i sanntid på telefoner og bærbare datamaskiner. Forvent strammere streaming (lav latens) varianter, bedre høyttalerdiaarisering sammenkoblet med den, og sterkere ytelse på lavressursspråk. Etter hvert som lyd-AI på enheten vokser, vil lette modeller i Whisper-stil sannsynligvis drive live-teksting, møtenotater og tilgjengelighetsverktøy helt offline, og bevare personvernet samtidig som de samsvarer med nøyaktighet i skygrad.
Real-World Implementering
Automatisk generering av søkbare transkripsjoner og bildetekster for podcaster og YouTube-videoer
Driver live møtenotater-apper som produserer sammendrag fra Zoom eller Teams-lyd
Oversettelse av fremmedspråklige intervjuer direkte til engelsk tekst for journalister
Bygge stemmestyrte tilgjengelighetsverktøy og diktering for brukere som ikke kan skrive
Risikoer og rekkverk
Risikoen for stemmemisbruk og etterligning øker når samtykke mangler.
Nøyaktigheten kan falle på tvers av aksenter, dialekter eller støyende omgivelser.
Syntetisk lyd kan forveksles med autentisk tale uten tydelig merking.
Veikart for implementering
Innhent eksplisitt samtykke for stemmefangst, kloning og gjenbruk.
Test kvalitet på tvers av forskjellige høyttalere og bakgrunnsforhold.
Definer når et menneske må gjennomgå eller godkjenne utdata.
Merk syntetisk lyd og oppbevar herkomstregistreringer for ansvarlighet.
Fortsett å utforske
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Whisper Speech Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Neste guide
Talefølelsesgjenkjenning
Ofte stilte spørsmål
What is Whisper Speech Recognition?
Whisper er OpenAIs åpen kildekode automatiske talegjenkjenningssystem som gjør lyd til tekst på tvers av 90+ språk. Det er viktig fordi det brakte nesten-menneskelig transkripsjonskvalitet gratis til alle, og jobber robust med aksenter, bakgrunnsstøy og teknisk sjargong.
Omtrent hvor mange timer med lyd ble Whisper trent på?
Whisper ble trent på rundt 680 000 timer med flerspråklig, multitask-lyd samlet inn fra nettet, et uvanlig stort og mangfoldig datasett.
Hvilken mellomrepresentasjon beregner Whisper fra rå lyd før koderen?
Whisper konverterer hver 30-sekunders lydbit til et 80-kanals log-Mel-spektrogram, som Transformer-koderen behandler.
Hvordan utfører en enkelt Whisper-modell flere oppgaver som transkripsjon og oversettelse?
Hvisk betingelser på spesielle tokens i starten av dekodingen som forteller den språket, oppgaven og om den skal sende ut tidsstempler.
Hvilken generell nevrale arkitektur bruker Whisper?
Whisper er en koder-dekoder-transformator: koderen leser spektrogrammet og dekoderen genererer teksttokens autoregressivt.
Hvorfor anses Whisper som spesielt robust sammenlignet med tidligere ASR-systemer?
Trening på enorme mengder variert, virkelig lyd (aksenter, støy, krysstale) ga Whisper sterk ut-av-boksen robusthet uten tuning per domene.