GUIDE de l'IA audio

Reconnaissance vocale chuchotée

Whisper est le système de reconnaissance vocale automatique open source de OpenAI qui transforme l'audio en texte dans plus de 90 langues.

2 minutes de lectureDernière mise à jour

Aperçu

It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.

Plongée profonde

Lancé par OpenAI en septembre 2022, Whisper est un modèle d'encodeur-décodeur basé sur Transformer, formé sur 680 000 heures d'audio multilingue et multitâche extrait du Web. Contrairement aux systèmes précédents qui nécessitaient des données propres et étiquetées, Whisper a appris des enregistrements désordonnés du monde réel, ce qui le rend remarquablement résistant aux accents, au bruit et à la diaphonie. Un modèle unique gère la transcription, la traduction vers l'anglais, l'identification de la langue et l'horodatage. Il est livré dans des tailles allant de « minuscule » (39 millions de paramètres) à « grande » (1,55 B), permettant aux utilisateurs d'échanger la vitesse contre la précision. Étant donné que les poids sont sous licence ouverte du MIT, Whisper est devenu l'épine dorsale par défaut d'innombrables transcripteurs de podcasts, outils de sous-titrage et applications vocales presque du jour au lendemain.

Aperçu technique

Whisper divise l'audio en morceaux de 30 secondes, convertit chacun en un spectrogramme log-Mel (80 canaux de fréquence) et l'envoie à un encodeur Transformer. Le décodeur prédit ensuite les jetons de texte de manière autorégressive, guidé par des jetons spéciaux qui spécifient la tâche (transcrire ou traduire), la langue et s'il faut émettre des horodatages. Ce conditionnement de jetons multitâches est une astuce astucieuse : un ensemble de poids effectue de nombreuses tâches en fonction des jetons d'invite fournis au début du décodage.

Impact stratégique

Accès et portée

Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.

Coût et budget

Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.

Vitesse et échelle

Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.

L'avenir de la reconnaissance vocale chuchotée

Whisper a déclenché une vague de dérivés plus rapides comme Whisper.cpp, des versions plus rapides et distillées qui fonctionnent en temps réel sur les téléphones et les ordinateurs portables. Attendez-vous à des variantes de streaming plus serrées (à faible latence), à ​​une meilleure diarisation des locuteurs et à de meilleures performances sur les langues à faibles ressources. À mesure que l’IA audio sur appareil se développe, les modèles légers de type Whisper alimenteront probablement les sous-titres en direct, les notes de réunion et les outils d’accessibilité entièrement hors ligne, préservant ainsi la confidentialité tout en correspondant à la précision du cloud.

Mise en œuvre dans le monde réel

Génération automatique de transcriptions et de sous-titres consultables pour les podcasts et les vidéos YouTube

Alimenter des applications de notes de réunion en direct qui produisent des résumés à partir de l'audio Zoom ou Teams

Traduire des interviews en langue étrangère directement en texte anglais pour les journalistes

Création d'outils d'accessibilité à commande vocale et de dictée pour les utilisateurs qui ne savent pas taper

Risques et garde-fous

Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.

La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.

L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.

Feuille de route de mise en œuvre

1

Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.

2

Testez la qualité sur divers locuteurs et conditions d’arrière-plan.

3

Définissez quand un humain doit examiner ou approuver les résultats.

4

Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Whisper Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Reconnaissance des émotions vocales

Questions fréquemment posées

What is Whisper Speech Recognition?

Whisper est le système de reconnaissance vocale automatique open source de OpenAI qui transforme l'audio en texte dans plus de 90 langues. C’est important car il a apporté gratuitement à tout le monde une qualité de transcription quasi humaine, en travaillant de manière robuste sur les accents, le bruit de fond et le jargon technique.

Environ combien d’heures d’audio Whisper a-t-il été formé ?

Whisper a été formé sur environ 680 000 heures d’audio multitâche et multilingue collectées sur le Web, un ensemble de données inhabituellement vaste et diversifié.

Quelle représentation intermédiaire Whisper calcule-t-il à partir de l'audio brut avant l'encodeur ?

Whisper convertit chaque morceau audio de 30 secondes en un spectrogramme log-Mel à 80 canaux, que l'encodeur Transformer traite.

Comment un seul modèle Whisper effectue-t-il plusieurs tâches telles que la transcription et la traduction ?

Chuchotez des conditions sur des jetons spéciaux au début du décodage qui lui indiquent la langue, la tâche et s'il faut émettre des horodatages.

Quelle architecture neuronale globale Whisper utilise-t-il ?

Whisper est un transformateur codeur-décodeur : l'encodeur lit le spectrogramme et le décodeur génère des jetons de texte de manière autorégressive.

Pourquoi Whisper est-il considéré comme particulièrement robuste par rapport aux systèmes ASR précédents ?

La formation sur d'énormes quantités d'audio variés et réels (accents, bruit, diaphonie) a donné à Whisper une forte robustesse prête à l'emploi sans réglage par domaine.