OpenAI Murmure
Whisper est le système de reconnaissance vocale automatique open source de OpenAI qui transcrit et traduit l'audio parlé dans des dizaines de langues.
Aperçu
C’est important car il a apporté une transcription robuste, gratuite et quasi-humaine à toute personne capable d’exécuter le modèle.
Plongée profonde
Sorti en septembre 2022, Whisper a été formé sur environ 680 000 heures d’audio multilingue et multitâche collectées sur le Web. Cet ensemble de données énorme et varié est le secret de sa robustesse : il gère bien mieux les accents, le bruit de fond et le jargon technique que les systèmes plus anciens, sans avoir besoin d'être affiné pour chaque nouveau domaine. Whisper peut transcrire le discours dans la langue d'origine, traduire le discours de nombreuses langues vers l'anglais, identifier la langue parlée et ajouter des horodatages. OpenAI a publié ouvertement les poids et le code du modèle, de sorte qu'il s'exécute localement sur un ordinateur portable ou dans un centre de données, ce qui a alimenté une explosion d'outils communautaires, des réimplémentations plus rapides et des applications construites dessus. La précision varie selon la langue et la qualité audio, et comme tous ces systèmes, il peut parfois « halluciner » le texte.
Aperçu technique
Whisper est un encodeur-décodeur Transformer formé comme une tâche séquence à séquence. L'audio est converti en un spectrogramme log-Mel, une représentation visuelle des fréquences au fil du temps, que l'encodeur traite. Le décodeur prédit ensuite les jetons de texte, conditionnés par des jetons spéciaux qui indiquent au modèle quelle tâche effectuer : transcrire, traduire, détecter la langue ou ajouter des horodatages. Parce qu’il a appris de l’audio Web faiblement étiqueté sur de nombreuses tâches à la fois, un modèle unique généralise largement au lieu d’être adapté à une référence étroite.
Impact stratégique
Accès et portée
Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.
Coût et budget
Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.
Vitesse et échelle
Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.
L'avenir de OpenAI Whisper
Whisper est devenu un élément de base par défaut pour la transcription, et la tendance est à des variantes plus rapides, plus petites et en temps réel qui s'exécutent sur les téléphones et les appareils périphériques. Attendez-vous à une prise en charge du streaming plus stricte, à une meilleure séparation des locuteurs et à une intégration avec de grands modèles linguistiques pour le nettoyage, le résumé et le sous-titrage en direct. Les pondérations ouvertes signifient que la communauté continue de l'optimiser, tandis que OpenAI et d'autres proposent de nouveaux modèles vocaux. La réduction des textes hallucinés, notamment à usage médical et juridique, reste une priorité active.
Mise en œuvre dans le monde réel
Un journaliste transcrit automatiquement les interviews enregistrées au lieu de les taper à la main
Une plateforme de podcast génère des transcriptions et des sous-titres consultables pour chaque épisode
Un outil de réunion produit des sous-titres en direct et un enregistrement écrit d'un appel vidéo
Un chercheur traduit des enregistrements de terrain en langue parlée en texte anglais pour analyse
Risques et garde-fous
Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.
La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.
L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.
Feuille de route de mise en œuvre
Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.
Testez la qualité sur divers locuteurs et conditions d’arrière-plan.
Définissez quand un humain doit examiner ou approuver les résultats.
Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the OpenAI Whisper quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Alignement des mots horodatés Whisper
Questions fréquemment posées
Qu'est-ce que le murmure OpenAI ?
Whisper est le système de reconnaissance vocale automatique open source de OpenAI qui transcrit et traduit l'audio parlé dans des dizaines de langues. C’est important car il a apporté une transcription robuste, gratuite et quasi-humaine à toute personne capable d’exécuter le modèle.
Quel est le but principal du murmure de OpenAI ?
Whisper est un système de reconnaissance vocale automatique qui transcrit et traduit l'audio parlé dans de nombreuses langues.
À peu près sur quelle quantité d’audio Whisper a-t-il été formé ?
Whisper a été formé sur environ 680 000 heures d'audio multilingue et multitâche collectées sur le Web, ce qui explique sa robustesse.
Quelle représentation de l'audio l'encodeur de Whisper traite-t-il ?
L'audio est converti en un spectrogramme log-Mel, une représentation du contenu fréquentiel au fil du temps, que l'encodeur du Transformer lit.
Quelle fonctionnalité Whisper NE fournit PAS nativement ?
Whisper gère la transcription, la traduction vers l'anglais, la détection de langue et l'horodatage, mais ce n'est pas un générateur vidéo.
Pourquoi Whisper a-t-il déclenché une vague d'outils et d'applications communautaires ?
Étant donné que OpenAI a fourni les poids et le code en open source, les développeurs ont pu exécuter Whisper localement et créer de nombreux outils et des réimplémentations plus rapides.