Разпознаване на шепот
Whisper е автоматичната система за разпознаване на OpenAI с отворен код, която превръща звука в текст на над 90 езика.
Преглед
It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.
Дълбоко гмуркане
Издаден от OpenAI през септември 2022 г., Whisper е модел на енкодер-декодер, базиран на Transformer, обучен на 680 000 часа многоезично, многозадачно аудио, извлечено от мрежата. За разлика от по-ранните системи, които се нуждаеха от чисти, етикетирани данни, Whisper се учи от объркани записи от реалния свят, което го прави забележително устойчив на акценти, шум и пресичане. Един модел обработва транскрипцията, превода на английски език, езиковата идентификация и времевия печат. Доставя се в размери от „малки“ (39M параметри) до „големи“ (1,55B), което позволява на потребителите да заменят скоростта с точност. Тъй като тежестите са открито лицензирани от Масачузетския технологичен институт, Whisper се превърна в гръбнак по подразбиране за безброй транскрибирачи на подкасти, инструменти за надписи и гласови приложения почти за една нощ.
Техническа информация
Whisper разделя аудиото на 30-секундни части, преобразува всяка в log-Mel спектрограма (80 честотни канала) и я подава към енкодер Transformer. След това декодерът предсказва авторегресивно текстови токени, ръководени от специални токени, които уточняват задачата (транскрибиране срещу превод), език и дали да излъчват времеви отпечатъци. Това многозадачно кондициониране на токени е хитрият трик: един набор от тегла изпълнява много задачи в зависимост от подканите токени, предоставени в началото на декодирането.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на разпознаването на шепот
Whisper предизвика вълна от по-бързи производни като Whisper.cpp, faster-whisper и дестилирани версии, които работят в реално време на телефони и лаптопи. Очаквайте по-тесни варианти на стрийминг (с ниска латентност), по-добра диаризация на високоговорителите, съчетана заедно с него, и по-силна производителност на езици с ниски ресурси. Тъй като аудио AI на устройството расте, олекотените модели в стил Whisper вероятно ще захранват надписи на живо, бележки за срещи и инструменти за достъпност изцяло офлайн, запазвайки поверителността, като същевременно отговарят на точността на ниво облак.
Внедряване в реалния свят
Автоматично генериране на преписи и надписи с възможност за търсене за подкасти и видеоклипове в YouTube
Подхранване на приложения за бележки от срещи на живо, които произвеждат резюмета от Zoom или Teams audio
Превод на чуждоезични интервюта директно на английски текст за журналисти
Изграждане на инструменти за достъпност с гласово управление и диктовка за потребители, които не могат да пишат
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Whisper Speech Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Разпознаване на емоционална реч
Frequently asked questions
What is Whisper Speech Recognition?
Whisper е автоматичната система за разпознаване на OpenAI с отворен код, която превръща звука в текст на над 90 езика. Има значение, защото донесе почти човешко качество на транскрипция на всички безплатно, работейки стабилно върху акценти, фонов шум и технически жаргон.
Приблизително на колко часа аудио е бил обучен Whisper?
Whisper беше обучен на около 680 000 часа многоезично, многозадачно аудио, събрано от мрежата, необичайно голям и разнообразен набор от данни.
Какво междинно представяне изчислява Whisper от сурово аудио преди енкодера?
Whisper преобразува всяка 30-секундна аудио част в 80-канална log-Mel спектрограма, която енкодерът Transformer обработва.
Как един модел Whisper изпълнява множество задачи като транскрипция и превод?
Условия за шепнене на специални токени в началото на декодирането, които му казват езика, задачата и дали да излъчва времеви клейма.
Каква цялостна невронна архитектура използва Whisper?
Whisper е енкодер-декодер Transformer: енкодерът чете спектрограмата, а декодерът генерира текстови токени авторегресивно.
Защо Whisper се счита за особено здрав в сравнение с по-ранните ASR системи?
Обучението върху огромни количества разнообразно аудио от реалния свят (акценти, шум, кръстосано смущаване) даде на Whisper силна готовност извън кутията без настройка за всеки домейн.