Распознавание шепотной речи
Whisper — это система автоматического распознавания речи с открытым исходным кодом OpenAI, которая преобразует звук в текст на более чем 90 языках.
Обзор
It matters because it brought near-human transcription quality to everyone for free, working robustly on accents, background noise, and technical jargon.
Глубокое погружение
Whisper, выпущенный OpenAI в сентябре 2022 года, представляет собой модель кодера-декодера на основе Transformer, обученную на 680 000 часов многоязычного и многозадачного аудио, полученного из Интернета. В отличие от более ранних систем, которым требовались чистые, размеченные данные, Whisper учился на беспорядочных реальных записях, что делало его удивительно устойчивым к акцентам, шуму и перекрестным помехам. Одна модель обрабатывает транскрипцию, перевод на английский язык, идентификацию языка и временную метку. Он поставляется в размерах от «крошечных» (39 миллионов параметров) до «больших» (1,55 миллиарда), что позволяет пользователям жертвовать скоростью ради точности. Поскольку веса открыто лицензируются MIT, Whisper почти за одну ночь стал основой по умолчанию для бесчисленных транскрибаторов подкастов, инструментов субтитров и голосовых приложений.
Техническая информация
Whisper разбивает звук на 30-секундные фрагменты, преобразует каждый в спектрограмму log-Mel (80 частотных каналов) и передает ее на кодер Transformer. Затем декодер прогнозирует текстовые токены авторегрессионно, руководствуясь специальными токенами, которые определяют задачу (расшифровка или перевод), язык и необходимость выдачи меток времени. Такое многозадачное согласование токенов является хитрым трюком: один набор весов выполняет множество работ в зависимости от токенов приглашения, предоставленных в начале декодирования.
Стратегическое воздействие
Доступ и охват
Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.
Стоимость и бюджет
Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.
Скорость и масштаб
Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.
Будущее распознавания шепотной речи
Whisper вызвал волну более быстрых производных, таких как Whisper.cpp, fast-whisper и дистиллированных версий, которые работают в реальном времени на телефонах и ноутбуках. Ожидайте более плотные варианты потоковой передачи (с низкой задержкой), лучшую синхронизацию говорящих в сочетании с ней и более высокую производительность на языках с низким уровнем ресурсов. По мере развития искусственного интеллекта на устройстве легкие модели в стиле Whisper, скорее всего, будут обеспечивать живые субтитры, заметки о встречах и инструменты обеспечения специальных возможностей полностью в автономном режиме, сохраняя конфиденциальность и обеспечивая при этом точность облачного уровня.
Реальная реализация
Автоматическое создание расшифровок и подписей для подкастов и видео на YouTube с возможностью поиска.
Использование приложений для заметок о собраниях в режиме реального времени, которые создают сводки из аудио Zoom или Teams.
Перевод интервью на иностранном языке непосредственно на английский текст для журналистов
Создание инструментов доступности с голосовым управлением и диктовки для пользователей, которые не умеют печатать.
Риски и ограничения
Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.
Точность может снижаться из-за акцентов, диалектов или шумной обстановки.
Синтетический звук можно принять за аутентичную речь без четкой маркировки.
Дорожная карта реализации
Получите явное согласие на захват, клонирование и повторное использование голоса.
Проверьте качество звука при использовании различных динамиков и фоновых условий.
Определите, когда человек должен проверять или утверждать результаты.
Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Whisper Speech Recognition quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Распознавание речевых эмоций
Часто задаваемые вопросы
What is Whisper Speech Recognition?
Whisper — это система автоматического распознавания речи с открытым исходным кодом OpenAI, которая преобразует звук в текст на более чем 90 языках. Это важно, потому что оно бесплатно предоставило каждому качество транскрипции, близкое к человеческому, тщательно работая над акцентами, фоновым шумом и техническим жаргоном.
Примерно на скольких часах аудио тренировался Whisper?
Whisper обучался на около 680 000 часов многоязычного и многозадачного аудио, собранного из Интернета — необычайно большого и разнообразного набора данных.
Какое промежуточное представление Whisper вычисляет из необработанного аудио перед кодировщиком?
Whisper преобразует каждый 30-секундный фрагмент аудио в 80-канальную спектрограмму log-Mel, которую обрабатывает кодер Transformer.
Как одна модель Whisper выполняет несколько задач, таких как транскрипция и перевод?
Условия шепота для специальных токенов в начале декодирования, которые сообщают ему язык, задачу и необходимость выдачи меток времени.
Какую общую нейронную архитектуру использует Whisper?
Whisper — это преобразователь кодер-декодер: кодер считывает спектрограмму, а декодер генерирует текстовые токены авторегрессионным способом.
Почему Whisper считается особенно надежным по сравнению с более ранними системами ASR?
Обучение на огромном количестве разнообразного реального звука (акценты, шум, перекрестные помехи) обеспечило Whisper высокую надежность без дополнительной настройки для каждого домена.