Аудио РУКОВОДСТВО ПО ИИ

Полнодуплексная речь Моши

Moshi — это голосовой искусственный интеллект с открытым исходным кодом, работающий в реальном времени от компании Kyutai, который говорит и слушает одновременно — в полнодуплексном режиме — вместо того, чтобы делать резкие повороты.

2 минуты чтенияПоследнее обновление

Обзор

That removes the awkward lag and rigid turn-taking of traditional voice assistants.

Глубокое погружение

Moshi, выпущенный французской лабораторией Kyutai в 2024 году, представляет собой базовую модель преобразования речи в речь, созданную для естественного разговора с малой задержкой. В отличие от конвейерных помощников, которые связывают речь в текст, затем языковую модель, а затем текст в речь, Moshi обрабатывает звук напрямую и непрерывно. Его ключевая идея — полнодуплексный режим: он одновременно моделирует два аудиопотока — пользовательский и собственный — поэтому может слушать во время разговора, обрабатывать прерывания, использовать обратный канал с «ммм» и естественным образом перекрываться, как это делают люди. Задержка достигает около 160–200 миллисекунд, что намного ниже типичной задержки помощника. Под капотом он сочетает в себе 7B-параметрическую языковую модель текста и звука (Helium) с Mimi, нейронным аудиокодеком, который сжимает речь в дискретные токены, которые может генерировать модель. Кютай открыто опубликовал веса и код.

Техническая информация

Хитрость Moshi заключается в кодеке Mimi, который превращает непрерывный звук в поток дискретных токенов с низким битрейтом и частотой 12,5 Гц, включая дистиллированный семантический токен. Языковая модель прогнозирует свои собственные речевые токены и пользовательские в параллельных, синхронизированных по времени потоках, поэтому генерации никогда не приходится останавливаться, чтобы «прослушать». Метод «Внутренний монолог» предсказывает текст перед звуком, улучшая лингвистическое качество и связность того, что на самом деле говорит Моши.

Стратегическое воздействие

Доступ и охват

Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.

Стоимость и бюджет

Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.

Скорость и масштаб

Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.

Будущее полнодуплексной речи Moshi

Полнодуплексное моделирование становится шаблоном для естественного голосового искусственного интеллекта, оказывая влияние на системы во всей отрасли. Ожидайте меньшие версии для устройств, многоязычную поддержку, меньшую задержку и интеграцию с агентами, службой поддержки клиентов и инструментами обеспечения специальных возможностей. Поскольку Moshi открыт, исследователи могут свободно исследовать и улучшать его. Проблемы остаются с фактической достоверностью, безопасностью дублирования речи и эмоциональными нюансами, но переход от жесткой очередности к плавному, прерываемому разговору, вероятно, будет постоянным.

Реальная реализация

Голосовой компаньон без помощи рук, который можно прервать на полуслове и ответить менее чем за 200 миллисекунд.

Открытая исследовательская база для изучения полнодуплексного разговорного диалога в реальном времени без использования фирменных черных ящиков.

Помощники по обеспечению специальных возможностей, которые плавно общаются с пользователями, которым требуется быстрое и естественное перемещение вперед и назад.

Создание прототипов прерываемых голосовых ботов для обслуживания клиентов, которые работают по обратному каналу и реагируют, пока звонящий еще говорит.

Риски и ограничения

Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.

Точность может снижаться из-за акцентов, диалектов или шумной обстановки.

Синтетический звук можно принять за аутентичную речь без четкой маркировки.

Дорожная карта реализации

1

Получите явное согласие на захват, клонирование и повторное использование голоса.

2

Проверьте качество звука при использовании различных динамиков и фоновых условий.

3

Определите, когда человек должен проверять или утверждать результаты.

4

Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Moshi Full-Duplex Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Нормализация текста для речи

Часто задаваемые вопросы

What is Moshi Full-Duplex Speech?

Moshi — это голосовой искусственный интеллект с открытым исходным кодом, работающий в реальном времени от компании Kyutai, который говорит и слушает одновременно — в полнодуплексном режиме — вместо того, чтобы делать резкие повороты. Это устраняет неловкую задержку и жесткую очередность традиционных голосовых помощников.

Что означает «полнодуплексный режим» в контексте Moshi?

Полнодуплексный режим означает, что модель обрабатывает входящий и исходящий звук одновременно, поэтому она может слушать во время разговора и естественным образом обрабатывать прерывания.

Какая организация освободила Моши?

Moshi был разработан и открыт с открытым исходным кодом французской исследовательской лабораторией искусственного интеллекта Kyutai в 2024 году.

Что такое Мими в системе Моши?

Mimi — это нейронный аудиокодек, который сжимает непрерывную речь в низкобитовый поток дискретных токенов, которые может генерировать модель.

Чем Moshi отличается от традиционного голосового помощника?

Традиционные помощники связывают речь в текст, языковую модель и текст в речь; Moshi — это единая модель преобразования речи в речь, которая непрерывно обрабатывает звук.

На какую примерно задержку разговора ориентируется Moshi?

Moshi обеспечивает задержку около 160–200 мс, что намного ниже, чем у обычных голосовых помощников, что обеспечивает естественное перекрытие и прерывание.