Аудіо AI GUIDE

Повнодуплексне мовлення Moshi

Moshi — це голосовий штучний інтелект із відкритим вихідним кодом у режимі реального часу від Kyutai, який розмовляє та слухає одночасно — у дуплексному режимі — замість чіткої черги.

2 хвилини читанняОстаннє оновлення

Огляд

That removes the awkward lag and rigid turn-taking of traditional voice assistants.

Глибоке занурення

Moshi, випущений французькою лабораторією Kyutai у 2024 році, є основною моделлю синтезу мовлення, розробленою для природної розмови з низькою затримкою. На відміну від конвеєрних помічників, які об’єднують мовлення в текст, потім мовну модель, а потім текст у мовлення, Moshi обробляє аудіо безпосередньо та постійно. Його ключова ідея полягає в повному дуплексі: він одночасно моделює два аудіопотоки — користувальницький і власний — щоб він міг слухати під час розмови, обробляти переривання, передавати зворотний канал за допомогою «mhm» і природно накладатися, як це роблять люди. Він досягає затримки близько 160-200 мілісекунд, що набагато нижче типової затримки асистента. Під капотом він поєднує модель мови тексту та аудіо з параметрами 7B (Helium) із Mimi, нейронним аудіокодеком, який стискає мову в окремі токени, які модель може генерувати. Кютай відкрито оприлюднив ваги та код.

Технічне розуміння

Фокус Moshi полягає в його кодеку Mimi, який перетворює безперервне аудіо в потік дискретних токенів із низькою швидкістю передачі даних із частотою 12,5 Гц, включаючи дистильований семантичний токен. Мовна модель передбачає свої власні мовні маркери та токени користувача в паралельних потоках, вирівняних у часі, тому генерація ніколи не повинна зупинятися, щоб «прослухати». Метод «внутрішнього монологу» передбачає текст перед звуком, покращуючи лінгвістичну якість і зв’язність того, що насправді говорить Моші.

Стратегічний вплив

Доступ і охоплення

Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.

Вартість і бюджет

Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.

Швидкість і масштаб

Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.

Майбутнє повнодуплексного мовлення Moshi

Повнодуплексне моделювання стає шаблоном для природного голосового штучного інтелекту, що впливає на системи в усій галузі. Очікуйте менших версій на пристрої, багатомовної підтримки, меншої затримки та інтеграції в агенти, службу підтримки та інструменти доступності. Оскільки Moshi відкритий, дослідники можуть вільно досліджувати та вдосконалювати його. Проблеми залишаються пов’язані з достовірністю фактів, безпекою в мовленні, що збігається, і емоційним нюансом, але перехід від жорсткої черги до плавної розмови, яка переривається, ймовірно, буде постійним.

Реалізація в реальному світі

Голосовий співрозмовник, якого ви можете переривати на півслові, відповідаючи менше ніж за 200 мілісекунд.

Базовий рівень відкритих досліджень для вивчення повнодуплексного голосового діалогу в режимі реального часу без власних чорних ящиків.

Асистенти доступності, які плавно спілкуються з користувачами, яким потрібен швидкий і природний обмін даними.

Створення прототипів переривчастих голосових ботів служби підтримки клієнтів, які передають зворотний канал і реагують, поки абонент ще говорить.

Ризики та огорожі

Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.

Точність може впасти через акценти, діалекти чи шумне середовище.

Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.

Дорожня карта впровадження

1

Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.

2

Перевірте якість на різних динаміках і фонових умовах.

3

Визначте, коли людина повинна переглядати або затверджувати результати.

4

Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Moshi Full-Duplex Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Нормалізація тексту для мовлення

Часті запитання

What is Moshi Full-Duplex Speech?

Moshi — це голосовий штучний інтелект із відкритим вихідним кодом у режимі реального часу від Kyutai, який розмовляє та слухає одночасно — у дуплексному режимі — замість чіткої черги. Це усуває незручну затримку та жорстку чергування традиційних голосових помічників.

Що означає «повний дуплекс» у контексті Moshi?

Повний дуплекс означає, що модель обробляє вхідний і вихідний звук одночасно, тож вона може слухати під час розмови та природно обробляти переривання.

Яка організація випустила Moshi?

Moshi була розроблена та відкрита Kyutai, французькою дослідницькою лабораторією ШІ, у 2024 році.

Що таке Мімі в системі Moshi?

Mimi — це нейронний аудіокодек, який стискає безперервне мовлення в потік окремих токенів із низькою швидкістю передачі даних, які може генерувати модель.

Чим Moshi відрізняється від традиційного конвеєра голосового помічника?

Традиційні помічники з’єднують мовлення в текст, мовну модель і перетворення тексту в мовлення; Moshi — це єдина модель мовлення, яка безперервно обробляє аудіо.

На яку приблизно затримку розмови орієнтується Moshi?

Moshi досягає затримки близько 160-200 мс, що набагато менше, ніж у типових голосових помічників, що забезпечує природне перекриття та переривання.