Moshi Full-Duplex Speech
Moshi е гласов AI с отворен код в реално време от Kyutai, който говори и слуша едновременно — пълен дуплекс — вместо да се редува строго.
Преглед
That removes the awkward lag and rigid turn-taking of traditional voice assistants.
Дълбоко гмуркане
Moshi, пуснат от френската лаборатория Kyutai през 2024 г., е основен модел за говор към говор, създаден за естествен разговор с ниска латентност. За разлика от тръбопроводните асистенти, които свързват говор към текст, след това езиков модел, след това текст към говор, Moshi обработва аудио директно и непрекъснато. Неговата основна идея е пълен дуплекс: той моделира два аудио потока едновременно – на потребителя и своя собствен – така че да може да слуша, докато говори, да обработва прекъсвания, да предава обратно канал с „mhm“ и да се припокрива естествено, както правят хората. Той достига латентност около 160-200 милисекунди, далеч под типичното забавяне на асистента. Под капака той съчетава 7B-параметър текст-и-аудио езиков модел (Helium) с Mimi, невронен аудио кодек, който компресира речта в отделни токени, които моделът може да генерира. Kyutai пусна тежестите и кода открито.
Техническа информация
Номерът на Moshi е неговият кодек Mimi, който превръща непрекъснатото аудио в поток с нисък битрейт от отделни токени при 12,5 Hz, включително дестилиран семантичен токен. Езиковият модел предвижда своите собствени речеви токени и тези на потребителя в паралелни потоци, подравнени във времето, така че генерирането никога не трябва да спира, за да „слуша“. Методът „Вътрешен монолог“ предсказва текста преди аудиото, подобрявайки езиковото качество и съгласуваността на това, което Моши всъщност казва.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на Moshi Full-Duplex Speech
Пълнодуплексното моделиране се превръща в шаблон за AI с естествен глас, оказвайки влияние върху системите в индустрията. Очаквайте по-малки версии на устройството, многоезична поддръжка, по-ниска латентност и интегриране в агенти, обслужване на клиенти и инструменти за достъпност. Тъй като Moshi е отворен, изследователите могат да го изследват и подобряват свободно. Предизвикателствата остават около фактическата надеждност, безопасността при припокриване на речта и емоционалния нюанс, но преминаването от твърд ред към течен, прекъсваем разговор вероятно е постоянен.
Внедряване в реалния свят
Гласов спътник със свободни ръце, който можете да прекъсвате по средата на изречението, с отговори за под 200 милисекунди.
Отворена база за изследване за изучаване на пълнодуплексен говорим диалог в реално време без собствени черни кутии.
Асистенти за достъпност, които разговарят плавно с потребители, които се нуждаят от бързо, естествено движение напред-назад.
Създаване на прототипи на прекъсваеми гласови ботове за обслужване на клиенти, които прехвърлят обратен канал и реагират, докато обаждащият се все още говори.
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Moshi Full-Duplex Speech quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Нормализиране на текст за реч
Frequently asked questions
What is Moshi Full-Duplex Speech?
Moshi е гласов AI с отворен код в реално време от Kyutai, който говори и слуша едновременно — пълен дуплекс — вместо да се редува строго. Това премахва неудобното забавяне и твърдото редуване на традиционните гласови асистенти.
Какво означава „пълен дуплекс“ в контекста на Moshi?
Пълен дуплекс означава, че моделът обработва входящо и изходящо аудио едновременно, така че може да слуша, докато говори, и да се справя с прекъсванията по естествен начин.
Коя организация пусна Moshi?
Moshi е разработен и с отворен код от Kyutai, френска изследователска лаборатория за изкуствен интелект, през 2024 г.
Какво е Mimi в системата Moshi?
Mimi е невронният аудио кодек, който компресира непрекъсната реч в поток с нисък битрейт от отделни токени, които моделът може да генерира.
Как се различава Moshi от традиционния тръбопровод за гласов асистент?
Традиционните асистенти свързват говор към текст, езиков модел и текст към говор; Moshi е единичен модел реч-към-говор, който непрекъснато обработва аудио.
Приблизително към каква латентност при разговор е насочен Moshi?
Moshi постига латентност около 160-200 ms, много по-ниска от типичните гласови асистенти, което позволява естествено припокриване и прекъсване.