Mowa Moshi w pełnym dupleksie
Moshi to oparta na otwartym kodzie źródłowym sztuczna inteligencja głosowa firmy Kyutai działająca w czasie rzeczywistym, która mówi i słucha w tym samym czasie — w trybie pełnego dupleksu — zamiast działać po kolei.
Przegląd
That removes the awkward lag and rigid turn-taking of traditional voice assistants.
Głębokie nurkowanie
Moshi, wydany przez francuskie laboratorium Kyutai w 2024 r., to podstawowy model zamiany mowy na mowę stworzony z myślą o naturalnej rozmowie z niskimi opóźnieniami. W przeciwieństwie do asystentów potokowych, które łączą zamianę mowy na tekst, następnie model języka, a następnie zamianę tekstu na mowę, Moshi obsługuje dźwięk bezpośrednio i w sposób ciągły. Jego kluczową ideą jest pełny dupleks: modeluje jednocześnie dwa strumienie audio — użytkownika i jego własny — dzięki czemu może słuchać podczas mówienia, obsługiwać przerwy, kanał zwrotny z „mhm” i naturalnie nakładać się na siebie, tak jak to robią ludzie. Osiąga opóźnienie około 160–200 milisekund, znacznie poniżej typowego opóźnienia asystenta. Pod maską łączy model języka tekstu i dźwięku o parametrach 7B (Helium) z Mimi, neuronowym kodekiem audio, który kompresuje mowę w dyskretne tokeny, które model może wygenerować. Kyutai otwarcie ujawnił ciężary i kod.
Wgląd techniczny
Sztuczką Moshi jest kodek Mimi, który zamienia ciągły dźwięk w strumień dyskretnych tokenów o niskiej przepływności przy 12,5 Hz, w tym destylowany token semantyczny. Model języka przewiduje własne tokeny mowy i użytkownika w równoległych, wyrównanych w czasie strumieniach, więc pokolenie nigdy nie musi się zatrzymywać, aby „słuchać”. Metoda „Monologu wewnętrznego” przewiduje tekst przed dźwiękiem, poprawiając jakość językową i spójność tego, co faktycznie mówi Moshi.
Wpływ strategiczny
Dostęp i zasięg
Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.
Koszt i budżet
Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.
Szybkość i skala
Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.
Przyszłość pełnodupleksowej mowy Moshi
Modelowanie pełnodupleksowe staje się szablonem sztucznej inteligencji głosowej, wpływającej na systemy w całej branży. Spodziewaj się mniejszych wersji na urządzenie, wielojęzycznej obsługi, mniejszych opóźnień i integracji z agentami, obsługą klienta i narzędziami ułatwień dostępu. Ponieważ Moshi jest otwarte, badacze mogą go swobodnie badać i ulepszać. Pozostają wyzwania związane z wiarygodnością faktów, bezpieczeństwem nakładających się wypowiedzi i niuansami emocjonalnymi, ale przejście od sztywnej kolei do płynnej, przerywalnej rozmowy jest prawdopodobnie trwałe.
Implementacja w świecie rzeczywistym
Towarzysz głosowy bez użycia rąk, który możesz przerwać w połowie zdania, a odpowiedź zajmie mniej niż 200 milisekund.
Otwarta baza badawcza do badania dialogów mówionych w trybie pełnego dupleksu w czasie rzeczywistym bez zastrzeżonych czarnych skrzynek.
Asystenci ułatwień dostępu, którzy płynnie komunikują się z użytkownikami, którzy potrzebują szybkiej, naturalnej komunikacji tam i z powrotem.
Prototypowanie botów głosowych obsługujących klienta z możliwością przerywania, które przekazują sygnał zwrotny i reagują, gdy rozmówca jeszcze mówi.
Zagrożenia i poręcze
W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.
Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.
Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.
Plan wdrożenia
Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.
Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.
Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.
Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Moshi Full-Duplex Speech quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Normalizacja tekstu dla mowy
Często zadawane pytania
What is Moshi Full-Duplex Speech?
Moshi to oparta na otwartym kodzie źródłowym sztuczna inteligencja głosowa firmy Kyutai działająca w czasie rzeczywistym, która mówi i słucha w tym samym czasie — w trybie pełnego dupleksu — zamiast działać po kolei. Eliminuje to niezręczne opóźnienia i sztywną zmianę, charakterystyczne dla tradycyjnych asystentów głosowych.
Co oznacza „pełny dupleks” w kontekście Moshi?
Pełny dupleks oznacza, że model obsługuje jednocześnie dźwięk przychodzący i wychodzący, dzięki czemu może słuchać podczas mówienia i naturalnie radzić sobie z przerwami.
Która organizacja wypuściła Moshiego?
Moshi zostało opracowane i udostępnione na zasadach open source przez Kyutai, francuskie laboratorium badawcze AI, w 2024 roku.
Czym jest Mimi w systemie Moshi?
Mimi to neuronowy kodek audio, który kompresuje ciągłą mowę do strumienia dyskretnych tokenów o niskiej przepływności, który może wygenerować model.
Czym Moshi różni się od tradycyjnego potoku asystenta głosowego?
Tradycyjni asystenci łączą zamianę mowy na tekst, model języka i zamianę tekstu na mowę; Moshi to pojedynczy model zamiany mowy na mowę obsługujący dźwięk w sposób ciągły.
Jakie mniej więcej opóźnienie konwersacji ma na celu Moshi?
Moshi osiąga opóźnienie wynoszące około 160-200 ms, znacznie mniej niż typowi asystenci głosowi, umożliwiając naturalne nakładanie się i przerywanie.