Zvukový průvodce AI

Plně duplexní řeč Moshi

Moshi je open source hlasová umělá inteligence v reálném čase od společnosti Kyutai, která mluví a poslouchá současně – plně duplexně – místo toho, aby se striktně střídala.

2 minuty čteníNaposledy aktualizováno

Přehled

That removes the awkward lag and rigid turn-taking of traditional voice assistants.

Hluboký ponor

Moshi, vydaný francouzskou laboratoří Kyutai v roce 2024, je základní model řeči na řeč vytvořený pro přirozenou konverzaci s nízkou latencí. Na rozdíl od zřetězených asistentů, kteří řetězí převod řeči na text, pak jazykový model a pak převod textu na řeč, Moshi zpracovává zvuk přímo a nepřetržitě. Jeho klíčová myšlenka je plně duplexní: modeluje dva zvukové proudy současně – uživatelský a svůj vlastní – takže může poslouchat při mluvení, zvládnout přerušení, zpětný kanál s „mhm“ a přirozeně se překrývat jako lidé. Dosahuje latence kolem 160-200 milisekund, což je hluboko pod typickým zpožděním asistenta. Pod kapotou spáruje 7B-parametrový textový a zvukový jazykový model (Helium) s Mimi, neuronovým zvukovým kodekem, který komprimuje řeč do diskrétních tokenů, které může model generovat. Kyutai otevřeně uvolnil závaží a kód.

Technický přehled

Trik společnosti Moshi je v kodeku Mimi, který přeměňuje nepřetržitý zvuk na proud diskrétních tokenů s nízkou bitovou rychlostí při 12,5 Hz, včetně destilovaného sémantického tokenu. Jazykový model předpovídá své vlastní řečové tokeny a uživatelské toky v paralelně časově zarovnaných tocích, takže generace se nikdy nemusí zastavit, aby „poslouchala“. Metoda „vnitřního monologu“ předpovídá text před zvukem, čímž zlepšuje jazykovou kvalitu a soudržnost toho, co Moshi skutečně říká.

Strategický dopad

Přístup a dosah

Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.

Cena a rozpočet

Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.

Rychlost a měřítko

Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.

Budoucnost Moshi Full-Duplex Speech

Plně duplexní modelování se stává šablonou pro přirozenou hlasovou umělou inteligenci, která ovlivňuje systémy v celém odvětví. Očekávejte menší verze na zařízení, vícejazyčnou podporu, nižší latenci a integraci do agentů, zákaznických služeb a nástrojů pro usnadnění. Protože je Moshi otevřená, vědci ji mohou volně zkoumat a vylepšovat. Výzvy přetrvávají kolem faktické spolehlivosti, bezpečnosti v překrývajících se řečech a emocionálních nuancí, ale posun od strnulého obratu k plynulé, přerušitelné konverzaci je pravděpodobně trvalý.

Real-World Implementace

Hlasový společník handsfree, kterého můžete přerušit uprostřed věty, s odpověďmi do 200 milisekund.

Otevřený výzkumný základ pro studium plně duplexního mluveného dialogu v reálném čase bez proprietárních černých skříněk.

Asistenti usnadnění, kteří plynule konverzují s uživateli, kteří potřebují rychlé a přirozené přemisťování tam a zpět.

Prototypování přerušitelných hlasových robotů zákaznických služeb, které backchannelují a reagují, zatímco volající stále mluví.

Rizika a zábradlí

Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.

Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.

Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.

Plán implementace

1

Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.

2

Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.

3

Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.

4

Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Moshi Full-Duplex Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Normalizace textu pro řeč

Často kladené otázky

What is Moshi Full-Duplex Speech?

Moshi je open source hlasová umělá inteligence v reálném čase od společnosti Kyutai, která mluví a poslouchá současně – plně duplexně – místo toho, aby se striktně střídala. To odstraňuje nepříjemné zpoždění a strnulé otáčení tradičních hlasových asistentů.

Co znamená „full-duplex“ v kontextu Moshi?

Full-duplex znamená, že model zpracovává příchozí a odchozí zvuk současně, takže může poslouchat při mluvení a přirozeně zvládat přerušení.

Která organizace vydala Moshi?

Moshi byl vyvinut a open source společností Kyutai, francouzskou výzkumnou laboratoří AI, v roce 2024.

Co je Mimi v systému Moshi?

Mimi je neurální zvukový kodek, který komprimuje souvislou řeč do proudu diskrétních tokenů s nízkou bitovou rychlostí, které může model generovat.

Jak se Moshi liší od tradičního potrubí hlasových asistentů?

Tradiční asistenti řetězí převod řeči na text, jazykový model a převod textu na řeč; Moshi je jediný model převodu řeči na řeč, který nepřetržitě zpracovává zvuk.

Na jakou konverzační latenci se Moshi přibližně zaměřuje?

Moshi dosahuje latence kolem 160-200 ms, což je mnohem méně než u typických hlasových asistentů, což umožňuje přirozené překrývání a přerušení.