Zvukový průvodce AI

Mimi Streaming Audio kodek

Mimi je neurální zvukový kodek, který komprimuje řeč do malého proudu diskrétních tokenů v reálném čase, takže modely AI mohou poslouchat a mluvit s velmi nízkou latencí.

2 minuty čteníNaposledy aktualizováno

Přehled

It is the audio backbone behind Kyutai's Moshi voice model.

Hluboký ponor

Mimi, vydaný francouzskou laboratoří Kyutai v roce 2024, je neurální kodek, který mění 24 kHz zvuk na proud diskrétních tokenů rychlostí zhruba 1,1 kbps a pouze 12,5 tokenů za sekundu. Využívá kodér-dekodér se zbytkovou vektorovou kvantizací (RVQ), rozdělující tokeny do „sémantické“ první úrovně získané z modelu řeči s vlastním dohledem (WavLM) plus několik „akustických“ úrovní, které zachycují texturu hlasu. Rozhodující je, že je plně streamovaný a kauzální: vysílá tokeny, když zvuk přichází, místo aby čekal na celý klip, s latencí asi 80 ms. To umožňuje jazykovému modelu zacházet s řečí jako s textovými tokeny, což umožňuje Moshi konverzovat v plně duplexním režimu a zároveň zachovat rekonstruovaný zvuk srozumitelný a přirozený.

Technický přehled

Mimiho trikem je schéma split-RVQ. První kódová kniha je trénována s destilační ztrátou, aby odpovídala vložení z WavLM, což ji nutí nést fonetický „význam“, zatímco paralelní akustické kódové knihy rekonstruují detaily tvaru vlny. Transformátor pracuje uvnitř úzkého hrdla a nepříznivá (GAN) ztráta na dekodéru zvyšuje kvalitu výstupu. Kauzální konvoluce udržují vše ve streamování, takže latence zůstává kolem 80 ms.

Strategický dopad

Přístup a dosah

Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.

Cena a rozpočet

Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.

Rychlost a měřítko

Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.

Budoucnost Mimi Streaming Audio Codec

Očekávejte, že se kodeky jako Mimi stanou standardním rozhraním mezi audio a velkými jazykovými modely a posunou hlasové asistenty v reálném čase k době odezvy pod 100 ms. Výzkum vede k ještě nižšímu počtu tokenů při zachování identity mluvčích, emocí a hudby. Vzhledem k tomu, že Kyutai nabízí Mimi a Moshi open source, je pravděpodobné, že zasadí mnoho otevřených systémů řeči na řeč, asistentů na zařízení a nástrojů pro hlasovou komunikaci s extrémně nízkou šířkou pásma.

Real-World Implementace

Plně duplexní hlasový asistent Moshi od Kyutai, takže může poslouchat a mluvit současně

Streamování řečových tokenů do jazykového modelu pro převod řeči do řeči v reálném čase

Hlasové hovory s extrémně nízkou bitovou rychlostí (~1,1 kbps) pro špatné nebo přetížené podmínky sítě

Tokenizace zvuku pro generativní řeč a kanály převodu textu na řeč, které převažují nad zvukem jako text

Rizika a zábradlí

Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.

Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.

Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.

Plán implementace

1

Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.

2

Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.

3

Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.

4

Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mimi Streaming Audio Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Neuronové zvukové kodeky

Často kladené otázky

What is Mimi Streaming Audio Codec?

Mimi je neurální zvukový kodek, který komprimuje řeč do malého proudu diskrétních tokenů v reálném čase, takže modely AI mohou poslouchat a mluvit s velmi nízkou latencí. Je to páteř zvuku za hlasovým modelem Moshi společnosti Kyutai.

Která laboratoř vydala hlasový model Mimi a Moshi?

Mimi a Moshi byly vydány v roce 2024 francouzskou výzkumnou laboratoří Kyutai, která obě poskytla jako open source.

Kolik žetonů za sekundu vyšle Mimi pro řeč?

Mimi komprimuje 24 kHz zvuk na pouhých 12,5 tokenů za sekundu při zhruba 1,1 kbps.

Co zachycuje první („sémantická“) kódová kniha v Mimi?

První úroveň RVQ je trénována destilací z WavLM, aby přenášela sémantický/fonetický obsah, zatímco pozdější úrovně přidávají akustické detaily.

Proč je Mimi popisována jako „streaming“ nebo „kauzální“?

Mimi zpracovává zvuk kauzálně a vydává tokeny postupně, což dává přibližně 80 ms latenci vhodnou pro živou konverzaci.

Jakou kvantizační techniku ​​používá Mimi ke kódování zvuku?

Mimi používá zbytkovou vektorovou kvantizaci, skládá více kódových knih, takže každá přidává jemnější detaily k předchozí.