Mimi Streaming Audio kodek
Mimi je neurální zvukový kodek, který komprimuje řeč do malého proudu diskrétních tokenů v reálném čase, takže modely AI mohou poslouchat a mluvit s velmi nízkou latencí.
Přehled
It is the audio backbone behind Kyutai's Moshi voice model.
Hluboký ponor
Mimi, vydaný francouzskou laboratoří Kyutai v roce 2024, je neurální kodek, který mění 24 kHz zvuk na proud diskrétních tokenů rychlostí zhruba 1,1 kbps a pouze 12,5 tokenů za sekundu. Využívá kodér-dekodér se zbytkovou vektorovou kvantizací (RVQ), rozdělující tokeny do „sémantické“ první úrovně získané z modelu řeči s vlastním dohledem (WavLM) plus několik „akustických“ úrovní, které zachycují texturu hlasu. Rozhodující je, že je plně streamovaný a kauzální: vysílá tokeny, když zvuk přichází, místo aby čekal na celý klip, s latencí asi 80 ms. To umožňuje jazykovému modelu zacházet s řečí jako s textovými tokeny, což umožňuje Moshi konverzovat v plně duplexním režimu a zároveň zachovat rekonstruovaný zvuk srozumitelný a přirozený.
Technický přehled
Mimiho trikem je schéma split-RVQ. První kódová kniha je trénována s destilační ztrátou, aby odpovídala vložení z WavLM, což ji nutí nést fonetický „význam“, zatímco paralelní akustické kódové knihy rekonstruují detaily tvaru vlny. Transformátor pracuje uvnitř úzkého hrdla a nepříznivá (GAN) ztráta na dekodéru zvyšuje kvalitu výstupu. Kauzální konvoluce udržují vše ve streamování, takže latence zůstává kolem 80 ms.
Strategický dopad
Přístup a dosah
Zlepšuje dostupnost prostřednictvím přepisu, vyprávění a hlasových rozhraní.
Cena a rozpočet
Mediální týmy mohou dodávat vylepšený zvuk rychleji s menšími rozpočty.
Rychlost a měřítko
Systémy orientované na zákazníky mohou zpracovávat mluvené interakce ve větším měřítku.
Budoucnost Mimi Streaming Audio Codec
Očekávejte, že se kodeky jako Mimi stanou standardním rozhraním mezi audio a velkými jazykovými modely a posunou hlasové asistenty v reálném čase k době odezvy pod 100 ms. Výzkum vede k ještě nižšímu počtu tokenů při zachování identity mluvčích, emocí a hudby. Vzhledem k tomu, že Kyutai nabízí Mimi a Moshi open source, je pravděpodobné, že zasadí mnoho otevřených systémů řeči na řeč, asistentů na zařízení a nástrojů pro hlasovou komunikaci s extrémně nízkou šířkou pásma.
Real-World Implementace
Plně duplexní hlasový asistent Moshi od Kyutai, takže může poslouchat a mluvit současně
Streamování řečových tokenů do jazykového modelu pro převod řeči do řeči v reálném čase
Hlasové hovory s extrémně nízkou bitovou rychlostí (~1,1 kbps) pro špatné nebo přetížené podmínky sítě
Tokenizace zvuku pro generativní řeč a kanály převodu textu na řeč, které převažují nad zvukem jako text
Rizika a zábradlí
Pokud chybí souhlas, zvyšuje se riziko zneužití hlasu a předstírání jiné identity.
Přesnost může klesat v přízvuku, dialektech nebo hlučném prostředí.
Syntetický zvuk lze bez jasného označení zaměnit za autentickou řeč.
Plán implementace
Získejte výslovný souhlas se zachycením hlasu, klonováním a opětovným použitím.
Otestujte kvalitu napříč různými reproduktory a podmínkami pozadí.
Definujte, kdy musí člověk zkontrolovat nebo schválit výstupy.
Označte syntetický zvuk a veďte záznamy o původu pro zajištění odpovědnosti.
Pokračujte v objevování
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Další průvodce
Neuronové zvukové kodeky
Často kladené otázky
What is Mimi Streaming Audio Codec?
Mimi je neurální zvukový kodek, který komprimuje řeč do malého proudu diskrétních tokenů v reálném čase, takže modely AI mohou poslouchat a mluvit s velmi nízkou latencí. Je to páteř zvuku za hlasovým modelem Moshi společnosti Kyutai.
Která laboratoř vydala hlasový model Mimi a Moshi?
Mimi a Moshi byly vydány v roce 2024 francouzskou výzkumnou laboratoří Kyutai, která obě poskytla jako open source.
Kolik žetonů za sekundu vyšle Mimi pro řeč?
Mimi komprimuje 24 kHz zvuk na pouhých 12,5 tokenů za sekundu při zhruba 1,1 kbps.
Co zachycuje první („sémantická“) kódová kniha v Mimi?
První úroveň RVQ je trénována destilací z WavLM, aby přenášela sémantický/fonetický obsah, zatímco pozdější úrovně přidávají akustické detaily.
Proč je Mimi popisována jako „streaming“ nebo „kauzální“?
Mimi zpracovává zvuk kauzálně a vydává tokeny postupně, což dává přibližně 80 ms latenci vhodnou pro živou konverzaci.
Jakou kvantizační techniku používá Mimi ke kódování zvuku?
Mimi používá zbytkovou vektorovou kvantizaci, skládá více kódových knih, takže každá přidává jemnější detaily k předchozí.