Codec Audio Penstriman Mimi
Mimi ialah codec audio saraf yang memampatkan pertuturan menjadi aliran kecil token diskret dalam masa nyata, jadi model AI boleh mendengar dan bercakap dengan kependaman yang sangat rendah.
Gambaran keseluruhan
It is the audio backbone behind Kyutai's Moshi voice model.
Menyelam dalam
Mimi, dikeluarkan oleh makmal Perancis Kyutai pada tahun 2024, ialah codec saraf yang menukarkan audio 24 kHz kepada aliran token diskret pada kira-kira 1.1 kbps dan hanya 12.5 token sesaat. Ia menggunakan penyahkod pengekod dengan pengkuantitian vektor sisa (RVQ), memisahkan token kepada tahap pertama 'semantik' yang disuling daripada model pertuturan penyeliaan sendiri (WavLM) serta beberapa tahap 'akustik' yang menangkap tekstur suara. Yang penting ia adalah penstriman dan kausal sepenuhnya: ia mengeluarkan token apabila audio tiba daripada menunggu klip penuh, dengan kependaman kira-kira 80 ms. Ini membolehkan model bahasa memperlakukan pertuturan seperti token teks, membolehkan Moshi bercakap dalam dupleks penuh sambil memastikan audio yang dibina semula boleh difahami dan semula jadi.
Wawasan Teknikal
Helah Mimi ialah skim split-RVQ. Buku kod pertama dilatih dengan kehilangan penyulingan untuk memadankan benam daripada WavLM, memaksanya membawa 'makna' fonetik, manakala buku kod akustik selari membina semula butiran bentuk gelombang. Transformer beroperasi di dalam kesesakan, dan kehilangan adversarial (GAN) pada penyahkod menajamkan kualiti output. Konvolusi sebab-akibat memastikan segala-galanya distrim, jadi kependaman kekal hampir 80 ms.
Kesan Strategik
Akses dan capai
Ia meningkatkan kebolehcapaian melalui transkripsi, narasi dan antara muka suara.
Kos dan bajet
Pasukan media boleh menghantar audio yang digilap dengan lebih pantas dengan belanjawan yang lebih kecil.
Kelajuan dan skala
Sistem yang menghadapi pelanggan boleh memproses interaksi pertuturan pada skala yang lebih besar.
Masa Depan Mimi Streaming Audio Codec
Jangkakan codec seperti Mimi untuk menjadi antara muka standard antara audio dan model bahasa besar, mendorong pembantu suara masa nyata ke arah masa tindak balas sub-100 ms. Penyelidikan memacu kadar token lebih rendah sambil mengekalkan identiti pembesar suara, emosi dan muzik. Oleh kerana Kyutai sumber terbuka Mimi dan Moshi, ia berkemungkinan besar akan menghasilkan banyak sistem pertuturan ke pertuturan terbuka, pembantu pada peranti dan alat komunikasi suara lebar jalur ultra rendah.
Pelaksanaan Dunia Sebenar
Menguasakan pembantu suara penuh dupleks Moshi Kyutai supaya ia boleh mendengar dan bercakap secara serentak
Menstrim token pertuturan ke dalam model bahasa untuk terjemahan pertuturan ke pertuturan masa nyata
Panggilan suara ultra-rendah bitrate (~1.1 kbps) untuk keadaan rangkaian yang lemah atau sesak
Tokenizing audio untuk pertuturan generatif dan saluran paip teks ke pertuturan yang menaakul bunyi seperti teks
Risiko & Pengawal
Penyalahgunaan suara dan risiko penyamaran meningkat apabila tiada kebenaran.
Ketepatan boleh menurun merentas aksen, dialek atau persekitaran yang bising.
Audio sintetik boleh disalah anggap sebagai pertuturan tulen tanpa pelabelan yang jelas.
Hala Tuju Pelaksanaan
Dapatkan persetujuan yang jelas untuk menangkap suara, pengklonan dan penggunaan semula.
Uji kualiti merentas pelbagai pembesar suara dan keadaan latar belakang.
Tentukan bila manusia mesti menyemak atau meluluskan output.
Labelkan audio sintetik dan simpan rekod asal untuk kebertanggungjawaban.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Codec Audio Neural
Soalan lazim
What is Mimi Streaming Audio Codec?
Mimi ialah codec audio saraf yang memampatkan pertuturan menjadi aliran kecil token diskret dalam masa nyata, jadi model AI boleh mendengar dan bercakap dengan kependaman yang sangat rendah. Ia adalah tulang belakang audio di belakang model suara Moshi Kyutai.
Makmal apa yang mengeluarkan Mimi dan model suara Moshi?
Mimi dan Moshi dikeluarkan pada 2024 oleh makmal penyelidikan Perancis Kyutai, yang menggunakan sumber terbuka kedua-duanya.
Secara kasar berapa banyak token sesaat yang Mimi keluarkan untuk pertuturan?
Mimi memampatkan audio 24 kHz kepada hanya kira-kira 12.5 token sesaat pada kira-kira 1.1 kbps.
Apakah yang ditangkap oleh buku kod ('semantik') pertama dalam Mimi?
Tahap RVQ pertama dilatih melalui penyulingan daripada WavLM untuk membawa kandungan semantik/fonetik, manakala tahap kemudian menambah perincian akustik.
Mengapakah Mimi disifatkan sebagai 'streaming' atau 'causal'?
Mimi memproses audio secara bersebab dan mengeluarkan token secara berperingkat, memberikan kira-kira 80 ms kependaman yang sesuai untuk perbualan langsung.
Teknik pengkuantitian yang manakah Mimi gunakan untuk mengekod audio?
Mimi menggunakan pengkuantitian vektor sisa, menyusun berbilang buku kod supaya setiap satu menambah perincian yang lebih halus kepada yang sebelumnya.