Mimi Streaming Audio Codec
A Mimi egy neurális audiokodek, amely valós időben tömöríti a beszédet diszkrét tokenek kis folyamává, így az AI-modellek nagyon alacsony késleltetéssel tudnak hallgatni és beszélni.
Áttekintés
It is the audio backbone behind Kyutai's Moshi voice model.
Mély merülés
A Mimi, amelyet a francia Kyutai labor adott ki 2024-ben, egy neurális kodek, amely a 24 kHz-es hangot diszkrét tokenek folyamává alakítja nagyjából 1,1 kbps sebességgel és mindössze 12,5 token másodpercenként. Ez egy kódoló-dekódolót használ maradék vektorkvantálással (RVQ), amely a tokeneket egy önfelügyelt beszédmodellből (WavLM) desztillált „szemantikai” első szintre osztja fel, valamint több „akusztikus” szintet, amelyek rögzítik a hang textúráját. Lényeges, hogy teljesen streaming és okozati: tokeneket bocsát ki, amikor hang érkezik, nem pedig a teljes klipre vár, körülbelül 80 ms-os késleltetéssel. Ez lehetővé teszi a nyelvi modell számára, hogy a beszédet szöveges tokenként kezelje, lehetővé téve a Moshi számára, hogy teljes duplexben társalogjon, miközben a rekonstruált hang érthető és természetes marad.
Technikai betekintés
Mimi trükkje egy split-RVQ séma. Az első kódkönyv desztillációs veszteséggel van betanítva, hogy illeszkedjen a WavLM beágyazásaihoz, és arra kényszeríti, hogy fonetikus „jelentést” hordozzon, míg a párhuzamos akusztikus kódkönyvek rekonstruálják a hullámforma részleteit. A transzformátor a szűk keresztmetszeten belül működik, és a dekóder ellenséges (GAN) vesztesége élesíti a kimeneti minőséget. Az ok-okozati konvolúciók folyamatosan streamelnek mindent, így a késleltetés 80 ms közelében marad.
Stratégiai hatás
Hozzáférés és elérés
Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.
Költség és költségvetés
A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.
Sebesség és méretarány
Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.
A Mimi Streaming Audio Codec jövője
Várható, hogy a Mimi-hez hasonló kodekek az audio- és a nagy nyelvi modellek szabványos interfészévé váljanak, és a valós idejű hangsegédeket 100 ms alatti válaszidőre tolják. A kutatások még alacsonyabbra csökkentik a token arányát, miközben megőrzik a beszélő identitását, érzelmeit és zenéjét. Mivel a Kyutai nyílt forráskódú Mimi és Moshi, valószínűleg sok nyílt beszéd-felolvasó rendszert, eszközön lévő asszisztenst és ultra-alacsony sávszélességű hangkommunikációs eszközt fog létrehozni.
Valós megvalósítás
A Kyutai Moshi full-duplex hangasszisztensének tápellátása, hogy egyszerre tudjon hallgatni és beszélni
Beszédtokenek streamelése nyelvi modellbe valós idejű beszéd-beszéd fordításhoz
Rendkívül alacsony bitsebességű hanghívások (~1,1 kbps) rossz vagy túlterhelt hálózati feltételek esetén
Hang tokenizálása generatív beszédhez és szövegfelolvasó csővezetékekhez, amelyek a szövegszerű hangzás helyett indokolják
Kockázatok és védőkorlátok
A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.
A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.
A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.
Végrehajtási ütemterv
Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.
Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.
Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.
Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Neurális audio kodekek
Gyakran ismételt kérdések
What is Mimi Streaming Audio Codec?
A Mimi egy neurális audiokodek, amely valós időben tömöríti a beszédet diszkrét tokenek kis folyamává, így az AI-modellek nagyon alacsony késleltetéssel tudnak hallgatni és beszélni. Ez az audio gerince Kyutai Moshi hangmodelljének.
Melyik labor adta ki Mimit és a Moshi hangmodellt?
A Mimit és a Moshit 2024-ben adta ki a francia Kyutai kutatólaboratórium, amely mindkettőt nyílt forráskódú.
Körülbelül hány tokent bocsát ki másodpercenként a Mimi a beszédhez?
A Mimi a 24 kHz-es hangot csak körülbelül 12,5 tokenre tömöríti másodpercenként, nagyjából 1,1 kbps sebességgel.
Mit rögzít a Mimi első ('szemantikai') kódkönyve?
Az első RVQ szintet a WavLM desztillációja képezi szemantikai/fonetikai tartalom hordozására, míg a későbbi szintek akusztikus részleteket adnak hozzá.
Miért írják le a Mimit „streaming”-nek vagy „ok-okozatinak”?
A Mimi kauzálisan dolgozza fel a hangot, és fokozatosan adja ki a tokeneket, így körülbelül 80 ms-os késleltetést biztosít az élő beszélgetéshez.
Milyen kvantálási technikát használ a Mimi a hang kódolására?
A Mimi maradék vektorkvantálást használ, több kódkönyvet egymásra rakva, így mindegyik finomabb részletet ad az előzőhöz.