Mimi Streaming Audio Codec
Mimi ni kodeki ya sauti ya neva ambayo hubana hotuba katika mtiririko mdogo wa tokeni tofauti kwa wakati halisi, ili miundo ya AI iweze kusikiliza na kuongea kwa utulivu wa chini sana.
Muhtasari
It is the audio backbone behind Kyutai's Moshi voice model.
Dive ya kina
Mimi, iliyotolewa na maabara ya Kifaransa ya Kyutai mwaka wa 2024, ni kodeki ya neva ambayo hubadilisha sauti ya kHz 24 kuwa mtiririko wa tokeni tofauti kwa takriban 1.1 kbps na tokeni 12.5 pekee kwa sekunde. Inatumia programu ya kusimbua iliyo na ujanibishaji wa vekta iliyobaki (RVQ), ikigawanya tokeni hadi kiwango cha kwanza cha 'semantic' kilichotolewa kutoka kwa mtindo wa usemi unaojisimamia (WavLM) pamoja na viwango kadhaa vya 'acoustic' ambavyo vinanasa umbile la sauti. Muhimu sana inatiririsha kikamilifu na inasababisha: inatoa tokeni sauti inapowasili badala ya kusubiri klipu kamili, yenye takriban ms 80 ya muda wa kusubiri. Hii huruhusu muundo wa lugha kushughulikia usemi kama tokeni za maandishi, kuwezesha Moshi kuzungumza kwa uwili kamili huku sauti iliyoundwa upya iweze kueleweka na asilia.
Ufahamu wa Kiufundi
Ujanja wa Mimi ni mpango wa mgawanyiko wa RVQ. Kitabu cha kwanza cha msimbo kimefunzwa kwa hasara ya kunereka ili kulinganisha upachikaji kutoka kwa WavLM, na kukilazimisha kubeba 'maana' ya kifonetiki, huku vitabu vya msimbo sambamba vya akustika vinaunda upya maelezo ya muundo wa wimbi. Transfoma hufanya kazi ndani ya kizuizi, na hasara ya adversarial (GAN) kwenye dekoda huongeza ubora wa utoaji. Mazungumzo ya sababu huweka kila kitu kutiririka, kwa hivyo muda wa kusubiri unakaa karibu 80 ms.
Athari za kimkakati
Kufikia na kufikia
Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.
Cost and budget
Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.
Kasi na kiwango
Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.
Mustakabali wa Mimi Kutiririsha Kodeki ya Sauti
Tarajia kodeki kama Mimi ziwe kiolesura cha kawaida kati ya miundo ya sauti na lugha kubwa, na kusukuma visaidizi vya sauti vya wakati halisi kuelekea nyakati za majibu za milisekunde 100. Utafiti unapunguza viwango vya tokeni huku ukihifadhi utambulisho wa mzungumzaji, hisia na muziki. Kwa sababu Mimi na Moshi zinazotumia vyanzo huria vya Kyutai, kuna uwezekano wa kupata mifumo mingi ya wazi ya usemi-hadi-hotuba, visaidizi vya kifaa na zana za mawasiliano ya sauti ya chini-bandwidth.
Utekelezaji wa Ulimwengu Halisi
Inawezesha kisaidia sauti cha Kyutai cha Moshi chenye uwili kamili ili iweze kusikiliza na kuzungumza kwa wakati mmoja
Kutiririsha tokeni za matamshi katika muundo wa lugha kwa tafsiri ya wakati halisi ya hotuba-hadi-hotuba
Simu za sauti zenye kasi ya chini zaidi (~1.1 kbps) kwa hali duni au iliyosongamana ya mtandao
Kuweka toni sauti kwa hotuba wasilianifu na bomba za kutoka kwa maandishi hadi usemi zinazosababu juu ya sauti kama maandishi
Hatari & Walinzi
Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.
Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.
Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.
Ramani ya Utekelezaji
Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.
Jaribu ubora kwenye spika na hali mbalimbali za usuli.
Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.
Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mimi Streaming Audio Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Kodeki za Sauti za Neural
Maswali yanayoulizwa mara kwa mara
What is Mimi Streaming Audio Codec?
Mimi ni kodeki ya sauti ya neva ambayo hubana hotuba katika mtiririko mdogo wa tokeni tofauti kwa wakati halisi, ili miundo ya AI iweze kusikiliza na kuongea kwa utulivu wa chini sana. Ni uti wa mgongo wa sauti nyuma ya mtindo wa sauti wa Kyutai wa Moshi.
Ni maabara gani ilitoa Mimi na mtindo wa sauti wa Moshi?
Mimi na Moshi zilitolewa mnamo 2024 na maabara ya utafiti ya Ufaransa ya Kyutai, ambayo ilitoa vyanzo wazi vyote viwili.
Takriban ni tokeni ngapi kwa sekunde ambazo Mimi hutoa kwa hotuba?
Mimi hubana sauti ya kHz 24 hadi takriban tokeni 12.5 kwa sekunde kwa takriban 1.1 kbps.
Kitabu cha msimbo cha kwanza ('semantic') katika Mimi kinanasa nini?
Kiwango cha kwanza cha RVQ kinafunzwa kupitia kunereka kutoka kwa WavLM ili kubeba maudhui ya kisemantiki/fonetiki, huku viwango vya baadaye huongeza maelezo ya akustika.
Kwa nini Mimi anaelezewa kama 'kutiririsha' au 'sababu'?
Mimi huchakata sauti kwa njia inayosababisha na kutoa tokeni mara kwa mara, ikitoa muda wa kusubiri wa ms 80 unaofaa kwa mazungumzo ya moja kwa moja.
Je, Mimi hutumia mbinu gani ya kuhesabu kusimba sauti?
Mimi hutumia ujanibishaji wa vekta iliyobaki, kuweka vitabu vya msimbo vingi ili kila kimoja kiongeze maelezo bora zaidi kwa kilichotangulia.