MWONGOZO WA AI wa Sauti

Mimi Streaming Audio Codec

Mimi ni kodeki ya sauti ya neva ambayo hubana hotuba katika mtiririko mdogo wa tokeni tofauti kwa wakati halisi, ili miundo ya AI iweze kusikiliza na kuongea kwa utulivu wa chini sana.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It is the audio backbone behind Kyutai's Moshi voice model.

Dive ya kina

Mimi, iliyotolewa na maabara ya Kifaransa ya Kyutai mwaka wa 2024, ni kodeki ya neva ambayo hubadilisha sauti ya kHz 24 kuwa mtiririko wa tokeni tofauti kwa takriban 1.1 kbps na tokeni 12.5 pekee kwa sekunde. Inatumia programu ya kusimbua iliyo na ujanibishaji wa vekta iliyobaki (RVQ), ikigawanya tokeni hadi kiwango cha kwanza cha 'semantic' kilichotolewa kutoka kwa mtindo wa usemi unaojisimamia (WavLM) pamoja na viwango kadhaa vya 'acoustic' ambavyo vinanasa umbile la sauti. Muhimu sana inatiririsha kikamilifu na inasababisha: inatoa tokeni sauti inapowasili badala ya kusubiri klipu kamili, yenye takriban ms 80 ya muda wa kusubiri. Hii huruhusu muundo wa lugha kushughulikia usemi kama tokeni za maandishi, kuwezesha Moshi kuzungumza kwa uwili kamili huku sauti iliyoundwa upya iweze kueleweka na asilia.

Ufahamu wa Kiufundi

Ujanja wa Mimi ni mpango wa mgawanyiko wa RVQ. Kitabu cha kwanza cha msimbo kimefunzwa kwa hasara ya kunereka ili kulinganisha upachikaji kutoka kwa WavLM, na kukilazimisha kubeba 'maana' ya kifonetiki, huku vitabu vya msimbo sambamba vya akustika vinaunda upya maelezo ya muundo wa wimbi. Transfoma hufanya kazi ndani ya kizuizi, na hasara ya adversarial (GAN) kwenye dekoda huongeza ubora wa utoaji. Mazungumzo ya sababu huweka kila kitu kutiririka, kwa hivyo muda wa kusubiri unakaa karibu 80 ms.

Athari za kimkakati

Kufikia na kufikia

Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.

Cost and budget

Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.

Kasi na kiwango

Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.

Mustakabali wa Mimi Kutiririsha Kodeki ya Sauti

Tarajia kodeki kama Mimi ziwe kiolesura cha kawaida kati ya miundo ya sauti na lugha kubwa, na kusukuma visaidizi vya sauti vya wakati halisi kuelekea nyakati za majibu za milisekunde 100. Utafiti unapunguza viwango vya tokeni huku ukihifadhi utambulisho wa mzungumzaji, hisia na muziki. Kwa sababu Mimi na Moshi zinazotumia vyanzo huria vya Kyutai, kuna uwezekano wa kupata mifumo mingi ya wazi ya usemi-hadi-hotuba, visaidizi vya kifaa na zana za mawasiliano ya sauti ya chini-bandwidth.

Utekelezaji wa Ulimwengu Halisi

Inawezesha kisaidia sauti cha Kyutai cha Moshi chenye uwili kamili ili iweze kusikiliza na kuzungumza kwa wakati mmoja

Kutiririsha tokeni za matamshi katika muundo wa lugha kwa tafsiri ya wakati halisi ya hotuba-hadi-hotuba

Simu za sauti zenye kasi ya chini zaidi (~1.1 kbps) kwa hali duni au iliyosongamana ya mtandao

Kuweka toni sauti kwa hotuba wasilianifu na bomba za kutoka kwa maandishi hadi usemi zinazosababu juu ya sauti kama maandishi

Hatari & Walinzi

Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.

Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.

Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.

Ramani ya Utekelezaji

1

Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.

2

Jaribu ubora kwenye spika na hali mbalimbali za usuli.

3

Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.

4

Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mimi Streaming Audio Codec quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Kodeki za Sauti za Neural

Maswali yanayoulizwa mara kwa mara

What is Mimi Streaming Audio Codec?

Mimi ni kodeki ya sauti ya neva ambayo hubana hotuba katika mtiririko mdogo wa tokeni tofauti kwa wakati halisi, ili miundo ya AI iweze kusikiliza na kuongea kwa utulivu wa chini sana. Ni uti wa mgongo wa sauti nyuma ya mtindo wa sauti wa Kyutai wa Moshi.

Ni maabara gani ilitoa Mimi na mtindo wa sauti wa Moshi?

Mimi na Moshi zilitolewa mnamo 2024 na maabara ya utafiti ya Ufaransa ya Kyutai, ambayo ilitoa vyanzo wazi vyote viwili.

Takriban ni tokeni ngapi kwa sekunde ambazo Mimi hutoa kwa hotuba?

Mimi hubana sauti ya kHz 24 hadi takriban tokeni 12.5 kwa sekunde kwa takriban 1.1 kbps.

Kitabu cha msimbo cha kwanza ('semantic') katika Mimi kinanasa nini?

Kiwango cha kwanza cha RVQ kinafunzwa kupitia kunereka kutoka kwa WavLM ili kubeba maudhui ya kisemantiki/fonetiki, huku viwango vya baadaye huongeza maelezo ya akustika.

Kwa nini Mimi anaelezewa kama 'kutiririsha' au 'sababu'?

Mimi huchakata sauti kwa njia inayosababisha na kutoa tokeni mara kwa mara, ikitoa muda wa kusubiri wa ms 80 unaofaa kwa mazungumzo ya moja kwa moja.

Je, Mimi hutumia mbinu gani ya kuhesabu kusimba sauti?

Mimi hutumia ujanibishaji wa vekta iliyobaki, kuweka vitabu vya msimbo vingi ili kila kimoja kiongeze maelezo bora zaidi kwa kilichotangulia.