Hotuba ya Moshi Kamili-Duplex
Moshi ni chanzo huria, sauti ya wakati halisi AI kutoka Kyutai ambayo inazungumza na kusikiliza kwa wakati mmoja - duplex kamili - badala ya kuchukua zamu kali.
Muhtasari
That removes the awkward lag and rigid turn-taking of traditional voice assistants.
Dive ya kina
Moshi, iliyotolewa na maabara ya Kifaransa ya Kyutai mwaka wa 2024, ni kielelezo cha msingi cha hotuba kwa hotuba iliyojengwa kwa mazungumzo ya asili, ya utulivu wa chini. Tofauti na wasaidizi wa bomba ambao huunganisha hotuba-kwa-maandishi, kisha modeli ya lugha, kisha maandishi-hadi-hotuba, Moshi hushughulikia sauti moja kwa moja na kwa kuendelea. Wazo lake kuu ni uwili kamili: ni mfano wa mitiririko miwili ya sauti kwa wakati mmoja - ya mtumiaji na yake mwenyewe - ili iweze kusikiliza inapozungumza, kushughulikia kukatizwa, njia ya nyuma na 'mhm,' na kuingiliana kawaida kama wanadamu. Inafikia muda wa kusubiri karibu 160-200 milliseconds, mbali chini ya kawaida msaidizi bakia. Chini ya kofia inaunganisha modeli ya lugha ya maandishi na sauti yenye vigezo 7B (Helium) na Mimi, kodeki ya sauti ya neva ambayo inabana usemi kuwa tokeni tofauti ambazo modeli inaweza kuzalisha. Kyutai alitoa uzani na msimbo waziwazi.
Ufahamu wa Kiufundi
Ujanja wa Moshi ni kodeki yake ya Mimi, ambayo hugeuza sauti inayoendelea kuwa mtiririko wa chini wa biti ya tokeni za 12.5 Hz, ikiwa ni pamoja na tokeni ya semantiki iliyosafishwa. Muundo wa lugha hutabiri tokeni zake za usemi na za mtumiaji katika mitiririko inayolingana na wakati, kwa hivyo kizazi hakina budi kusimama ili 'kusikiliza.' Mbinu ya 'Monologue ya Ndani' hubashiri maandishi kabla ya sauti, na kuboresha ubora wa lugha na mshikamano wa kile Moshi inasema.
Athari za kimkakati
Kufikia na kufikia
Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.
Cost and budget
Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.
Kasi na kiwango
Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.
Mustakabali wa Hotuba ya Moshi Kamili-Duplex
Uundaji wa sehemu mbili kamili unakuwa kiolezo cha AI ya sauti asilia, inayoathiri mifumo kote tasnia. Tarajia matoleo madogo zaidi ya kifaa, usaidizi wa lugha nyingi, muda wa kusubiri wa chini, na ujumuishaji katika mawakala, huduma kwa wateja na zana za ufikivu. Kwa sababu Moshi iko wazi, watafiti wanaweza kuichunguza na kuiboresha kwa uhuru. Changamoto husalia kuhusu kutegemewa kwa ukweli, usalama katika usemi unaoingiliana, na hali ya kihisia, lakini kuhama kutoka kwa mazungumzo magumu hadi mazungumzo ya maji, yanayokatizwa kuna uwezekano kuwa ya kudumu.
Utekelezaji wa Ulimwengu Halisi
Mwenza wa sauti bila kugusa unaweza kukatiza katikati ya sentensi, ukiwa na majibu chini ya milisekunde 200.
Fungua msingi wa utafiti wa kusoma mazungumzo ya wakati halisi, yenye uwili kamili bila visanduku vyeusi vya wamiliki.
Visaidizi vya ufikivu ambavyo huzungumza kwa urahisi na watumiaji wanaohitaji kurudi na kurudi kwa haraka, asilia.
Kuiga roboti za sauti za huduma kwa mteja zinazoweza kurudi nyuma na kujibu mpigaji simu bado anazungumza.
Hatari & Walinzi
Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.
Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.
Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.
Ramani ya Utekelezaji
Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.
Jaribu ubora kwenye spika na hali mbalimbali za usuli.
Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.
Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Moshi Full-Duplex Speech quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Urekebishaji wa Maandishi kwa Usemi
Maswali yanayoulizwa mara kwa mara
What is Moshi Full-Duplex Speech?
Moshi ni chanzo huria, sauti ya wakati halisi AI kutoka Kyutai ambayo inazungumza na kusikiliza kwa wakati mmoja - duplex kamili - badala ya kuchukua zamu kali. Hiyo huondoa kulegalega kwa shida na uchukuaji wa zamu wa visaidizi vya kawaida vya sauti.
Je, neno 'full-duplex' linamaanisha nini katika muktadha wa Moshi?
Full-duplex inamaanisha kuwa muundo hushughulikia sauti zinazoingia na kutoka kwa wakati mmoja, ili iweze kusikiliza inapozungumza na kushughulikia kukatizwa kwa kawaida.
Ni shirika gani lililotoa Moshi?
Moshi ilitengenezwa na kufadhiliwa na Kyutai, maabara ya utafiti ya AI ya Ufaransa, mwaka 2024.
Mimi ni nini katika mfumo wa Moshi?
Mimi ni kodeki ya sauti ya neural ambayo hubana usemi unaoendelea hadi mtiririko wa chini-bit wa tokeni tofauti ambazo muundo unaweza kuzalisha.
Je, Moshi inatofautiana vipi na bomba la kitamaduni la kusaidia sauti?
Wasaidizi wa kitamaduni hufungamanisha usemi-kwa-maandishi, muundo wa lugha, na maandishi-hadi-hotuba; Moshi ni kielelezo kimoja cha usemi-kwa-hotuba kinachoshughulikia sauti mfululizo.
Moshi inalenga kuchelewa kwa mazungumzo gani?
Moshi hupata muda wa kusubiri kwa takriban ms 160-200, chini sana kuliko visaidizi vya kawaida vya sauti, kuwezesha mwingiliano wa asili na kukatizwa.