Audio AI ÚTMUTATÓ

Moshi Full-Duplex beszéd

A Moshi a Kyutai nyílt forráskódú, valós idejű hangos AI-ja, amely egyszerre beszél és hallgat – full-duplex – ahelyett, hogy szigorúan váltana.

2 perc olvasásUtoljára frissítve

Áttekintés

That removes the awkward lag and rigid turn-taking of traditional voice assistants.

Mély merülés

A francia Kyutai laboratórium által 2024-ben kiadott Moshi egy beszéd-beszéd alapmodell, amelyet természetes, alacsony késleltetésű beszélgetésre építettek. Ellentétben a beszédet szöveggé, majd egy nyelvi modellt, majd a szöveget beszédté láncoló pipeline asszisztensekkel, a Moshi közvetlenül és folyamatosan kezeli a hangot. A kulcsötlet a full duplex: egyszerre két hangfolyamot – a felhasználóét és a sajátját – modellezi, így beszéd közben hallgathat, kezelheti a megszakításokat, visszacsatornázhat „mhm”-mel, és természetes módon átfedheti egymást, mint az emberek. Körülbelül 160-200 milliszekundumot ér el, ami messze elmarad a tipikus asszisztensi késéstől. A motorháztető alatt egy 7B-paraméteres szöveg- és hangnyelvi modellt (Hélium) párosít a Mimi-vel, egy neurális audiokodekkel, amely a beszédet a modell által generált diszkrét tokenekké tömöríti. Kyutai nyíltan kiadta a súlyokat és a kódot.

Technikai betekintés

A Moshi trükkje a Mimi kodek, amely a folyamatos hangot 12,5 Hz-es diszkrét tokenek alacsony bitsebességű folyamává alakítja, beleértve a desztillált szemantikai tokent. A nyelvi modell megjósolja saját beszédjelzőit és a felhasználó párhuzamos, időre igazított adatfolyamait, így a generációnak soha nem kell megállnia a „hallgatáshoz”. A „belső monológ” módszer előrejelzi a szöveget a hang előtt, javítva a nyelvi minőséget és a Moshi által elmondottak koherenciáját.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A Moshi Full-Duplex beszéd jövője

A full-duplex modellezés a természetes hangalapú mesterséges intelligencia sablonjává válik, és az egész iparágban befolyásolja a rendszereket. Kisebb, eszközön található verziókra, többnyelvű támogatásra, alacsonyabb késleltetésre, valamint ügynökökbe, ügyfélszolgálati és kisegítő lehetőségekbe való integrációra számíthat. Mivel a Moshi nyitott, a kutatók szabadon vizsgálhatják és javíthatják. Kihívások maradnak a ténybeli megbízhatóság, az átfedő beszéd biztonsága és az érzelmi árnyalatok körül, de a merev fordulatfelvételről a folyékony, megszakítható beszélgetésre való elmozdulás valószínűleg állandó.

Valós megvalósítás

Egy kihangosított hangtárs, amellyel a mondat közepén megszakíthatja a választ, és 200 ezredmásodperc alatti válaszokat ad.

Nyílt kutatási alapvonal a valós idejű, full-duplex beszélt párbeszéd tanulmányozásához szabadalmaztatott fekete dobozok nélkül.

Kisegítő lehetőségek, amelyek gördülékenyen beszélgetnek azokkal a felhasználókkal, akiknek gyors, természetes oda-vissza kapcsolatra van szükségük.

Megszakítható ügyfélszolgálati hangbotok prototípusa, amelyek visszacsatornáznak és reagálnak, miközben a hívó még beszél.

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Moshi Full-Duplex Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Szövegnormalizálás a beszédhez

Gyakran ismételt kérdések

What is Moshi Full-Duplex Speech?

A Moshi a Kyutai nyílt forráskódú, valós idejű hangos AI-ja, amely egyszerre beszél és hallgat – full-duplex – ahelyett, hogy szigorúan váltana. Ez megszünteti a hagyományos hangasszisztensek kínos késését és merev fordulatát.

Mit jelent a „full-duplex” a Moshi kontextusában?

A teljes duplex funkció azt jelenti, hogy a modell egyszerre kezeli a bejövő és a kimenő hangot, így beszéd közben is tud hallgatni, és természetesen kezeli a megszakításokat.

Melyik szervezet adta ki a Moshit?

A Moshi-t a Kyutai, egy francia mesterséges intelligenciakutató laboratórium fejlesztette ki és nyitotta meg 2024-ben.

Mi a Mimi a Moshi rendszerben?

A Mimi az a neurális audiokodek, amely a folyamatos beszédet a modell által generált diszkrét tokenek alacsony bitsebességű folyamává tömöríti.

Miben különbözik a Moshi a hagyományos hangasszisztens-csővezetéktől?

A hagyományos asszisztensek beszédet szöveggé, nyelvi modellt és szöveget beszédké láncolnak; A Moshi egyetlen beszéd-beszéd modell, amely folyamatosan kezeli a hangot.

Körülbelül milyen beszélgetési késleltetést céloz meg a Moshi?

A Moshi 160-200 ms körüli késleltetést ér el, ami jóval alacsonyabb, mint a tipikus hangasszisztensek, így természetes átfedést és megszakítást tesz lehetővé.