Audio AI ÚTMUTATÓ

WaveNet

A DeepMind által 2016-ban bevezetett WaveNet egy áttörést jelentő neurális hálózat volt, amely egy-egy mintát generál nyers hanganyagot, és meglepően természetes beszédet és zenét hoz létre.

2 perc olvasásUtoljára frissítve

Áttekintés

It set the modern standard for high-fidelity text-to-speech.

Mély merülés

A WaveNet egy autoregresszív generatív modell: megjósolja minden egyes hangmintát, amely az előtte lévő összes mintán alapul, jellemzően 16 000 vagy 24 000 minta/másodperc sebességgel. Alapvető innovációja kitágult ok-okozati konvolúciók halmaza. Az ok-okozati összefüggés azt jelenti, hogy a modell csak visszafelé tekint az időben, megőrizve a generációs sorrendet; A dilatáció azt jelenti, hogy minden réteg exponenciálisan növekvő számú mintát hagy ki, így egy szerény köteg több ezer mintát fed le (széles receptív mező) óriási költségek nélkül. A nyelvi jellemzőkre vagy egy mel-spektrogramra támaszkodó WaveNet sokkal természetesebb beszédet produkál, mint az azt megelőző konkatenatív és parametrikus vokóderek, ezzel nagyrészt bezárja a lemaradást az emberi felvételekhez képest, és megerősíti a Google Assistant korai verzióit.

Technikai betekintés

A tágított konvolúció a kulcsfontosságú trükk: az 1, 2, 4, 8 stb. tágulási rátákkal csak több tíz réteg mélységű hálózat képes több ezer múltbéli mintára figyelni, és rögzíti a hullámforma finom részleteit és a hosszabb prozódiai struktúrát. A kimenet kategorikus eloszlásként modellezi az egyes minták értékét (eredetileg 256 szint a mu-law kompandálás révén), és a kapuzott aktiválási egységek, valamint a maradék és kihagyó kapcsolatok stabilizálják ennek a nagyon mély veremnek a képzését.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A WaveNet jövője

Az eredeti WaveNet lassú volt, mert a mintavétel szekvenciális. Az utódok javították ezt: a Parallel WaveNet és a WaveRNN lehetővé tette a valós idejű szintézist, majd a későbbi áramlás- és GAN-alapú vokoderek, mint például a WaveGlow és a HiFi-GAN, valamint a diffúziós vokoderek tovább növelték a minőséget és a sebességet. A WaveNet autoregresszív, dilatált konvolúciós ötletei tovább élnek ezekben a rendszerekben, és a hangon túlmutató architektúrákat is befolyásoltak, megerősítve örökségét a generatív modellezésben.

Valós megvalósítás

Természetes hangzású hangok generálása a Google Asszisztenshez és a Google Cloud Text-to-Speech-hez

Neurális vokóderként működik, amely a mel-spektrogramokat hullámformákká alakítja a TTS-csővezetékekben, például a Tacotron 2-ben

Valósághű zongora- és hangszeres zene szintetizálása nyers hangból

Hangszintézis a kisegítő lehetőségekhez és a hangoskönyvek narrációjához

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WaveNet quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Hang mélyhamisítás észlelése

Gyakran ismételt kérdések

What is WaveNet?

A DeepMind által 2016-ban bevezetett WaveNet egy áttörést jelentő neurális hálózat volt, amely egy-egy mintát generál nyers hanganyagot, és meglepően természetes beszédet és zenét hoz létre. Ez felállította a nagy pontosságú szövegfelolvasó modern szabványát.

Hogyan generál hangot a WaveNet?

A WaveNet autoregresszív: minden hangmintát megjósol az előtte lévő minták alapján.

Mi a legfontosabb konvolúciós innováció a WaveNetben?

A kitágult kauzális konvolúciók lehetővé teszik, hogy a hálózat hatékonyan lefedje a múltbeli minták ezreit, miközben csak visszafelé tekint az időben.

Miért segít a tágulás a WaveNeten?

Az exponenciálisan növekvő dilatációs ráták széles befogadó mezőt adnak több ezer mintán, viszonylag kevés réteggel.

Mi volt az eredeti WaveNet fő gyakorlati hátránya?

Mivel minden minta az előzőektől függ, a generálás szekvenciális volt, ezért lassú volt, motiválva a Parallel WaveNet és más utódokat.

A WaveNet gyakran miként szolgál a szöveg-beszéd folyamatban?

A WaveNet felvehet egy mel-spektrogramot (például a Tacotron 2-ből), és előállíthatja a végső, természetes hangú hullámformát.