WaveNet
A DeepMind által 2016-ban bevezetett WaveNet egy áttörést jelentő neurális hálózat volt, amely egy-egy mintát generál nyers hanganyagot, és meglepően természetes beszédet és zenét hoz létre.
Áttekintés
It set the modern standard for high-fidelity text-to-speech.
Mély merülés
A WaveNet egy autoregresszív generatív modell: megjósolja minden egyes hangmintát, amely az előtte lévő összes mintán alapul, jellemzően 16 000 vagy 24 000 minta/másodperc sebességgel. Alapvető innovációja kitágult ok-okozati konvolúciók halmaza. Az ok-okozati összefüggés azt jelenti, hogy a modell csak visszafelé tekint az időben, megőrizve a generációs sorrendet; A dilatáció azt jelenti, hogy minden réteg exponenciálisan növekvő számú mintát hagy ki, így egy szerény köteg több ezer mintát fed le (széles receptív mező) óriási költségek nélkül. A nyelvi jellemzőkre vagy egy mel-spektrogramra támaszkodó WaveNet sokkal természetesebb beszédet produkál, mint az azt megelőző konkatenatív és parametrikus vokóderek, ezzel nagyrészt bezárja a lemaradást az emberi felvételekhez képest, és megerősíti a Google Assistant korai verzióit.
Technikai betekintés
A tágított konvolúció a kulcsfontosságú trükk: az 1, 2, 4, 8 stb. tágulási rátákkal csak több tíz réteg mélységű hálózat képes több ezer múltbéli mintára figyelni, és rögzíti a hullámforma finom részleteit és a hosszabb prozódiai struktúrát. A kimenet kategorikus eloszlásként modellezi az egyes minták értékét (eredetileg 256 szint a mu-law kompandálás révén), és a kapuzott aktiválási egységek, valamint a maradék és kihagyó kapcsolatok stabilizálják ennek a nagyon mély veremnek a képzését.
Stratégiai hatás
Hozzáférés és elérés
Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.
Költség és költségvetés
A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.
Sebesség és méretarány
Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.
A WaveNet jövője
Az eredeti WaveNet lassú volt, mert a mintavétel szekvenciális. Az utódok javították ezt: a Parallel WaveNet és a WaveRNN lehetővé tette a valós idejű szintézist, majd a későbbi áramlás- és GAN-alapú vokoderek, mint például a WaveGlow és a HiFi-GAN, valamint a diffúziós vokoderek tovább növelték a minőséget és a sebességet. A WaveNet autoregresszív, dilatált konvolúciós ötletei tovább élnek ezekben a rendszerekben, és a hangon túlmutató architektúrákat is befolyásoltak, megerősítve örökségét a generatív modellezésben.
Valós megvalósítás
Természetes hangzású hangok generálása a Google Asszisztenshez és a Google Cloud Text-to-Speech-hez
Neurális vokóderként működik, amely a mel-spektrogramokat hullámformákká alakítja a TTS-csővezetékekben, például a Tacotron 2-ben
Valósághű zongora- és hangszeres zene szintetizálása nyers hangból
Hangszintézis a kisegítő lehetőségekhez és a hangoskönyvek narrációjához
Kockázatok és védőkorlátok
A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.
A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.
A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.
Végrehajtási ütemterv
Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.
Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.
Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.
Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WaveNet quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Hang mélyhamisítás észlelése
Gyakran ismételt kérdések
What is WaveNet?
A DeepMind által 2016-ban bevezetett WaveNet egy áttörést jelentő neurális hálózat volt, amely egy-egy mintát generál nyers hanganyagot, és meglepően természetes beszédet és zenét hoz létre. Ez felállította a nagy pontosságú szövegfelolvasó modern szabványát.
Hogyan generál hangot a WaveNet?
A WaveNet autoregresszív: minden hangmintát megjósol az előtte lévő minták alapján.
Mi a legfontosabb konvolúciós innováció a WaveNetben?
A kitágult kauzális konvolúciók lehetővé teszik, hogy a hálózat hatékonyan lefedje a múltbeli minták ezreit, miközben csak visszafelé tekint az időben.
Miért segít a tágulás a WaveNeten?
Az exponenciálisan növekvő dilatációs ráták széles befogadó mezőt adnak több ezer mintán, viszonylag kevés réteggel.
Mi volt az eredeti WaveNet fő gyakorlati hátránya?
Mivel minden minta az előzőektől függ, a generálás szekvenciális volt, ezért lassú volt, motiválva a Parallel WaveNet és más utódokat.
A WaveNet gyakran miként szolgál a szöveg-beszéd folyamatban?
A WaveNet felvehet egy mel-spektrogramot (például a Tacotron 2-ből), és előállíthatja a végső, természetes hangú hullámformát.