Audio AI ÚTMUTATÓ

Source-Filter Vocoding and WORLD

A vocoder egy olyan eszköz, amely a beszédet építőelemekre szedi, és újraépíti.

2 perc olvasásUtoljára frissítve

Áttekintés

A forrásszűrő modell és a WORLD vocoder klasszikus módszerek, amelyek a szöveg-beszéd és a hang konverziót erősítik azáltal, hogy elválasztják a hangszálaidat a szájad formától.

Mély merülés

A forrás-szűrő modell a beszédet úgy írja le, hogy két darab együtt működik: egy forrás (a rezgő hangszálak zümmögése a hangos hangokhoz, vagy zajos levegő a suttogásokhoz és mássalhangzókhoz), amely áthalad egy szűrőn (a torok, a száj és az orr rezonáns alakja). A vokóder elemzi a rögzített hangot, hogy megbecsülje ezeket a darabokat, majd új hangot szintetizál belőlük. A Masanori Morise által 2016 körül kiadott WORLD egy kiváló minőségű vokóder, amely három paramétert von ki: F0 (a forrás hangmagasság-kontúrja), a spektrális burkológörbe (a szűrő a CheapTrick algoritmuson keresztül) és az aperiodikitás (mennyi zaj a hanghoz képest a PLATINUM/D4C-n keresztül). Ez a három adatfolyam egymástól függetlenül módosítható, majd újraszintetizálható, így a WORLD a parametrikus TTS és az énekhangrendszerek munkalovasává válik.

Technikai betekintés

A VILÁG ereje a tiszta szétválasztásból származik. A CheapTrick sima spektrális burkológörbét becsül, amely robusztus a kis F0 hibákkal szemben, míg a DIO/Harvest pályahangmagasság és a D4C méri a sáv aperiodikusságát. Mivel a hangmagasság, a hangszín és a zaj különálló paraméterfolyamokban él, az F0-t egy oktávval feljebb tolhatja anélkül, hogy megváltoztatná a hang hangját, vagy meghosszabbíthatja az időtartamot anélkül, hogy megváltoztatná a hangmagasságot. A neurális vokóderek, mint például a WaveNet, később közvetlenül modellezték a hullámformát, de a WORLD továbbra is gyors, értelmezhető és licencmentes.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A Source-Filter Vocoding és a VILÁG jövője

A tiszta jelfeldolgozó vokódereket nagyrészt lehagyták a neurális vokóderek (HiFi-GAN, WaveRNN) a csúcstermészetesség miatt, de a WORLD nem tűnt el. Gyors, CPU-barát előtérként működik a hangkonverziós csővezetékeken, az éneklő szintetizátorokon és a kutatási alapvonalakon belül, és F0-plusz spektrális burkológörbe funkciói továbbra is számos neurális modellt táplálnak. Olyan hibrid rendszerekre számíthatunk, ahol VILÁG-stílusú, értelmezhető paraméterek irányítják a neurális dekódolókat, így az alkotók precízen szabályozhatják a hangmagasságot és a hangszínt a realizmus feláldozása nélkül.

Valós megvalósítás

Hangkonverziós eszközök, amelyek megváltoztatják a beszélő hangmagasságát és hangszínét, miközben a beszédet érthetően tartják

Énekhang szintetizátorok (mint például az UTAU/NNSVS ökoszisztéma), amelyek új hangmagasságnál újraszintetizálják a hangokat

Paraméteres szövegfelolvasó rendszerek, amelyek F0, spektrális és aperiodikus adatfolyamokat generálnak a vokódolás előtt

A beszédkutatás alapvonalai a hangmagasság eltolásához, az időnyújtáshoz és a prozódia szerkesztéshez átképzés nélkül

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Source-Filter Vocoding and WORLD quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Demucs zenei forrás elkülönítése

Gyakran ismételt kérdések

Mi az a Source-Filter Vocoding és a WORLD?

A vocoder egy olyan eszköz, amely a beszédet építőelemekre szedi, és újraépíti. A forrásszűrő modell és a WORLD vocoder klasszikus módszerek, amelyek a szöveg-beszéd és a hang konverziót erősítik azáltal, hogy elválasztják a hangszálaidat a szájad formától.

Mit jelent a „szűrő” a beszéd forrás-szűrő modelljében?

A szűrő a hangcsatorna rezonanciája – a torok, a száj és az orr formája, amely színezi a hangot. A forrás a hangszalag zümmögése vagy zajos légáramlás.

Melyik három paramétert vonja ki a WORLD vocoder a beszédből?

A WORLD a beszédet alapfrekvenciára (F0), spektrális burkológörbére (hangszín/szűrő) és aperiodicitásra (zaj/tónus egyensúly) bontja.

Mi a neve a WORLD spektrális burkológörbe becslésére szolgáló algoritmusának?

A CheapTrick sima spektrális burkológörbét becsül meg, amely robusztus a hangmagasság-becslés kis hibáira.

Miért hasznos a hangmagasság és a spektrális burkológörbe elválasztása?

Mivel a hangmagasság (F0) és a hangszín (spektrális burkológörbe) független adatfolyamok, növelheti vagy csökkentheti a hangmagasságot, miközben megőrzi a hangszóró azonosságát.

Miben hasonlít a WORLD az olyan neurális vokóderekhez, mint a HiFi-GAN?

A WORLD egy jelfeldolgozó vocoder: gyors, értelmezhető és CPU-barát. A neurális vokóderek általában magasabb természetességet érnek el, de nehezebbek.