ΟΔΗΓΟΣ Audio AI

Κωδικοποιητής φωνής που βασίζεται σε ροή WaveGlow

Το WaveGlow είναι ένας νευρωνικός φωνοκωδικοποιητής που βασίζεται στη ροή της NVIDIA που συνθέτει κυματομορφές ομιλίας από φασματογράμματα mel σε ένα μόνο πέρασμα χωρίς αυτοπαλίνδρομο.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It matters because it delivers high-quality audio faster than real time using only a simple likelihood loss.

Βαθιά κατάδυση

Το WaveGlow, που κυκλοφόρησε από τις Prenger, Valle και Catanzaro στη NVIDIA το 2018, συνδυάζει ιδέες από το Glow και το WaveNet για να δημιουργήσει έναν φωνοκωδικοποιητή που είναι γρήγορος και εύκολος στην εκπαίδευση. Σε αντίθεση με τους φωνοκωδικοποιητές GAN, είναι μια κανονικοποιητική ροή: μαθαίνει μια αναστρέψιμη χαρτογράφηση μεταξύ μιας απλής κατανομής Gauss και της ακουστικής κυματομορφής, που εξαρτάται από το φασματογράφημα mel. Η εκπαίδευση μεγιστοποιεί την ακριβή πιθανότητα καταγραφής των δεδομένων, επομένως δεν χρειάζεται ξεχωριστός διαχωριστής, αυτόματη παλινδρόμηση και απόσταξη δύο δικτύων δασκάλου-μαθητή που απαιτούσαν προηγούμενες παράλληλες προσεγγίσεις WaveNet. Για να δημιουργήσετε ήχο, δοκιμάζετε τον Gaussian θόρυβο και εκτελείτε το αναστρέψιμο δίκτυο αντίστροφα. Το WaveGlow παράγει ομιλία με ποιότητα συγκρίσιμη με το WaveNet ενώ συνθέτει πολύ πιο γρήγορα από τον πραγματικό χρόνο σε μια σύγχρονη GPU.

Τεχνική διορατικότητα

Το WaveGlow στοιβάζει βήματα αναστρέψιμης ροής, καθένα από τα οποία συνδυάζει ένα συγγενικό στρώμα σύζευξης με μια αναστρέψιμη συνέλιξη 1x1 δανεισμένη από το Glow. Τα δείγματα ήχου ομαδοποιούνται σε διανύσματα μέσω μιας λειτουργίας συμπίεσης, ώστε τα στρώματα σύζευξης να μπορούν να τα μεταμορφώσουν αποτελεσματικά. Επειδή κάθε βήμα είναι αντιστρέψιμο, η κατεύθυνση προς τα εμπρός υπολογίζει την πιθανότητα για εκπαίδευση και η αντίστροφη κατεύθυνση αντιστοιχίζει το θόρυβο στον ήχο για συμπέρασμα. Ένα ενιαίο δίκτυο και ένας στόχος αρνητικής πιθανότητας καταγραφής καθιστούν την εκπαίδευση ιδιαίτερα σταθερή και απλή.

Στρατηγικός αντίκτυπος

Πρόσβαση και προσέγγιση χρηστών

Βελτιώνει την προσβασιμότητα μέσω διασυνδέσεων μεταγραφής, αφήγησης και φωνής.

Κόστος και προϋπολογισμός

Οι ομάδες πολυμέσων μπορούν να αποστέλλουν γυαλισμένο ήχο πιο γρήγορα με μικρότερους προϋπολογισμούς.

Ταχύτητα και κλίμακα

Τα συστήματα που αντιμετωπίζουν πελάτες μπορούν να επεξεργάζονται προφορικές αλληλεπιδράσεις σε μεγαλύτερη κλίμακα.

Το μέλλον του φωνοκωδικοποιητή που βασίζεται σε ροή WaveGlow

Το WaveGlow έδειξε ότι οι κωδικοποιητές φωνής καθαρής ροής μπορούν να ανταγωνιστούν την αυτοπαλινδρομική ποιότητα, επηρεάζοντας μεταγενέστερα μοντέλα ήχου που ταιριάζουν με τη ροή και τη ροή. Η απλότητά του με μία απώλεια παραμένει ελκυστική, αν και οι φωνοκωδικοποιητές GAN όπως το HiFi-GAN κερδίζουν τώρα συχνά σε μέγεθος και ταχύτητα. Κοιτάζοντας το μέλλον, οι ιδέες που βασίζονται στη ροή και οι αντιστοιχίσεις ροής αναβιώνουν στα μοντέρνα TTS που γειτνιάζουν με τη διάχυση και τα αναστρέψιμα σχέδια τύπου WaveGlow συνεχίζουν να ενημερώνουν την έρευνα σχετικά με την ακριβή, ελεγχόμενη και αποτελεσματική παραγωγή κυματομορφών.

Υλοποίηση σε πραγματικό κόσμο

Σύζευξη με το Tacotron 2 στον αγωγό αναφοράς TTS της NVIDIA για παραγωγή ομιλίας φυσικής ποιότητας στούντιο

Γρήγορη σύνθεση ομιλίας GPU για ροές εργασίας αφήγησης, μεταγλώττισης και δημιουργίας περιεχομένου

Δημιουργία εκπαίδευσης και ήχου επίδειξης στην έρευνα όπου προτιμάται η σταθερή προπόνηση με μία απώλεια

Έξοδος φωνής σε πραγματικό χρόνο σε διαδραστικά συστήματα που τρέχουν σε υλικό NVIDIA

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Οι κίνδυνοι κατάχρησης φωνής και πλαστοπροσωπίας αυξάνονται όταν λείπει η συγκατάθεση.

Η ακρίβεια μπορεί να πέσει σε τόνους, διαλέκτους ή θορυβώδη περιβάλλοντα.

Ο συνθετικός ήχος μπορεί να εκληφθεί εσφαλμένα ως αυθεντική ομιλία χωρίς σαφή σήμανση.

Οδικός Χάρτης Εφαρμογής

1

Λάβετε ρητή συγκατάθεση για λήψη φωνής, κλωνοποίηση και επαναχρησιμοποίηση.

2

Δοκιμάστε την ποιότητα σε διαφορετικά ηχεία και συνθήκες φόντου.

3

Καθορίστε πότε ένας άνθρωπος πρέπει να επανεξετάσει ή να εγκρίνει τα αποτελέσματα.

4

Επισημάνετε τον συνθετικό ήχο και κρατήστε αρχεία προέλευσης για υπευθυνότητα.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WaveGlow Flow-Based Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Δημιουργία ομιλίας με αντιστοίχιση ροής φωνής

Συχνές ερωτήσεις

What is WaveGlow Flow-Based Vocoder?

Το WaveGlow είναι ένας νευρωνικός φωνοκωδικοποιητής που βασίζεται στη ροή της NVIDIA που συνθέτει κυματομορφές ομιλίας από φασματογράμματα mel σε ένα μόνο πέρασμα χωρίς αυτοπαλίνδρομο. Έχει σημασία γιατί παρέχει ήχο υψηλής ποιότητας πιο γρήγορα από τον πραγματικό χρόνο χρησιμοποιώντας μόνο μια απλή απώλεια πιθανότητας.

Το WaveGlow συνδυάζει αρχιτεκτονικές ιδέες από ποια δύο μοντέλα;

Το WaveGlow συνδυάζει τη δομή αναστρέψιμης ροής του Glow με τον σχεδιασμό μοντελοποίησης ήχου του WaveNet.

Τι είδους μοντέλο είναι το WaveGlow;

Το WaveGlow είναι μια κανονικοποιητική ροή που μαθαίνει μια αναστρέψιμη αντιστοίχιση μεταξύ του Gaussian θορύβου και του ήχου.

Πώς το WaveGlow δημιουργεί μια κυματομορφή κατά το χρόνο συμπερασμάτων;

Επειδή το δίκτυο είναι αντιστρέψιμο, αντλείτε θόρυβο Gauss και τρέχετε τη ροή προς τα πίσω, υπό τον όρο του φασματογράφου mel.

Ποιο στόχο βελτιστοποιεί το WaveGlow κατά τη διάρκεια της εκπαίδευσης;

Ως ροή, το WaveGlow μεγιστοποιεί την ακριβή πιθανότητα καταγραφής, χωρίς να απαιτείται διάκριση ή απόσταξη.

Ποια δύο στοιχεία αποτελούν κάθε αναστρέψιμο βήμα στο WaveGlow;

Κάθε βήμα ροής συνδυάζει ένα στρώμα συγγενικής σύζευξης με μια αναστρέψιμη συνέλιξη 1x1 που υιοθετήθηκε από το Glow.