Νευρωνικοί φωνοκωδικοποιητές
Ένας νευρικός φωνοκωδικοποιητής είναι ένα μοντέλο που μετατρέπει μια συμπαγή ακουστική αναπαράσταση, συνήθως ένα φασματογράφημα μελ, σε μια πραγματική ακουστική κυματομορφή.
Επισκόπηση
It is the final stage that gives modern text-to-speech and voice cloning their natural, human sound.
Βαθιά κατάδυση
Η παραδοσιακή σύνθεση ομιλίας χρησιμοποιούσε φωνοκωδικοποιητές επεξεργασίας σήματος που συχνά ακουγόταν βουητό ή ρομποτικό. Οι νευρωνικοί φωνοκωδικοποιητές μαθαίνουν να ανακατασκευάζουν ακατέργαστα δείγματα ήχου από ένα φασματόγραμμα εκπαιδεύοντας σε ώρες πραγματικών εγγραφών. Το WaveNet (DeepMind, 2016) ήταν η ανακάλυψη, προβλέποντας ήχο ένα δείγμα κάθε φορά με 16.000+ δείγματα ανά δευτερόλεπτο, παράγοντας εντυπωσιακά φυσική ομιλία αλλά πολύ αργά. Αργότερα μοντέλα αντάλλαξαν αυτό το αυτοπαλινδρομικό σημείο συμφόρησης για ταχύτητα: Το WaveGlow χρησιμοποίησε παραγωγή βασισμένη στη ροή, το Parallel WaveGAN και το MelGAN χρησιμοποίησαν δίκτυα παραγωγής αντιπάλου και το HiFi-GAN έγινε δημοφιλές πρότυπο δημιουργώντας ήχο υψηλής πιστότητας 22 kHz πολύ πιο γρήγορα από τον πραγματικό χρόνο. Σήμερα ο φωνοκωδικοποιητής είναι σχεδόν πάντα το δεύτερο μισό ενός αγωγού δύο σταδίων, σε συνδυασμό με ένα ακουστικό μοντέλο όπως το Tacotron 2 ή το FastSpeech που παράγει το φασματογράφημα μελ.
Τεχνική διορατικότητα
Ένα φασματογράφημα mel πετάει τις πληροφορίες φάσης του ήχου, διατηρώντας μόνο τον τρόπο με τον οποίο η ενέργεια κατανέμεται στις ζώνες συχνοτήτων με την πάροδο του χρόνου. Η δύσκολη δουλειά του φωνοκωδικοποιητή είναι να εφεύρει μια εύλογη, συνεκτική κυματομορφή της οποίας το φάσμα μεγέθους ταιριάζει με αυτή την είσοδο. Οι κωδικοποιητές φωνής που βασίζονται σε GAN, όπως το HiFi-GAN, χρησιμοποιούν πολλαπλούς διαχωριστές που επιθεωρούν το σήμα σε διαφορετικές κλίμακες και περιοδικότητες, ωθώντας τη γεννήτρια να παράγει ρεαλιστικές λεπτές λεπτομέρειες, όπως αρμονικές και αιχμηρές μεταβατικές αλλαγές συμφώνων.
Στρατηγικός αντίκτυπος
Πρόσβαση και προσέγγιση χρηστών
Βελτιώνει την προσβασιμότητα μέσω διασυνδέσεων μεταγραφής, αφήγησης και φωνής.
Κόστος και προϋπολογισμός
Οι ομάδες πολυμέσων μπορούν να αποστέλλουν γυαλισμένο ήχο πιο γρήγορα με μικρότερους προϋπολογισμούς.
Ταχύτητα και κλίμακα
Τα συστήματα που αντιμετωπίζουν πελάτες μπορούν να επεξεργάζονται προφορικές αλληλεπιδράσεις σε μεγαλύτερη κλίμακα.
Το μέλλον των νευρωνικών φωνοκωδικοποιητών
Οι κωδικοποιητές φωνής γίνονται μικρότεροι και πιο γρήγοροι, ώστε να μπορούν να λειτουργούν σε τηλέφωνα και ενσωματωμένες συσκευές χωρίς σύνδεση στο cloud. Υπάρχει επίσης μια ώθηση προς καθολικούς φωνοκωδικοποιητές που γενικεύονται σε οποιονδήποτε ομιλητή, γλώσσα, τραγούδι ή ακόμα και μη ομιλικό ήχο χωρίς επανεκπαίδευση. Μια παράλληλη τάση διπλώνει τον φωνοκωδικοποιητή απευθείας σε συστήματα από άκρο σε άκρο και νευρικούς κωδικοποιητές, θολώνοντας τη γραμμή μεταξύ ξεχωριστών σταδίων ακουστικής και κυματομορφής και μειώνοντας τα τεχνουργήματα που εισάγονται περνώντας μέσα από ένα ενδιάμεσο φασματόγραμμα.
Υλοποίηση σε πραγματικό κόσμο
Δημιουργία του τελικού προφορικού ήχου σε βοηθούς μετατροπής κειμένου σε ομιλία, όπως προγράμματα ανάγνωσης οθόνης και εφαρμογές πλοήγησης
Παραγωγή κλωνοποιημένων φωνών με φυσικό ήχο σε εργαλεία μεταγλώττισης και αφήγησης ακουστικών βιβλίων
Ανακατασκευή φωνών τραγουδιού σε μουσική AI και λογισμικό εικονικών τραγουδιστών
Τροφοδοσία εξόδου φωνής στη συσκευή για έξυπνα ηχεία και συσκευές προσβασιμότητας χωρίς διακομιστές μετ' επιστροφής
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Οι κίνδυνοι κατάχρησης φωνής και πλαστοπροσωπίας αυξάνονται όταν λείπει η συγκατάθεση.
Η ακρίβεια μπορεί να πέσει σε τόνους, διαλέκτους ή θορυβώδη περιβάλλοντα.
Ο συνθετικός ήχος μπορεί να εκληφθεί εσφαλμένα ως αυθεντική ομιλία χωρίς σαφή σήμανση.
Οδικός Χάρτης Εφαρμογής
Λάβετε ρητή συγκατάθεση για λήψη φωνής, κλωνοποίηση και επαναχρησιμοποίηση.
Δοκιμάστε την ποιότητα σε διαφορετικά ηχεία και συνθήκες φόντου.
Καθορίστε πότε ένας άνθρωπος πρέπει να επανεξετάσει ή να εγκρίνει τα αποτελέσματα.
Επισημάνετε τον συνθετικό ήχο και κρατήστε αρχεία προέλευσης για υπευθυνότητα.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Neural Vocoders quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
HiFi-GAN και GAN Vocoders
Συχνές ερωτήσεις
What is Neural Vocoders?
Ένας νευρικός φωνοκωδικοποιητής είναι ένα μοντέλο που μετατρέπει μια συμπαγή ακουστική αναπαράσταση, συνήθως ένα φασματογράφημα μελ, σε μια πραγματική ακουστική κυματομορφή. Είναι το τελικό στάδιο που δίνει στο σύγχρονο κείμενο σε ομιλία και κλωνοποίηση φωνής τον φυσικό, ανθρώπινο ήχο τους.
Ποια είναι η κύρια δουλειά ενός νευρικού φωνοκωδικοποιητή;
Ένας νευρικός φωνοκωδικοποιητής λαμβάνει ένα συμπαγές ακουστικό χαρακτηριστικό, συνήθως ένα φασματογράφημα mel, και συνθέτει την πραγματική ακατέργαστη ακουστική κυματομορφή που ακούτε.
Ποιο μοντέλο του 2016 ήταν η σημαντική ανακάλυψη που έκανε τους νευρικούς φωνοκωδικοποιητές να ακούγονται φυσικοί;
Η WaveNet, από την DeepMind το 2016, παρήγαγε δείγματα ήχου και παρήγαγε εντυπωσιακά φυσική ομιλία, ξεκινώντας την εποχή των νευρωνικών φωνοκωδικοποιητών.
Γιατί το αρχικό WaveNet άργησε να παράγει ήχο;
Το WaveNet είναι αυτοπαλινδρομικό: κάθε δείγμα ήχου εξαρτάται από τα προηγούμενα, επομένως η δημιουργία δεκάδων χιλιάδων δειγμάτων ανά δευτερόλεπτο ήταν υπολογιστικά δαπανηρή.
Ποιες πληροφορίες απορρίπτει ένα φασματογράφημα mel, καθιστώντας το έργο του κωδικοποιητή φωνής πιο δύσκολο;
Τα φασματογράμματα Mel διατηρούν το μέγεθος (ενέργεια ανά ζώνη συχνοτήτων) αλλά τη φάση πτώσης, επομένως ο κωδικοποιητής φωνής πρέπει να ανακατασκευάσει μια συνεκτική κυματομορφή της οποίας η φάση είναι εύλογη.
Πώς οι κωδικοποιητές φωνής που βασίζονται σε GAN, όπως το HiFi-GAN, βελτιώνουν τον ρεαλισμό;
Το HiFi-GAN χρησιμοποιεί αρκετούς διαχωριστές που επιθεωρούν διαφορετικές χρονικές κλίμακες και περιοδικότητες, ωθώντας τη γεννήτρια να παράγει ρεαλιστικές αρμονικές και μεταβατικές.