WaveNet
Το WaveNet, που εισήχθη από την DeepMind το 2016, ήταν ένα πρωτοποριακό νευρωνικό δίκτυο που παράγει ακατέργαστο ήχο ένα δείγμα τη φορά, παράγοντας εντυπωσιακά φυσική ομιλία και μουσική.
Επισκόπηση
It set the modern standard for high-fidelity text-to-speech.
Βαθιά κατάδυση
Το WaveNet είναι ένα αυτοπαλινδρομικό παραγωγικό μοντέλο: προβλέπει κάθε δείγμα ήχου που εξαρτάται από όλα τα δείγματα πριν από αυτό, συνήθως με 16.000 ή 24.000 δείγματα ανά δευτερόλεπτο. Η βασική του καινοτομία είναι μια στοίβα διευρυμένων αιτιακών συνελίξεων. Αιτιακή σημαίνει ότι το μοντέλο κοιτάζει μόνο προς τα πίσω στο χρόνο, διατηρώντας τη σειρά παραγωγής. Η διαστολή σημαίνει ότι κάθε στρώμα παρακάμπτει έναν εκθετικά αυξανόμενο αριθμό δειγμάτων, επομένως μια μέτρια στοίβα καλύπτει χιλιάδες δείγματα (ένα ευρύ δεκτικό πεδίο) χωρίς τεράστιο κόστος. Με βάση γλωσσικά χαρακτηριστικά ή φασματογράφημα μελ, το WaveNet παράγει ομιλία πολύ πιο φυσική από τους συνενωτικούς και παραμετρικούς κωδικοποιητές φωνής που προηγήθηκαν, κλείνοντας μεγάλο μέρος του κενού στις ανθρώπινες ηχογραφήσεις και τροφοδοτώντας τις πρώιμες εκδόσεις του Google Assistant.
Τεχνική διορατικότητα
Οι διευρυμένες περιελίξεις είναι το βασικό κόλπο: με ρυθμούς διαστολής 1, 2, 4, 8 και ούτω καθεξής, ένα δίκτυο βάθους μόνο δεκάδων στρωμάτων μπορεί να παρακολουθήσει χιλιάδες προηγούμενα δείγματα, αποτυπώνοντας τόσο λεπτές λεπτομέρειες κυματομορφής όσο και μεγαλύτερη προσωδιακή δομή. Η έξοδος μοντελοποιεί την τιμή κάθε δείγματος ως κατηγορηματική κατανομή (αρχικά 256 επίπεδα μέσω mu-law companding) και οι μονάδες ενεργοποίησης με περιορισμένη πρόσβαση συν υπολειμματικές συνδέσεις και συνδέσεις παράλειψης σταθεροποιούν την εκπαίδευση αυτής της πολύ βαθιάς στοίβας.
Στρατηγικός αντίκτυπος
Πρόσβαση και προσέγγιση χρηστών
Βελτιώνει την προσβασιμότητα μέσω διασυνδέσεων μεταγραφής, αφήγησης και φωνής.
Κόστος και προϋπολογισμός
Οι ομάδες πολυμέσων μπορούν να αποστέλλουν γυαλισμένο ήχο πιο γρήγορα με μικρότερους προϋπολογισμούς.
Ταχύτητα και κλίμακα
Τα συστήματα που αντιμετωπίζουν πελάτες μπορούν να επεξεργάζονται προφορικές αλληλεπιδράσεις σε μεγαλύτερη κλίμακα.
Το μέλλον της WaveNet
Το αρχικό WaveNet ήταν αργό επειδή η δειγματοληψία είναι διαδοχική. Οι διάδοχοι διόρθωσαν αυτό: Το Parallel WaveNet και το WaveRNN επέτρεψαν τη σύνθεση σε πραγματικό χρόνο και αργότερα τους κωδικοποιητές φωνής που βασίζονται σε ροή και GAN όπως το WaveGlow και το HiFi-GAN, καθώς και οι κωδικοποιητές φωνής διάχυσης, ώθησαν την ποιότητα και την ταχύτητα περαιτέρω. Οι ιδέες αυτοπαλίνδρομης, διευρυμένης συνέλιξης του WaveNet ζουν σε αυτά τα συστήματα και επηρέασαν αρχιτεκτονικές πολύ πέρα από τον ήχο, εδραιώνοντας την κληρονομιά του στη γενετική μοντελοποίηση.
Υλοποίηση σε πραγματικό κόσμο
Δημιουργία φωνών με φυσικό ήχο για Google Assistant και Google Cloud Text-to-Speech
Λειτουργεί ως νευρωνικός κωδικοποιητής φωνής που μετατρέπει τα φασματογράμματα mel σε κυματομορφές σε αγωγούς TTS όπως το Tacotron 2
Συνθέτοντας ρεαλιστική μουσική πιάνου και ορχηστρικής μουσικής από ακατέργαστο ήχο
Σύνθεση φωνής για εργαλεία προσβασιμότητας και αφήγηση ακουστικών βιβλίων
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Οι κίνδυνοι κατάχρησης φωνής και πλαστοπροσωπίας αυξάνονται όταν λείπει η συγκατάθεση.
Η ακρίβεια μπορεί να πέσει σε τόνους, διαλέκτους ή θορυβώδη περιβάλλοντα.
Ο συνθετικός ήχος μπορεί να εκληφθεί εσφαλμένα ως αυθεντική ομιλία χωρίς σαφή σήμανση.
Οδικός Χάρτης Εφαρμογής
Λάβετε ρητή συγκατάθεση για λήψη φωνής, κλωνοποίηση και επαναχρησιμοποίηση.
Δοκιμάστε την ποιότητα σε διαφορετικά ηχεία και συνθήκες φόντου.
Καθορίστε πότε ένας άνθρωπος πρέπει να επανεξετάσει ή να εγκρίνει τα αποτελέσματα.
Επισημάνετε τον συνθετικό ήχο και κρατήστε αρχεία προέλευσης για υπευθυνότητα.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WaveNet quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Ηχητική ανίχνευση Deepfake
Συχνές ερωτήσεις
What is WaveNet?
Το WaveNet, που εισήχθη από την DeepMind το 2016, ήταν ένα πρωτοποριακό νευρωνικό δίκτυο που παράγει ακατέργαστο ήχο ένα δείγμα τη φορά, παράγοντας εντυπωσιακά φυσική ομιλία και μουσική. Έθεσε τα σύγχρονα πρότυπα για μετατροπή κειμένου σε ομιλία υψηλής πιστότητας.
Πώς παράγει ήχο το WaveNet;
Το WaveNet είναι αυτοπαλινδρομικό: προβλέπει κάθε δείγμα ήχου με βάση τα δείγματα που προηγήθηκαν.
Ποια είναι η βασική συνελικτική καινοτομία στο WaveNet;
Οι διευρυμένες αιτιολογικές συνελίξεις επιτρέπουν στο δίκτυο να καλύπτει αποτελεσματικά χιλιάδες προηγούμενα δείγματα, ενώ κοιτάζει μόνο προς τα πίσω στο χρόνο.
Γιατί η διαστολή βοηθά το WaveNet;
Οι εκθετικά αυξανόμενοι ρυθμοί διαστολής δίνουν ένα ευρύ δεκτικό πεδίο σε χιλιάδες δείγματα με σχετικά λίγα στρώματα.
Ποιο ήταν ένα σημαντικό πρακτικό μειονέκτημα του αρχικού WaveNet;
Επειδή κάθε δείγμα εξαρτάται από τα προηγούμενα, η παραγωγή ήταν διαδοχική και επομένως αργή, παρακινώντας το Parallel WaveNet και άλλους διαδόχους.
Σε μια διοχέτευση κειμένου σε ομιλία, το WaveNet χρησιμεύει συχνά ως τι;
Το WaveNet μπορεί να πάρει ένα φασματόγραμμα mel (π.χ. από το Tacotron 2) και να παράγει την τελική κυματομορφή με φυσικό ήχο.