Μοντέλα γλώσσας VALL-E και Codec
Το VALL-E αναδιαμόρφωσε τη μετατροπή κειμένου σε ομιλία ως πρόβλημα μοντελοποίησης γλώσσας σε διακριτικά κωδικοποιητή ήχου, επιτρέποντας την κλωνοποίηση φωνής από μόλις τρία δευτερόλεπτα δείγματος.
Επισκόπηση
It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.
Βαθιά κατάδυση
Ανακοινώθηκε από την Microsoft στις αρχές του 2023, το VALL-E αντιμετωπίζει τη σύνθεση ομιλίας σαν μοντελοποίηση γλώσσας. Αντί να προβλέπει ένα φασματόγραμμα, προβλέπει τα διακριτά ακουστικά διακριτικά ενός νευρικού κωδικοποιητή (EnCodec), έτσι η γενιά γίνεται πρόβλεψη επόμενου συμβολικού σε ένα ακουστικό λεξιλόγιο. Δεδομένης μιας εγγραφής 3 δευτερολέπτων ενός αόρατου ηχείου και του κειμένου στόχου, το VALL-E συνεχίζει με τη φωνή αυτού του ομιλητή, διατηρώντας το ηχόχρωμα και ακόμη και το ακουστικό περιβάλλον. Εκπαιδεύτηκε σε περίπου 60.000 ώρες ομιλίας, πολύ περισσότερες από τα τυπικά σύνολα δεδομένων TTS, τα οποία του έδωσαν ισχυρή κλωνοποίηση μηδενικής λήψης. Επειδή τα διακριτικά κωδικοποιητή είναι πολυεπίπεδα (μέσω RVQ), το VALL-E χρησιμοποιεί δύο στάδια: ένα αυτοπαλινδρομικό μοντέλο προβλέπει την πρώτη, χονδροειδή ροή διακριτικών που εξαρτάται από την προτροπή και ένα μη αυτοπαλινδρομικό μοντέλο συμπληρώνει τα υπόλοιπα διακριτικά λεπτομερειών. Αυτή η συνταγή κωδικοποιητή-LM ενέπνευσε διαδόχους όπως το VALL-E 2 και πολλά μοντέλα βάσης ομιλίας.
Τεχνική διορατικότητα
Το κόλπο είναι η υβριδική αποκωδικοποίηση πάνω από ιεραρχικά διακριτικά κωδικοποιητή. Το αυτοπαλινδρομικό στάδιο προβλέπει τα πιο σημαντικά διακριτικά του πρώτου βιβλίου κωδικών ένα κάθε φορά, συλλαμβάνοντας την προσωδία και το περιεχόμενο. Τα υπόλοιπα βιβλία κωδικών, τα οποία προσθέτουν λεπτή ακουστική λεπτομέρεια, προβλέπονται παράλληλα από ένα μη-αυτοπαλινδρομικό μοντέλο που εξαρτάται από την πρώτη ροή και την προτροπή του ηχείου. Αυτός ο διαχωρισμός διατηρεί την ποιότητα σε υψηλά επίπεδα, ενώ αποφεύγει το κόστος της διαδοχικής παραγωγής κάθε διακριτικού και η χρήση κωδικοποιητή σημαίνει ότι η ομιλία και το κείμενο μπορούν να μοντελοποιηθούν με τον ίδιο μηχανισμό μετασχηματιστή.
Στρατηγικός αντίκτυπος
Πρόσβαση και προσέγγιση χρηστών
Βελτιώνει την προσβασιμότητα μέσω διασυνδέσεων μεταγραφής, αφήγησης και φωνής.
Κόστος και προϋπολογισμός
Οι ομάδες πολυμέσων μπορούν να αποστέλλουν γυαλισμένο ήχο πιο γρήγορα με μικρότερους προϋπολογισμούς.
Ταχύτητα και κλίμακα
Τα συστήματα που αντιμετωπίζουν πελάτες μπορούν να επεξεργάζονται προφορικές αλληλεπιδράσεις σε μεγαλύτερη κλίμακα.
Το μέλλον των μοντέλων γλώσσας VALL-E και Codec
Τα μοντέλα γλώσσας κωδικοποιητή συγχωνεύουν την ομιλία με μεγάλα γλωσσικά μοντέλα, δείχνοντας προς ενοποιημένα συστήματα που ακούν, συλλογίζονται και μιλούν σε ένα μοντέλο. Περιμένετε καλύτερη σταθερότητα και λιγότερα τεχνουργήματα, δημιουργία ροής σε πραγματικό χρόνο και αυστηρότερο έλεγχο των συναισθημάτων και του στυλ. Η ίδια ισχυρή κλωνοποίηση που κάνει το VALL-E χρήσιμο για προσβασιμότητα και μεταγλώττιση εγείρει επίσης ανησυχίες για το deepfake και τη συναίνεση, επομένως η υδατογράφηση, οι διασφαλίσεις φωνητικής επαλήθευσης και τα προστατευτικά κιγκλιδώματα πολιτικής γίνονται κεντρικό μέρος του τρόπου με τον οποίο αναπτύσσονται αυτά τα συστήματα.
Υλοποίηση σε πραγματικό κόσμο
Κλωνοποίηση φωνής από μερικά δευτερόλεπτα ήχου για εξατομικευμένους βοηθούς ή εργαλεία προσβασιμότητας που αποκαθιστούν μια χαμένη φωνή
Εντοπισμός και μεταγλώττιση βίντεο σε άλλες γλώσσες, διατηρώντας παράλληλα το ηχόχρωμα του αρχικού ομιλητή
Δημιουργία εκφραστικής αφήγησης που ταιριάζει με το πλαίσιο που διατηρεί το ακουστικό περιβάλλον μιας ηχογράφησης
Λειτουργεί ως η ραχοκοκαλιά ομιλίας σε βοηθούς πολλαπλών τρόπων που κατανοούν και παράγουν προφορικό ήχο
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Οι κίνδυνοι κατάχρησης φωνής και πλαστοπροσωπίας αυξάνονται όταν λείπει η συγκατάθεση.
Η ακρίβεια μπορεί να πέσει σε τόνους, διαλέκτους ή θορυβώδη περιβάλλοντα.
Ο συνθετικός ήχος μπορεί να εκληφθεί εσφαλμένα ως αυθεντική ομιλία χωρίς σαφή σήμανση.
Οδικός Χάρτης Εφαρμογής
Λάβετε ρητή συγκατάθεση για λήψη φωνής, κλωνοποίηση και επαναχρησιμοποίηση.
Δοκιμάστε την ποιότητα σε διαφορετικά ηχεία και συνθήκες φόντου.
Καθορίστε πότε ένας άνθρωπος πρέπει να επανεξετάσει ή να εγκρίνει τα αποτελέσματα.
Επισημάνετε τον συνθετικό ήχο και κρατήστε αρχεία προέλευσης για υπευθυνότητα.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VALL-E and Codec Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Αναδυόμενες Ικανότητες Μεγάλων Γλωσσικών Μοντέλων
Συχνές ερωτήσεις
What is VALL-E and Codec Language Models?
Το VALL-E αναδιαμόρφωσε τη μετατροπή κειμένου σε ομιλία ως πρόβλημα μοντελοποίησης γλώσσας σε διακριτικά κωδικοποιητή ήχου, επιτρέποντας την κλωνοποίηση φωνής από μόλις τρία δευτερόλεπτα δείγματος. Έδειξε ότι τα ίδια LLM με το ίδιο κείμενο πρόβλεψης μπορούν να δημιουργήσουν εξαιρετικά φυσική, εκφραστική ομιλία.
Ποια βασική ιδέα διακρίνει το VALL-E από τα προηγούμενα συστήματα μετατροπής κειμένου σε ομιλία;
Το VALL-E επαναπλαισιώνει το TTS ως πρόβλεψη επόμενου διακριτικού σε διακριτά διακριτικά κωδικοποιητή ήχου, αντιμετωπίζοντας τη δημιουργία ομιλίας σαν μοντέλο γλώσσας.
Πόσο ήχο αναφοράς χρειάζεται το VALL-E για να κλωνοποιήσει τη φωνή ενός νέου ομιλητή;
Το VALL-E μπορεί να εκτελέσει κλωνοποίηση φωνής μηδενικής λήψης από ένα δείγμα περίπου 3 δευτερολέπτων ενός αόρατου ηχείου.
Ποιον νευρωνικό κωδικοποιητή χρησιμοποιεί το VALL-E για να παράγει τα διακριτικά ήχου του;
Το VALL-E βασίζεται στο EnCodec του Meta, προβλέποντας τα διακριτά ακουστικά διακριτικά του για τη σύνθεση ομιλίας.
Γιατί το VALL-E χρησιμοποιεί τόσο αυτοπαλινδρομικό όσο και μη αυτοπαλινδρομικό στάδιο;
Τα διακριτικά Codec είναι ιεραρχικά μέσω RVQ. Το VALL-E προβλέπει την πρώτη χονδροειδή ροή αυτοπαλινδρομικά και τα υπόλοιπα διακριτικά λεπτομέρειας παράλληλα για αποτελεσματικότητα.
Περίπου σε πόσα δεδομένα ομιλίας εκπαιδεύτηκε το VALL-E, επιτρέποντας ισχυρή κλωνοποίηση μηδενικής λήψης;
Το VALL-E εκπαιδεύτηκε σε περίπου 60.000 ώρες ομιλίας, πολύ περισσότερες από τα τυπικά σύνολα δεδομένων TTS, τα οποία ενίσχυσαν τη γενίκευσή του στο μηδέν.