ΟΔΗΓΟΣ Audio AI

StyleTTS 2 Διάχυση στυλ

Το StyleTTS 2 είναι ένα μοντέλο μετατροπής κειμένου σε ομιλία που αντιμετωπίζει το «στυλ» της φωνής — προσωδία, συναίσθημα και χροιά ομιλητή — ως τυχαία μεταβλητή που δειγματοληψία με ένα μοντέλο διάχυσης, στη συνέχεια συνθέτει ήχο με αντίθετη εκπαίδευση έναντι ενός μεγάλου μοντέλου γλώσσας ομιλίας.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It matters because it reached human-level naturalness on single-speaker benchmarks without needing a reference clip at inference time.

Βαθιά κατάδυση

Το StyleTTS 2, που κυκλοφόρησε το 2023 από ερευνητές στο Πανεπιστήμιο της Κολούμπια, παράγει ομιλία δειγματίζοντας πρώτα ένα λανθάνον «διάνυσμα στυλ» χρησιμοποιώντας μια διαδικασία διάχυσης που εξαρτάται μόνο από το κείμενο εισόδου, και στη συνέχεια αποκωδικοποιώντας αυτό το στυλ συν τα φωνήματα σε κυματομορφή. Το διάνυσμα στυλ ελέγχει όλα όσα δεν γράφονται στο κείμενο: ρυθμός ομιλίας, περίγραμμα επιτονισμού, παύσεις και συναισθηματικό χρωματισμό. Κυρίως, προσθέτει εκπαίδευση αντιπάλου με μεγάλα προ-εκπαιδευμένα μοντέλα γλώσσας ομιλίας (WavLM) ως διακριτικά, ωθώντας την έξοδο προς τον αυθεντικό ήχο που ακούγεται στον άνθρωπο. Στο σημείο αναφοράς LJSpeech ξεπέρασε τις ανθρώπινες ηχογραφήσεις σε βαθμολογίες ακροατών, και στο LibriTTS με πολλά ηχεία έθεσε ταίριασμα της αλήθειας — ένα ορόσημο για την ποιότητα του νευρικού TTS από άκρο σε άκρο.

Τεχνική διορατικότητα

Το βασικό κόλπο είναι η διάχυση στυλ: αντί να προβλέπει μία σταθερή προσωδία, το StyleTTS 2 μοντελοποιεί το στυλ ως κατανομή πιθανότητας και δείγματα από αυτό μέσω ενός μοντέλου διάχυσης που εκτελείται σε λανθάνοντα χώρο χαμηλής διάστασης, ώστε η ίδια πρόταση να μπορεί να εκφωνηθεί με πολλούς φυσικούς τρόπους. Από άκρο σε άκρο, το πρόγραμμα πρόβλεψης διάρκειας, ο κωδικοποιητής στυλ, ο αποκωδικοποιητής και ο αντιτιθέμενος διαχωριστής που βασίζεται σε WavLM εκπαιδεύονται από κοινού, επιτρέποντας στις διαβαθμίσεις να ρέουν από την ποιότητα κυματομορφής πίσω σε ολόκληρο τον αγωγό.

Στρατηγικός αντίκτυπος

Πρόσβαση και προσέγγιση χρηστών

Βελτιώνει την προσβασιμότητα μέσω διασυνδέσεων μεταγραφής, αφήγησης και φωνής.

Κόστος και προϋπολογισμός

Οι ομάδες πολυμέσων μπορούν να αποστέλλουν γυαλισμένο ήχο πιο γρήγορα με μικρότερους προϋπολογισμούς.

Ταχύτητα και κλίμακα

Τα συστήματα που αντιμετωπίζουν πελάτες μπορούν να επεξεργάζονται προφορικές αλληλεπιδράσεις σε μεγαλύτερη κλίμακα.

The Future of StyleTTS 2 Style Diffusion

Αναμένετε ότι η διάχυση στυλ θα συγχωνευθεί με την κλωνοποίηση φωνής μηδενικής λήψης, ώστε μερικά δευτερόλεπτα ήχου αναφοράς να κατευθύνουν το στυλ του δείγματος και με ελεγχόμενες λαβές που επιτρέπουν στους δημιουργούς να πληκτρολογούν ρητά συναισθήματα, έμφαση ή ρυθμό. Οι ελαφρύτερες αποσταγμένες εκδόσεις στοχεύουν στη μείωση της δειγματοληψίας διάχυσης πολλαπλών βημάτων για χρήση σε πραγματικό χρόνο σε συσκευές. Καθώς αυτά τα μοντέλα φτάνουν στην ποιότητα μετάδοσης, η υδατοσήμανση και η επαλήθευση συναίνεσης θα γίνουν βασικά για την αντιμετώπιση των ανησυχιών για πλαστογράφηση φωνής και κατάχρηση ψεύτικα.

Υλοποίηση σε πραγματικό κόσμο

Δημιουργία αφήγησης ηχητικού βιβλίου όπου ο ίδιος ομιλητής ποικίλλει φυσικά την προσωδία μεταξύ των κεφαλαίων αντί να ακούγεται μονότονος

Παραγωγή εκφραστικών φωνών χαρακτήρων για indie παιχνίδια και κινούμενα σχέδια χωρίς την πρόσληψη πολλών ηθοποιών

Ενισχύοντας τους αναγνώστες οθόνης προσβασιμότητας που ακούγονται αρκετά ανθρώπινοι για ακρόαση μεγάλης διάρκειας

Δημιουργία τοπικών εκφωνήσεων ηλεκτρονικής μάθησης με φυσική έμφαση και ρυθμό από απλό κείμενο σεναρίου

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Οι κίνδυνοι κατάχρησης φωνής και πλαστοπροσωπίας αυξάνονται όταν λείπει η συγκατάθεση.

Η ακρίβεια μπορεί να πέσει σε τόνους, διαλέκτους ή θορυβώδη περιβάλλοντα.

Ο συνθετικός ήχος μπορεί να εκληφθεί εσφαλμένα ως αυθεντική ομιλία χωρίς σαφή σήμανση.

Οδικός Χάρτης Εφαρμογής

1

Λάβετε ρητή συγκατάθεση για λήψη φωνής, κλωνοποίηση και επαναχρησιμοποίηση.

2

Δοκιμάστε την ποιότητα σε διαφορετικά ηχεία και συνθήκες φόντου.

3

Καθορίστε πότε ένας άνθρωπος πρέπει να επανεξετάσει ή να εγκρίνει τα αποτελέσματα.

4

Επισημάνετε τον συνθετικό ήχο και κρατήστε αρχεία προέλευσης για υπευθυνότητα.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the StyleTTS 2 Style Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Διάχυση φασματογράμματος διάχυσης

Συχνές ερωτήσεις

What is StyleTTS 2 Style Diffusion?

Το StyleTTS 2 είναι ένα μοντέλο μετατροπής κειμένου σε ομιλία που αντιμετωπίζει το «στυλ» της φωνής — προσωδία, συναίσθημα και χροιά ομιλητή — ως τυχαία μεταβλητή που δειγματοληψία με ένα μοντέλο διάχυσης, στη συνέχεια συνθέτει ήχο με αντίθετη εκπαίδευση έναντι ενός μεγάλου μοντέλου γλώσσας ομιλίας. Έχει σημασία γιατί έφτασε σε φυσικό επίπεδο σε ανθρώπινο επίπεδο σε σημεία αναφοράς ενός ηχείου χωρίς να χρειάζεται ένα κλιπ αναφοράς τη στιγμή της εξαγωγής συμπερασμάτων.

Τι μοντελοποιεί το StyleTTS 2 χρησιμοποιώντας μια διαδικασία διάχυσης;

Το StyleTTS 2 δειγματίζει ένα διάνυσμα στυλ χαμηλής διάστασης με μοντέλο διάχυσης, καταγράφοντας χαρακτηριστικά προσωδίας, συναισθήματος και ηχείου που δεν προσδιορίζονται από το κείμενο.

Ποιο προ-εκπαιδευμένο μοντέλο ομιλίας χρησιμοποιείται ως αντίθετος διαχωρισμός στο StyleTTS 2;

Το StyleTTS 2 χρησιμοποιεί μεγάλα μοντέλα γλώσσας ομιλίας, όπως το WavLM, ως διακριτικά στην εκπαίδευση αντιπάλων, για να ωθήσει τις εξόδους προς τον ήχο με ανθρώπινο ήχο.

Γιατί το StyleTTS 2 μπορεί να πει την ίδια πρόταση με πολλούς φυσικούς τρόπους;

Επειδή το στυλ αντιμετωπίζεται ως τυχαία μεταβλητή και γίνεται δειγματοληψία μέσω διάχυσης, κάθε γενιά μπορεί να παράγει μια διαφορετική αλλά φυσική προσωδία για το ίδιο κείμενο.

Σε ποιο σημείο αναφοράς για ένα ηχείο το StyleTTS 2 φέρεται να ξεπέρασε τις ανθρώπινες ηχογραφήσεις σε βαθμολογίες ακροατών;

Στο σημείο αναφοράς LJSpeech, το StyleTTS 2 πέτυχε βαθμολογίες φυσικότητας ακροατών που ξεπερνούσαν τις εγγραφές ανθρώπινης αλήθειας.

Τι δίνει στο StyleTTS 2 η προπόνηση «από άκρο σε άκρο»;

Η κοινή εκπαίδευση από άκρο σε άκρο επιτρέπει την απώλεια της τελικής ποιότητας ήχου να ενημερώνει το πρόγραμμα πρόβλεψης διάρκειας, τον κωδικοποιητή στυλ και τον αποκωδικοποιητή μαζί και όχι σε μεμονωμένα στάδια.