ΟΔΗΓΟΣ Audio AI

AudioGen Σύνθεση κειμένου σε ήχο

Το AudioGen είναι ένα μοντέλο Meta που μετατρέπει τις περιγραφές κειμένου σε ρεαλιστικούς περιβαλλοντικούς ήχους και ηχητικά εφέ, όπως «γαυγίζει σκύλος ενώ τα πουλιά κελαηδούν». Έχει σημασία γιατί επιτρέπει στους δημιουργούς να παράγουν ήχο χωρίς ομιλία από απλή γλώσσα, μια δυνατότητα που λείπει εδώ και καιρό από τη γενετική τεχνητή νοημοσύνη.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Βαθιά κατάδυση

Το AudioGen, που κυκλοφόρησε από την Meta AI το 2022, είναι ένα μοντέλο γλώσσας αυτόματης παλινδρόμησης που παράγει γενικό ήχο (ηχητικά εφέ, σκηνές περιβάλλοντος, ήχους ζώων και αντικειμένων) απευθείας από μηνύματα κειμένου. Σε αντίθεση με τα συστήματα μετατροπής κειμένου σε ομιλία, στοχεύει στον ακατάστατο κόσμο του καθημερινού ήχου. Αρχικά συμπιέζει τον ακατέργαστο ήχο σε μια ακολουθία διακριτών διακριτικών χρησιμοποιώντας έναν νευρωνικό κωδικοποιητή (έναν αυτόματο κωδικοποιητή τύπου EnCodec με κβαντισμό υπολειπόμενου διανύσματος). Στη συνέχεια, ένα μοντέλο γλώσσας Transformer μαθαίνει να προβλέπει αυτά τα διακριτικά ήχου με βάση μια περιγραφή κειμένου που κωδικοποιείται από έναν ξεχωριστό κωδικοποιητή κειμένου. Για να βελτιωθεί η κατανόηση της σύνθεσης, οι συγγραφείς αναμείωσαν και συνέδεσαν δείγματα ήχου κατά τη διάρκεια της εκπαίδευσης, ώστε το μοντέλο να μπορεί να μάθει συνδυασμούς όπως επικαλυπτόμενους ήχους. Το AudioGen έγινε αργότερα μέρος της βιβλιοθήκης AudioCraft του Meta παράλληλα με το μουσικό μοντέλο MusicGen.

Τεχνική διορατικότητα

Το AudioGen έχει δύο στάδια. Πρώτον, ένας αυτόματος κωδικοποιητής ήχου μαθαίνει να αντιστοιχίζει τις κυματομορφές σε μια συμπαγή ροή διακριτών διακριτικών και πίσω. Δεύτερον, ένας μετασχηματιστής εκπαιδεύεται με στόχο τη μοντελοποίηση γλώσσας να προβλέπει το επόμενο διακριτικό ήχου που θα δοθεί στα προηγούμενα διακριτικά συν τη ρύθμιση κειμένου. Η καθοδήγηση χωρίς ταξινομητή και η μοντελοποίηση του βιβλίου κωδικών πολλαπλών ροών βελτιώνουν την πιστότητα και τη στοίχιση κειμένου. Η δημιουργία ήχου σημαίνει τη δειγματοληψία των διακριτικών αυτόματα και στη συνέχεια την αποκωδικοποίηση τους σε μια κυματομορφή με τον κωδικοποιητή.

Στρατηγικός αντίκτυπος

Πρόσβαση και προσέγγιση χρηστών

Βελτιώνει την προσβασιμότητα μέσω διασυνδέσεων μεταγραφής, αφήγησης και φωνής.

Κόστος και προϋπολογισμός

Οι ομάδες πολυμέσων μπορούν να αποστέλλουν γυαλισμένο ήχο πιο γρήγορα με μικρότερους προϋπολογισμούς.

Ταχύτητα και κλίμακα

Τα συστήματα που αντιμετωπίζουν πελάτες μπορούν να επεξεργάζονται προφορικές αλληλεπιδράσεις σε μεγαλύτερη κλίμακα.

Το μέλλον της σύνθεσης κειμένου σε ήχο AudioGen

Η μετατροπή κειμένου σε ήχο οδεύει προς υψηλότερους ρυθμούς δειγματοληψίας, μεγαλύτερες συνεκτικές σκηνές και αυστηρότερο έλεγχο του χρονισμού και της χωρικής τοποθέτησης των ήχων. Αναμένετε ενσωμάτωση σε εργαλεία βίντεο που προσθέτουν αυτόματα ταιριαστά ηχητικά εφέ, εργαλεία προσβασιμότητας που περιγράφουν σκηνές ηχητικά και μηχανές παιχνιδιών που συνθέτουν ήχο περιβάλλοντος κατά παραγγελία. Ο συνδυασμός μοντέλων διακριτικών τύπου AudioGen με μεθόδους διάχυσης και ισχυρότερους κωδικοποιητές κειμένου θα βελτιώσει τον ρεαλισμό, ενώ τα εργαλεία υδατογράφησης και προέλευσης θα βοηθήσουν στη διάκριση του συνθετικού από τον ηχογραφημένο ήχο.

Υλοποίηση σε πραγματικό κόσμο

Δημιουργία Foley και ηχητικά εφέ για ταινίες και παιχνίδια από μηνύματα κειμένου

Δημιουργία ηχοτοπίων περιβάλλοντος (βροχή, κίνηση, δάση) για εφαρμογές και εργαλεία διαλογισμού

Δημιουργία πρωτοτύπων ήχου για έργα βίντεο χωρίς αδειοδότηση αποθεμάτων βιβλιοθηκών

Παραγωγή προσαρμοσμένων ήχων ειδοποίησης και ειδοποίησης που περιγράφονται σε απλή γλώσσα

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Οι κίνδυνοι κατάχρησης φωνής και πλαστοπροσωπίας αυξάνονται όταν λείπει η συγκατάθεση.

Η ακρίβεια μπορεί να πέσει σε τόνους, διαλέκτους ή θορυβώδη περιβάλλοντα.

Ο συνθετικός ήχος μπορεί να εκληφθεί εσφαλμένα ως αυθεντική ομιλία χωρίς σαφή σήμανση.

Οδικός Χάρτης Εφαρμογής

1

Λάβετε ρητή συγκατάθεση για λήψη φωνής, κλωνοποίηση και επαναχρησιμοποίηση.

2

Δοκιμάστε την ποιότητα σε διαφορετικά ηχεία και συνθήκες φόντου.

3

Καθορίστε πότε ένας άνθρωπος πρέπει να επανεξετάσει ή να εγκρίνει τα αποτελέσματα.

4

Επισημάνετε τον συνθετικό ήχο και κρατήστε αρχεία προέλευσης για υπευθυνότητα.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioGen Text-to-Audio Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

DDSP Διαφοροποιήσιμη σύνθεση ήχου

Συχνές ερωτήσεις

What is AudioGen Text-to-Audio Synthesis?

Το AudioGen είναι ένα μοντέλο Meta που μετατρέπει τις περιγραφές κειμένου σε ρεαλιστικούς περιβαλλοντικούς ήχους και ηχητικά εφέ, όπως «γαυγίζει σκύλος ενώ τα πουλιά κελαηδούν». Έχει σημασία γιατί επιτρέπει στους δημιουργούς να παράγουν ήχο χωρίς ομιλία από απλή γλώσσα, μια δυνατότητα που λείπει εδώ και καιρό από τη γενετική τεχνητή νοημοσύνη.

Τι παράγει κυρίως το AudioGen;

Η AudioGen ειδικεύεται σε γενικό ήχο χωρίς ομιλία, όπως περιβαλλοντικούς ήχους και εφέ που παράγονται από προτροπές κειμένου.

Ποιο είναι το πρώτο στάδιο στη διοχέτευση του AudioGen;

Ένας αυτόματος κωδικοποιητής νευρικού κωδικοποιητή συμπιέζει τον ακατέργαστο ήχο σε διακριτά διακριτικά που το μοντέλο γλώσσας μπορεί στη συνέχεια να προβλέψει.

Τι τύπος μοντέλου προβλέπει τα διακριτικά ήχου;

Το AudioGen χρησιμοποιεί έναν αυτοπαλινδρομικό μετασχηματιστή που προβλέπει τα διακριτικά ήχου το ένα μετά το άλλο, ανάλογα με το κείμενο.

Γιατί οι συγγραφείς αναμίξανε και συνέδεσαν ήχο κατά τη διάρκεια της εκπαίδευσης;

Η επαύξηση με μικτά και συνδυασμένα κλιπ βελτίωσε την ικανότητα του AudioGen να συνθέτει πολλούς ήχους που περιγράφονται μαζί σε μια προτροπή.

Ποια μεγαλύτερη βιβλιοθήκη Meta περιλαμβάνει το AudioGen;

Το AudioGen είναι μέρος της βιβλιοθήκης AudioCraft του Meta, η οποία περιέχει επίσης το μοντέλο MusicGen.