Ακούστε Παρακολούθηση και ορθογραφία
Listen, Attend and Spell (LAS) είναι ένα νευρωνικό δίκτυο ορόσημο του 2015 που μεταγράφει την ομιλία απευθείας σε χαρακτήρες, χωρίς χειροποίητο λεξικό προφοράς ή ξεχωριστό γλωσσικό μοντέλο.
Επισκόπηση
It showed that a single end-to-end model could do speech recognition.
Βαθιά κατάδυση
Listen, Attend and Spell, που εισήχθη από τους ερευνητές Google Chan, Jaitly, Le και Vinyals το 2015, ήταν ένας από τους πρώτους πραγματικούς ανιχνευτές ομιλίας από άκρο σε άκρο. Έχει δύο μέρη: ένα «Listener», ένα πυραμιδικό αμφίδρομο LSTM που κωδικοποιεί τον ήχο ενώ συρρικνώνει τη διάσταση του χρόνου και έναν «Ορθογραφικό», έναν αποκωδικοποιητή LSTM που βασίζεται στην προσοχή που εκπέμπει χαρακτήρες έναν κάθε φορά. Ο μηχανισμός προσοχής επιτρέπει στον ορθογραφικό να εστιάζει στο σχετικό κομμάτι ήχου για κάθε γράμμα εξόδου. Σε αντίθεση με τους παλαιότερους αγωγούς HMM-DNN, το LAS δεν χρειάζεται λεξικό φωνημάτων, αναγκαστική ευθυγράμμιση και ξεχωριστά εκπαιδευμένο γλωσσικό μοντέλο. Μαθαίνει την ορθογραφία, τα όρια λέξεων και την ακουστική από κοινού από τον μεταγραφόμενο ήχο. Ενέπνευσε άμεσα τα σύγχρονα συστήματα ASR ακολουθίας σε ακολουθία και βασισμένα στην προσοχή.
Τεχνική διορατικότητα
Το LAS συνδυάζει έναν κωδικοποιητή-αποκωδικοποιητή με την προσοχή. Ο πυραμιδικός κωδικοποιητής LSTM μειώνει στο μισό τη χρονική ανάλυση σε κάθε ένα από τα τρία επίπεδα, κόβοντας μια μεγάλη ακουστική ακολουθία σε ένα διαχειρίσιμο μήκος, ώστε η προσοχή να είναι εφικτή. Σε κάθε βήμα αποκωδικοποίησης, ο ορθογράφος υπολογίζει τα βάρη προσοχής σε όλες τις καταστάσεις κωδικοποιητή, τα συνδυάζει σε ένα διάνυσμα περιβάλλοντος και προβλέπει τον επόμενο χαρακτήρα. Η εκπαίδευση μεγιστοποιεί την πιθανότητα της σωστής ακολουθίας χαρακτήρων. ένα τέχνασμα προγραμματισμένης δειγματοληψίας μειώνει την αναντιστοιχία αμαξοστοιχίας/δοκιμών.
Στρατηγικός αντίκτυπος
Πρόσβαση και προσέγγιση χρηστών
Βελτιώνει την προσβασιμότητα μέσω διασυνδέσεων μεταγραφής, αφήγησης και φωνής.
Κόστος και προϋπολογισμός
Οι ομάδες πολυμέσων μπορούν να αποστέλλουν γυαλισμένο ήχο πιο γρήγορα με μικρότερους προϋπολογισμούς.
Ταχύτητα και κλίμακα
Τα συστήματα που αντιμετωπίζουν πελάτες μπορούν να επεξεργάζονται προφορικές αλληλεπιδράσεις σε μεγαλύτερη κλίμακα.
The Future of Listen Attend and Spell
Το LAS είναι πλέον ιστορικό, αλλά το DNA του διατρέχει κάθε σύγχρονο σύστημα ASR. Η ιδέα του κωδικοποιητή-αποκωδικοποιητή που βασίζεται στην προσοχή εξελίχθηκε σε αναγνωριστές Transformer και Conformer, ενώ σχετικές προσεγγίσεις όπως η υπαγόρευση ισχύος στη συσκευή RNN-Transducer. Τα μελλοντικά συστήματα συνεχίζουν αυτή την τροχιά από άκρο σε άκρο, συνδυάζοντας την αναγνώριση με τη μετάφραση και την κατανόηση σε μεμονωμένα πολύγλωσσα μοντέλα και ωθώντας προς τη μεταγραφή ροής, χαμηλής καθυστέρησης, την οποία το LAS, που δεν ήταν ροή, δεν μπορούσε αρχικά να προσφέρει.
Υλοποίηση σε πραγματικό κόσμο
Μεταγραφή των προφορικών αγγλικών απευθείας σε γράμματα χωρίς λεξικό προφοράς
Χρησιμεύει ως η εννοιολογική βάση για συστήματα φωνητικής υπαγόρευσης και υπότιτλων που βασίζονται στην προσοχή
Επίδειξη εκπαίδευσης από άκρο σε άκρο για ακαδημαϊκά μαθήματα αναγνώρισης ομιλίας και σημεία αναφοράς
Εμπνευσμένα μοντέλα αλληλουχίας σε ακολουθία χρησιμοποιήθηκαν αργότερα σε αγωγούς μετάφρασης ομιλίας
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Οι κίνδυνοι κατάχρησης φωνής και πλαστοπροσωπίας αυξάνονται όταν λείπει η συγκατάθεση.
Η ακρίβεια μπορεί να πέσει σε τόνους, διαλέκτους ή θορυβώδη περιβάλλοντα.
Ο συνθετικός ήχος μπορεί να εκληφθεί εσφαλμένα ως αυθεντική ομιλία χωρίς σαφή σήμανση.
Οδικός Χάρτης Εφαρμογής
Λάβετε ρητή συγκατάθεση για λήψη φωνής, κλωνοποίηση και επαναχρησιμοποίηση.
Δοκιμάστε την ποιότητα σε διαφορετικά ηχεία και συνθήκες φόντου.
Καθορίστε πότε ένας άνθρωπος πρέπει να επανεξετάσει ή να εγκρίνει τα αποτελέσματα.
Επισημάνετε τον συνθετικό ήχο και κρατήστε αρχεία προέλευσης για υπευθυνότητα.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Listen Attend and Spell quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Αυτόματη προσθήκη ετικετών μουσικής
Συχνές ερωτήσεις
What is Listen Attend and Spell?
Listen, Attend and Spell (LAS) είναι ένα νευρωνικό δίκτυο ορόσημο του 2015 που μεταγράφει την ομιλία απευθείας σε χαρακτήρες, χωρίς χειροποίητο λεξικό προφοράς ή ξεχωριστό γλωσσικό μοντέλο. Έδειξε ότι ένα μόνο από άκρο σε άκρο μοντέλο μπορούσε να κάνει αναγνώριση ομιλίας.
Ποια είναι τα δύο κύρια στοιχεία του μοντέλου LAS;
Το LAS αποτελείται από έναν κωδικοποιητή «Listener» που επεξεργάζεται τον ήχο και έναν αποκωδικοποιητή «Speller» που βασίζεται στην προσοχή που εκπέμπει χαρακτήρες.
Τι βγάζει ο ορθογράφος στο LAS;
Ο ορθογράφος είναι ένας αποκωδικοποιητής που παράγει τη μεταγραφή χαρακτήρα ανά χαρακτήρα, μαθαίνοντας απευθείας την ορθογραφία.
Γιατί ο κωδικοποιητής LAS ονομάζεται «πυραμιδικός»;
Κάθε στρώμα του πυραμιδικού BLSTM μειώνει στο μισό το μήκος της ακολουθίας, συντομεύοντας τη μεγάλη ακολουθία ήχου, ώστε η προσοχή να είναι υπολογιστικά εφικτή.
Ποιο παλαιότερο στοιχείο ΔΕΝ απαιτεί το LAS;
Σε αντίθεση με τους κλασικούς αγωγούς HMM-DNN, το LAS μαθαίνει απευθείας από ζεύγη ήχου σε κείμενο χωρίς λεξικό φωνημάτων ή αναγκαστική στοίχιση.
Ποιος μηχανισμός επιτρέπει στον ορθογραφικό να εστιάζει στο σχετικό μέρος του ήχου για κάθε χαρακτήρα;
Ένας μηχανισμός προσοχής υπολογίζει τα βάρη πάνω από τις καταστάσεις κωδικοποιητή, σχηματίζοντας ένα διάνυσμα περιβάλλοντος που χρησιμοποιεί ο αποκωδικοποιητής σε κάθε βήμα.