Αρχιτεκτονικές Encoder-Decoder
Οι αρχιτεκτονικές κωδικοποιητή-αποκωδικοποιητή χωρίζουν ένα μοντέλο σε δύο μισά: ένα που διαβάζει και συμπιέζει μια είσοδο σε μια πλούσια εσωτερική αναπαράσταση και ένα που παράγει μια έξοδο από αυτήν.
Επισκόπηση
This design powers translation, summarization, and any task where the input and output are different sequences.
Βαθιά κατάδυση
Ένα μοντέλο κωδικοποιητή-αποκωδικοποιητή επεξεργάζεται ένα πρόβλημα σε δύο στάδια. Ο κωδικοποιητής διαβάζει ολόκληρη την ακολουθία εισόδου (ας πούμε, μια αγγλική πρόταση) και τη μετατρέπει σε ένα σύνολο διανυσμάτων με βάση τα συμφραζόμενα που καταγράφουν νόημα. Στη συνέχεια, ο αποκωδικοποιητής παράγει την ακολουθία εξόδου (ας πούμε, γαλλικά) ένα διακριτικό τη φορά, κοιτάζοντας πίσω στις δικές του προηγούμενες εξόδους και στις αναπαραστάσεις του κωδικοποιητή. Το αρχικό Transformer του 2017 ήταν ένας κωδικοποιητής-αποκωδικοποιητής που δημιουργήθηκε για μετάφραση. Μοντέλα όπως το T5 και το BART χρησιμοποιούν αυτό το σχήμα και πλαισιώνουν κάθε εργασία ως εισαγωγή κειμένου και εξαγωγή κειμένου. Ο διαχωρισμός είναι ισχυρός επειδή ο κωδικοποιητής μπορεί να δει ολόκληρη την είσοδο ταυτόχρονα (αμφίδρομο περιβάλλον), ενώ ο αποκωδικοποιητής δημιουργεί από αριστερά προς τα δεξιά. Αυτό καθιστά το σχέδιο μια φυσική εφαρμογή για προβλήματα αλληλουχίας σε ακολουθία όπου το μήκος και το περιεχόμενο εξόδου διαφέρουν από την είσοδο.
Τεχνική διορατικότητα
Ο κωδικοποιητής χρησιμοποιεί αμφίδρομη αυτοπροσοχή, επομένως κάθε διακριτικό εισόδου παρακολουθεί κάθε άλλο διακριτικό ταυτόχρονα. Ο αποκωδικοποιητής είναι αυτοπαλινδρομικός και χρησιμοποιεί συγκαλυμμένη αυτοπροσοχή, που σημαίνει ότι κάθε θέση μπορεί να δει μόνο προηγούμενες θέσεις για να διατηρήσει την αιτιακή δημιουργία. Η σύνδεσή τους είναι διασταυρούμενη προσοχή: τα επίπεδα αποκωδικοποιητή διερευνούν τις τελικές κρυφές καταστάσεις του κωδικοποιητή. Αυτός ο διαχωρισμός επιτρέπει στον κωδικοποιητή να δημιουργήσει μια πλήρη, ανεξάρτητη από την παραγγελία κατανόηση, ενώ ο αποκωδικοποιητής δεσμεύεται σε ένα διακριτικό τη φορά.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.
Πρόσβαση και προσέγγιση χρηστών
Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.
Σαφέστερες αποφάσεις
Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.
The Future of Encoder-Decoder Architectures
Μοντέλα μόνο με αποκωδικοποιητή, όπως το GPT κυριαρχούν πλέον στις συνομιλίες γενικής χρήσης, επειδή μια ενιαία στοίβα κλιμακώνεται απλά και χειρίζεται πολλές εργασίες μέσω προτροπής. Ωστόσο, τα σχέδια κωδικοποιητή-αποκωδικοποιητή εξακολουθούν να υπάρχουν εκεί όπου η κατανόηση εισόδου και η παραγωγή εξόδου είναι πραγματικά διακριτές: αναγνώριση ομιλίας (Whisper), σύνοψη εγγράφων και πολυτροπικά συστήματα που συνδυάζουν έναν κωδικοποιητή όρασης με έναν αποκωδικοποιητή κειμένου. Αναμένετε υβριδικές αρχιτεκτονικές που δανείζονται την αμφίδρομη κατανόηση του κωδικοποιητή για ανάκτηση και γείωση διατηρώντας παράλληλα την ευελιξία του αποκωδικοποιητή, ειδικά καθώς τα μοντέλα συνδυάζουν κείμενο, ήχο και εικόνες.
Υλοποίηση σε πραγματικό κόσμο
Google Μετάφραση και DeepL χρησιμοποιούν μετασχηματιστές κωδικοποιητή-αποκωδικοποιητή για να αντιστοιχίσουν μια πρόταση από μια γλώσσα σε μια άλλη.
Το Whisper του OpenAI κωδικοποιεί φασματογράμματα ήχου και τα αποκωδικοποιεί σε μεταγραμμένο ή μεταφρασμένο κείμενο.
T5 και BART power abstractive summation, συμπυκνώνοντας μεγάλα άρθρα σε σύντομες περιλήψεις.
Τα συστήματα υποτίτλων εικόνων συνδυάζουν έναν κωδικοποιητή όρασης με έναν αποκωδικοποιητή κειμένου για να περιγράψουν φωτογραφίες με λέξεις.
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.
Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.
Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.
Οδικός Χάρτης Εφαρμογής
Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.
Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.
Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.
Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Encoder-Decoder Architectures quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Cross-Encoders vs Bi-Encoders
Συχνές ερωτήσεις
What is Encoder-Decoder Architectures?
Οι αρχιτεκτονικές κωδικοποιητή-αποκωδικοποιητή χωρίζουν ένα μοντέλο σε δύο μισά: ένα που διαβάζει και συμπιέζει μια είσοδο σε μια πλούσια εσωτερική αναπαράσταση και ένα που παράγει μια έξοδο από αυτήν. Αυτός ο σχεδιασμός εξουσιοδοτεί τη μετάφραση, τη σύνοψη και οποιαδήποτε εργασία όπου η είσοδος και η έξοδος είναι διαφορετικές ακολουθίες.
Ποια είναι η κύρια εργασία του κωδικοποιητή σε ένα μοντέλο κωδικοποιητή-αποκωδικοποιητή;
Ο κωδικοποιητής καταναλώνει ολόκληρη την ακολουθία εισόδου και παράγει διανύσματα συμφραζομένων που καταγράφουν το νόημά του, τα οποία στη συνέχεια χρησιμοποιεί ο αποκωδικοποιητής.
Γιατί ο αποκωδικοποιητής χρησιμοποιεί καλυμμένη (αιτιατική) αυτοπροσοχή;
Η κάλυψη διασφαλίζει ότι κάθε θέση εξόδου παρακολουθεί μόνο προηγούμενες θέσεις, διατηρώντας τη σειρά αυτοπαλίνδρομης παραγωγής από αριστερά προς τα δεξιά.
Ποιος μηχανισμός συνδέει τον αποκωδικοποιητή με τις αναπαραστάσεις του κωδικοποιητή;
Η διασταυρούμενη προσοχή επιτρέπει σε κάθε επίπεδο αποκωδικοποιητή να διερευνά τις κρυφές καταστάσεις του κωδικοποιητή, συνδέοντας την κατανόηση της εισόδου με τη δημιουργία της εξόδου.
Ποιο από αυτά τα μοντέλα είναι αρχιτεκτονική κωδικοποιητή-αποκωδικοποιητή (sequence-to-sequence);
Το T5 (και το BART) είναι κλασικά μοντέλα κωδικοποιητή-αποκωδικοποιητή που πλαισιώνουν εργασίες ως κείμενο σε κείμενο. Το BERT είναι μόνο για κωδικοποιητή και το GPT-3 μόνο για αποκωδικοποιητή.
Γιατί ο σχεδιασμός κωδικοποιητή-αποκωδικοποιητή είναι φυσικός κατάλληλος για μετάφραση;
Η μετάφραση αντιστοιχίζει μια ακολουθία σε μια διαφορετική, επομένως η ανάγνωση ολόκληρης της πηγής (κωδικοποιητής) και η δημιουργία ενός νέου στόχου (αποκωδικοποιητής) ταιριάζει απόλυτα.