ΟΔΗΓΟΣ ΓΛΩΣΣΑΣ AI

Μοντελοποίηση μάσκας γλώσσας

Η μοντελοποίηση γλώσσας με μάσκα διδάσκει σε μια τεχνητή νοημοσύνη να συμπληρώνει σκόπιμα κρυμμένες λέξεις χρησιμοποιώντας το πλήρες περιβάλλον του περιβάλλοντος, τόσο αριστερά όσο και δεξιά.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

Είναι το εκπαιδευτικό τέχνασμα πίσω από το BERT και ο λόγος που τα μοντέλα μπορούν να κατανοήσουν σε βάθος το νόημα της πρότασης αντί να προβλέψουν απλώς τι θα ακολουθήσει.

Βαθιά κατάδυση

Στο μοντέλο μάσκας γλώσσας (MLM), παίρνετε μια πρόταση, κρύβετε τυχαία περίπου το 15% των διακριτικών της με ένα ειδικό σύμβολο [MASK] και εκπαιδεύετε το μοντέλο να μαντεύει τα πρωτότυπα. Επειδή το μοντέλο βλέπει λέξεις και στις δύο πλευρές κάθε κενού, δημιουργεί μια αμφίδρομη κατανόηση του περιβάλλοντος. Το BERT, που παρουσιάστηκε από τον Google το 2018, το έκανε δημοφιλές. Μια έξυπνη λεπτομέρεια: από τις καλυμμένες θέσεις, περίπου το 80% γίνεται [MASK], το 10% ανταλλάσσεται με μια τυχαία λέξη και το 10% μένει αμετάβλητο. Αυτό εμποδίζει το μοντέλο να περιμένει μόνο ένα διακριτικό [MASK] κατά τον χρόνο πρόβλεψης και επιβάλλει την ευρωστία. Μετά από αυτήν την προεκπαίδευση, το μοντέλο ρυθμίζεται με ακρίβεια για εργασίες όπως ταξινόμηση, απάντηση ερωτήσεων και αναγνώριση οντοτήτων με όνομα.

Τεχνική διορατικότητα

Το MLM χρησιμοποιεί έναν κωδικοποιητή Transformer με αμφίδρομη αυτοπροσοχή, έτσι ώστε κάθε διακριτικό να παρακολουθεί όλα τα άλλα ταυτόχρονα. Η απώλεια υπολογίζεται μόνο στις καλυμμένες θέσεις χρησιμοποιώντας διασταυρούμενη εντροπία έναντι των αληθινών αναγνωριστικών διακριτικών. Επειδή η προσοχή δεν είναι αιτιολογική (χωρίς μελλοντική κάλυψη), η αναπαράσταση για κάθε λέξη συγχωνεύει το αριστερό και το δεξί πλαίσιο σε ένα πυκνό διάνυσμα. Αυτή η αμφίδρομη κατεύθυνση είναι ακριβώς αυτό που παραιτούνται από τα μοντέλα επόμενου συμβολικού για τη δυνατότητα δημιουργίας.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.

Πρόσβαση και προσέγγιση χρηστών

Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.

Σαφέστερες αποφάσεις

Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.

Το μέλλον της μοντελοποίησης με μάσκα

Το καθαρό MLM έχει εν μέρει επισκιαστεί από τα παραγωγικά μοντέλα αποκωδικοποιητών για chatbot, αλλά παραμένει κυρίαρχο για τις ενσωματώσεις, την ανάκτηση και την ταξινόμηση όπου η κατανόηση ξεπερνά τη δημιουργία. Παραλλαγές όπως η RoBERTa, η ανίχνευση αντικατασταθέντος διακριτικού της ELECTRA και η DeBERTa συνεχίζουν να προωθούν την ακρίβεια και την αποτελεσματικότητα. Αναμένετε ότι οι κωδικοποιητές τύπου MLM θα παραμείνουν στο επίκεντρο της αναζήτησης, της σημασιολογικής ομοιότητας και ως ελαφριά στοιχεία μέσα σε μεγαλύτερα και πολυτροπικά συστήματα επαυξημένης ανάκτησης, όπου η γρήγορη, βαθιά κατανόηση έχει μεγαλύτερη σημασία από το κείμενο ελεύθερης μορφής.

Υλοποίηση σε πραγματικό κόσμο

Ενίσχυση της Google κατανόησης των ερωτημάτων συνομιλίας της Αναζήτησης βάσει BERT για την επιστροφή πιο σχετικών σελίδων.

Δημιουργία ενσωματώσεων προτάσεων για συστήματα σημασιολογικής αναζήτησης και ανάκτησης εγγράφων.

Βελτιστοποιήστε το BERT για ανάλυση συναισθήματος σχετικά με κριτικές προϊόντων ή εισιτήρια υποστήριξης.

Αναγνώριση επώνυμης οντότητας που εξάγει άτομα, οργανισμούς και ημερομηνίες από νομικό ή ιατρικό κείμενο.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.

Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.

Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.

2

Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.

3

Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.

4

Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Language Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Μοντελοποίηση Γλωσσών

Συχνές ερωτήσεις

Τι είναι το Masked Language Modeling;

Η μοντελοποίηση γλώσσας με μάσκα διδάσκει σε μια τεχνητή νοημοσύνη να συμπληρώνει σκόπιμα κρυμμένες λέξεις χρησιμοποιώντας το πλήρες περιβάλλον του περιβάλλοντος, τόσο αριστερά όσο και δεξιά. Είναι το προπονητικό κόλπο πίσω από το BERT και ο λόγος που τα μοντέλα μπορούν να κατανοήσουν βαθιά το νόημα της πρότασης αντί απλώς να προβλέψουν τι θα ακολουθήσει.

Ποια είναι η βασική εκπαιδευτική εργασία στη μοντελοποίηση γλωσσών με μάσκα;

Το MLM κρύβει ένα κλάσμα διακριτικών και εκπαιδεύει το μοντέλο να τα ανακτήσει χρησιμοποιώντας τόσο το αριστερό όσο και το δεξί πλαίσιο.

Χονδρικά τι ποσοστό των μαρκών καλύπτει συνήθως το BERT κατά τη διάρκεια της προπόνησης;

Το BERT καλύπτει περίπου το 15% των διακριτικών εισόδου, μια ισορροπία μεταξύ της παροχής επαρκούς σήματος και της αφαίρεσης επαρκούς περιβάλλοντος.

Γιατί το MLM δίνει σε ένα μοντέλο αμφίδρομη κατανόηση;

Ο κωδικοποιητής Transformer χρησιμοποιεί μη αιτιολογική αυτοπροσοχή, έτσι ώστε κάθε διακριτικό να μπορεί να δει όλα τα άλλα και στις δύο πλευρές.

Στο σύστημα κάλυψης του BERT, τι συμβαίνει στο 10% περίπου των επιλεγμένων θέσεων αντί να γίνουν [MASK];

Για να βελτιωθεί η ευρωστία, το 10% των καλυμμένων θέσεων ανταλλάσσονται με ένα τυχαίο διακριτικό και το 10% παραμένουν αμετάβλητα.

Σε ποιες θέσεις υπολογίζεται η απώλεια MLM;

Η απώλεια διασταυρούμενης εντροπίας εφαρμόζεται μόνο στις καλυμμένες θέσεις, συγκρίνοντας τις προβλέψεις με τα αρχικά αναγνωριστικά διακριτικών.