Ενισχυτική μάθηση από την ανθρώπινη ανατροφοδότηση
Το RLHF είναι η τεχνική που μετατρέπει ένα μοντέλο ακατέργαστης γλώσσας σε χρήσιμο, ευγενικό βοηθό εκπαιδεύοντάς το στις ανθρώπινες προτιμήσεις.
Επισκόπηση
Έχει σημασία γιατί ευθυγραμμίζει τη συμπεριφορά του μοντέλου με αυτό που πραγματικά θέλουν οι άνθρωποι, όχι μόνο με αυτό που είναι στατιστικά πιθανό.
Βαθιά κατάδυση
Ένα προκαταρτισμένο γλωσσικό μοντέλο προβλέπει εύλογο κείμενο, αλλά το αληθοφανές δεν είναι το ίδιο με το χρήσιμο, ειλικρινές ή ασφαλές. Το RLHF το διορθώνει σταδιακά. Πρώτον, η εποπτευόμενη λεπτομέρεια διδάσκει στο μοντέλο να ακολουθεί οδηγίες χρησιμοποιώντας παραδείγματα απαντήσεων που έχουν γραφτεί από άνθρωπο. Στη συνέχεια, οι άνθρωποι συγκρίνουν ζεύγη αποκρίσεων μοντέλου με την ίδια προτροπή και επιλέγουν την καλύτερη. Αυτές οι συγκρίσεις εκπαιδεύουν ένα ξεχωριστό μοντέλο ανταμοιβής που βαθμολογεί κάθε απάντηση. Τέλος, το γλωσσικό μοντέλο βελτιστοποιείται με ενισχυτική μάθηση για να παράγει απαντήσεις, το μοντέλο ανταμοιβής βαθμολογεί υψηλά. Μια ποινή το εμποδίζει να απομακρυνθεί πολύ από το αρχικό μοντέλο, ώστε να παραμένει άπταιστα και να μην εκμεταλλεύεται τις ιδιορρυθμίες του μοντέλου ανταμοιβής. Το RLHF ήταν κεντρικό για τη χρήση βοηθών τύπου ChatGPT.
Τεχνική διορατικότητα
Το μοντέλο ανταμοιβής συνήθως εκπαιδεύεται σε ζευγάρια προτιμήσεων με απώλεια στυλ Bradley-Terry, μαθαίνοντας να δίνει στην απάντηση που προτιμά ο άνθρωπος υψηλότερη βαθμολογία. Στη συνέχεια, η πολιτική ενημερώνεται με το PPO (Proximal Policy Optimization), το οποίο μεγιστοποιεί την ανταμοιβή, ενώ μια ποινή απόκλισης KL έναντι του μοντέλου αναφοράς αποτρέπει την υπερβολική βελτιστοποίηση και την «παραβίαση ανταμοιβής». Επειδή το PPO είναι δυσνόητο, οι νεότερες μέθοδοι όπως το DPO (Direct Preference Optimization) παρακάμπτουν το ρητό μοντέλο ανταμοιβής και τον βρόχο ενίσχυσης, βελτιστοποιώντας την πολιτική απευθείας από τα ζεύγη προτιμήσεων.
Στρατηγικός αντίκτυπος
Κόστος και προϋπολογισμός
Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.
Σαφέστερες αποφάσεις
Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.
Ελεγχος ποιότητας
Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.
Το Μέλλον της Ενισχυτικής Μάθησης από την Ανθρώπινη Ανατροφοδότηση
Το RLHF εκσυγχρονίζεται και εν μέρει αυτοματοποιείται. Το DPO και οι σχετικές μέθοδοι άμεσης προτίμησης αντικαθιστούν τον βαρύ αγωγό PPO για πολλές ομάδες και το RLAIF χρησιμοποιεί ανατροφοδότηση που δημιουργείται από την τεχνητή νοημοσύνη (όπως στο Constitutional AI) για να μειώσει το κόστος επισήμανσης. Η έρευνα αντιμετωπίζει το hacking ανταμοιβής, την προκατάληψη των σχολιαστών και τη δυσκολία να κρίνουμε μακροσκελείς ή ειδικές απαντήσεις, με τεχνικές όπως η επίβλεψη διαδικασίας και η συζήτηση. Αναμένετε ευθυγράμμιση για να συνδυάσει ανατροφοδότηση ανθρώπου και τεχνητής νοημοσύνης, πλουσιότερα σήματα ανταμοιβής πέρα από ένα μόνο αντίχειρα και αυξανόμενο έλεγχο του ποιος παρέχει τις προτιμήσεις και ποιες τιμές κωδικοποιούν.
Υλοποίηση σε πραγματικό κόσμο
Συντονίζοντας έναν βοηθό συνομιλίας ώστε να απορρίπτει επιβλαβή αιτήματα και να δίνει χρήσιμες, καλά δομημένες απαντήσεις και όχι απλώς εύλογο κείμενο.
Κατάταξη ζευγών περιλήψεων με βάση την ανθρώπινη προτίμηση για την εκπαίδευση ενός μοντέλου που γράφει περιλήψεις που οι άνθρωποι θεωρούν πραγματικά χρήσιμες.
Μείωση τοξικών ή προκατειλημμένων εκροών επιβραβεύοντας τις απαντήσεις που οι αξιολογητές κρίνουν ότι είναι σεβαστές και ασφαλείς.
Χρήση DPO σε ένα σύνολο δεδομένων προτιμώμενων απαντήσεων έναντι των απορριφθέντων απαντήσεων για την ευθυγράμμιση ενός μοντέλου ανοιχτού κώδικα χωρίς την εκτέλεση πλήρους βρόχου PPO.
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.
Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.
Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.
Οδικός Χάρτης Εφαρμογής
Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.
Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.
Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.
Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reinforcement Learning From Human Feedback quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Ενισχυτική Μάθηση
Συχνές ερωτήσεις
Τι είναι η Ενισχυτική Μάθηση από την Ανθρώπινη Ανατροφοδότηση;
Το RLHF είναι η τεχνική που μετατρέπει ένα μοντέλο ακατέργαστης γλώσσας σε χρήσιμο, ευγενικό βοηθό εκπαιδεύοντάς το στις ανθρώπινες προτιμήσεις. Έχει σημασία γιατί ευθυγραμμίζει τη συμπεριφορά του μοντέλου με αυτό που πραγματικά θέλουν οι άνθρωποι, όχι μόνο με αυτό που είναι στατιστικά πιθανό.
Ποιος είναι ο κύριος σκοπός του RLHF για ένα γλωσσικό μοντέλο;
Το RLHF κατευθύνει ένα μοντέλο προς τις απαντήσεις που προτιμούν οι άνθρωποι, καθιστώντας το πιο χρήσιμο, ειλικρινές και ασφαλές παρά απλώς εύλογο.
Τι πραγματικά μαθαίνει να κάνει το μοντέλο ανταμοιβής στο RLHF;
Το μοντέλο ανταμοιβής εκπαιδεύεται στις συγκρίσεις ανθρώπινων προτιμήσεων για τη βαθμολογία απαντήσεων, παρέχοντας το σήμα έναντι του οποίου βελτιστοποιείται η πολιτική.
Γιατί χρησιμοποιείται μια ποινή απόκλισης KL έναντι του αρχικού μοντέλου κατά το βήμα RL;
Η ποινή KL διατηρεί τη βελτιστοποιημένη πολιτική κοντά στο μοντέλο αναφοράς, προστατεύοντας από το hacking ανταμοιβής και την απώλεια της ευχέρειας.
Πώς συλλέγονται συνήθως τα δεδομένα προτιμήσεων για το μοντέλο ανταμοιβής;
Οι σχολιαστές επιλέγουν την προτιμώμενη απάντηση σε συγκρίσεις ανά ζεύγη, η οποία εκπαιδεύει το μοντέλο ανταμοιβής μέσω μιας απώλειας τύπου Bradley-Terry.
Τι πλεονέκτημα προσφέρει το DPO (Direct Preference Optimization) έναντι του κλασικού αγωγού RLHF;
Το DPO εξάγει τον στόχο απευθείας από τις προτιμήσεις, αποφεύγοντας το ξεχωριστό μοντέλο ανταμοιβής και το βήμα μάθησης άσκοπης ενίσχυσης.