Βελτιστοποίηση άμεσης προτίμησης
Το Direct Preference Optimization (DPO) είναι ένας τρόπος για να ευθυγραμμιστούν τα μοντέλα γλώσσας με τις ανθρώπινες προτιμήσεις χωρίς να εκπαιδεύσετε ένα ξεχωριστό μοντέλο ανταμοιβής ή να εκτελέσετε ενισχυτική μάθηση.
Επισκόπηση
It collapses a complex multi-stage pipeline into a single, stable training loss.
Βαθιά κατάδυση
Το DPO, που εισήχθη από τον Rafailov και τους συνεργάτες του στο Stanford το 2023, επανεξετάζει πώς διδάσκουμε σε ένα μοντέλο τι προτιμούν οι άνθρωποι. Η παραδοσιακή προσέγγιση (RLHF) εκπαιδεύει ένα μοντέλο ανταμοιβής σε ανθρώπινες συγκρίσεις και στη συνέχεια χρησιμοποιεί ενισχυτική μάθηση για να μεγιστοποιήσει αυτή την ανταμοιβή. Η βασική γνώση του DPO είναι μαθηματική: η βέλτιστη πολιτική βάσει αυτού του στόχου RLHF έχει μια σχέση κλειστής μορφής με την ανταμοιβή, ώστε να μπορείτε να αναδιατάξετε τις εξισώσεις και να βελτιστοποιήσετε το γλωσσικό μοντέλο απευθείας στα ζεύγη προτιμήσεων. Του δίνετε μια προτροπή, μια «επιλεγμένη» (προτιμώμενη) απάντηση και μια απάντηση «απορρίφθηκε», και μια απλή απώλεια τύπου ταξινόμησης ωθεί το μοντέλο να κάνει την επιλεγμένη απάντηση σχετικά πιο πιθανή. Χωρίς μοντέλο ανταμοιβής, χωρίς βρόχο δειγματοληψίας, χωρίς hacking ανταμοιβής. Είναι πολύ πιο απλό και πιο σταθερό στη λειτουργία.
Τεχνική διορατικότητα
Το DPO χρησιμοποιεί μια δυαδική απώλεια διασταυρούμενης εντροπίας σε σχέση με τα ζεύγη προτιμήσεων. Αυξάνει την αναλογία λογαριθμικής πιθανότητας της επιλεγμένης απόκρισης σε σχέση με την απορριφθείσα, καθεμία μετρούμενη σε σχέση με ένα παγωμένο μοντέλο αναφοράς (συνήθως το σημείο εκκίνησης με εποπτευόμενο-λεπτοσυντονισμένο). Μια παράμετρος θερμοκρασίας beta ελέγχει πόσο μακριά μπορεί να απομακρυνθεί η πολιτική από αυτήν την αναφορά, επιβάλλοντας σιωπηρά τον περιορισμό KL που εφαρμόζει ρητά το RLHF. Η ανταμοιβή δεν υλοποιείται ποτέ. είναι σιωπηρή στις λογιστικές πιθανότητες της ίδιας της πολιτικής.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.
Πρόσβαση και προσέγγιση χρηστών
Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.
Σαφέστερες αποφάσεις
Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.
Το μέλλον της βελτιστοποίησης άμεσης προτίμησης
Η DPO έχει γίνει μια προεπιλεγμένη μέθοδος ευθυγράμμισης επειδή είναι φθηνή και αναπαραγώγιμη και δημιούργησε μια οικογένεια παραλλαγών: η IPO διορθώνει την υπερπροσαρμογή σε σχεδόν ντετερμινιστικές προτιμήσεις, η KTO μαθαίνει από μεμονωμένες ετικέτες καλές ή κακές αντί για ζεύγη και το ORPO διπλώνει την εκμάθηση προτιμήσεων σε τελειοποίηση χωρίς μοντέλο αναφοράς. Αναμένετε τη συνέχιση των εργασιών για το συνδυασμό DPO με δεδομένα σχετικά με την πολιτική και απόκλιση μήκους/ποιότητας, μειώνοντας το κενό που απομένει με το πλήρες διαδικτυακό RLHF.
Υλοποίηση σε πραγματικό κόσμο
Βελτιστοποιήστε τα ανοιχτά μοντέλα συνομιλίας όπως το Zephyr και πολλά παράγωγα Llama και Mistral, τα οποία ευθυγραμμίστηκαν με το DPO σε σύνολα δεδομένων προτιμήσεων
Μείωση επιβλαβών ή μη χρήσιμων αποτελεσμάτων χρησιμοποιώντας ζεύγη όπου η ασφαλής, χρήσιμη απάντηση «επιλέγεται» έναντι μιας προβληματικής
Διδάσκοντας έναν βοηθό κωδικοποίησης να προτιμά τις σωστές, καλά τεκμηριωμένες λύσεις σε σχέση με τις λύσεις με buggy χρησιμοποιώντας συγκρίσεις με βαθμολογία προγραμματιστή
Συντονίστε το στυλ σύνοψης, έτσι ώστε τα μοντέλα να προτιμούν τις συνοπτικές, πιστές περιλήψεις σε σχέση με τις περιγραφικές ή τις παραισθήσεις
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.
Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.
Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.
Οδικός Χάρτης Εφαρμογής
Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.
Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.
Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.
Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Direct Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Βελτιστοποίηση προτιμήσεων αναλογίας πιθανοτήτων
Συχνές ερωτήσεις
What is Direct Preference Optimization?
Το Direct Preference Optimization (DPO) είναι ένας τρόπος για να ευθυγραμμιστούν τα μοντέλα γλώσσας με τις ανθρώπινες προτιμήσεις χωρίς να εκπαιδεύσετε ένα ξεχωριστό μοντέλο ανταμοιβής ή να εκτελέσετε ενισχυτική μάθηση. Καταρρέει έναν σύνθετο αγωγό πολλαπλών σταδίων σε μια ενιαία, σταθερή απώλεια προπόνησης.
Τι εξαλείφει το DPO σε σύγκριση με το παραδοσιακό RLHF;
Το κύριο πλεονέκτημα του DPO είναι η κατάργηση του ρητού μοντέλου ανταμοιβής και του βρόχου δειγματοληψίας RL, βελτιστοποιώντας την πολιτική απευθείας στα ζεύγη προτιμήσεων.
Από ποια δεδομένα αποτελείται ένα μεμονωμένο παράδειγμα εκπαίδευσης DPO;
Ο DPO εκπαιδεύεται σε ζεύγη προτιμήσεων: μια προτροπή συν μια προτιμώμενη («επιλεγμένη») και μια απάντηση που δεν προτιμάται («απορρίφθηκε»).
Τι ρόλο παίζει το μοντέλο αναφοράς στο DPO;
Μια παγωμένη αναφορά (συνήθως το μοντέλο SFT) αγκυρώνει την απώλεια. η παράμετρος beta ελέγχει πόσο μακριά μπορεί να απομακρυνθεί η εκπαιδευμένη πολιτική από αυτήν.
Στο DPO, πού αντιπροσωπεύεται η «ανταμοιβή»;
Η εξαγωγή του DPO δείχνει ότι η ανταμοιβή είναι σιωπηρή στον λόγο λογαριασμών-πιθανοτήτων μεταξύ πολιτικής και αναφοράς, επομένως δεν χρειάζεται ρητό μοντέλο ανταμοιβής.
Τι ελέγχει η παράμετρος βήτα (θερμοκρασία) στο DPO;
Το Beta διέπει τον σιωπηρό περιορισμό KL: το υψηλότερο beta κρατά την πολιτική πιο κοντά στην αναφορά, το χαμηλότερο beta επιτρέπει μεγαλύτερη απόκλιση.