ΟΔΗΓΟΣ ΓΛΩΣΣΑΣ AI

Βελτιστοποίηση προτιμήσεων αναλογίας πιθανοτήτων

Το Odds Ratio Preference Optimization (ORPO) είναι μια μέθοδος βελτιστοποίησης που διδάσκει σε ένα μοντέλο γλώσσας την καλή συμπεριφορά και τις ανθρώπινες προτιμήσεις σε ένα μόνο πάσο εκπαίδευσης.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.

Βαθιά κατάδυση

Το ORPO, που εισήχθη από τους Hong, Lee και Thorne το 2024, συνδυάζει την εποπτευόμενη λεπτομέρεια και την ευθυγράμμιση προτιμήσεων σε ένα βήμα. Οι περισσότεροι αγωγοί ευθυγράμμισης κάνουν πρώτα SFT σε καλά παραδείγματα και, στη συνέχεια, εκτελούν μια δεύτερη μέθοδο όπως RLHF ή DPO που απαιτεί ένα παγωμένο αντίγραφο του μοντέλου (μια αναφορά) συν αποθηκευμένα ζεύγη προτιμήσεων. Το ORPO καταργεί εντελώς το μοντέλο αναφοράς. Η απώλειά του προσθέτει έναν όρο ποινής στον τυπικό επόμενο στόχο: αυξάνει τις πιθανότητες που αποδίδει το μοντέλο στην επιλεγμένη (προτιμώμενη) απόκριση ενώ μειώνει τις πιθανότητες της απορριφθείσας. Επειδή χρησιμοποιεί την αναλογία πιθανοτήτων αντί για ένα ισχυρό χάσμα λογαριασμών-πιθανοτήτων, η ποινή είναι ήπια, έτσι το μοντέλο μαθαίνει να ευνοεί τις καλές απαντήσεις χωρίς να ξεχνά καταστροφικά την άπταιστη παραγωγή.

Τεχνική διορατικότητα

Η απώλεια του ORPO είναι η απώλεια διασταυρούμενης εντροπίας SFT συν ένα σταθμισμένο λογαριθμικό σιγμοειδές του λόγου πιθανοτήτων μεταξύ επιλεγμένων και απορριφθέντων απαντήσεων. Οι πιθανότητες είναι ίσες με p/(1-p), οπότε η αναλογία συγκρίνει πόσο πιο πιθανό είναι το μοντέλο να βρει την καλή απάντηση έναντι της κακής. Η χρήση πιθανοτήτων αντί της ακατέργαστης πιθανότητας διατηρεί την αντίθεση ήπια, γεγονός που αποτρέπει την υπερβολική καταστολή των απορριφθέντων διακριτικών που μπορεί να υποβαθμίσουν ένα μοντέλο χωρίς αναφορά.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.

Πρόσβαση και προσέγγιση χρηστών

Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.

Σαφέστερες αποφάσεις

Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.

The Future of Odds Ratio Preference Optimization

Το ORPO κερδίζει έλξη επειδή μειώνει τη μνήμη και τους υπολογισμούς εγκαταλείποντας το μοντέλο αναφοράς, το οποίο είναι ελκυστικό για ομάδες που βελτιστοποιούν σε περιορισμένο υλικό. Αναμένετε να εμφανίζεται πιο συχνά σε συνταγές ανοιχτού κώδικα και ως προεπιλεγμένη επιλογή σε βιβλιοθήκες όπως το Hugging Face TRL. Μελλοντικές εργασίες πιθανότατα θα συντονίσουν αυτόματα τη στάθμιση λάμδα, θα συνδυάσουν το ORPO με άλλους στόχους χωρίς αναφορά και θα το επεκτείνουν σε πολυτροπικά και πολύ μεγάλα μοντέλα όπου η διατήρηση δύο αντιγράφων στη μνήμη είναι δαπανηρή.

Υλοποίηση σε πραγματικό κόσμο

Βελτιστοποίηση ενός μοντέλου συνομιλίας 7Β ανοιχτού κώδικα σε ζεύγη προτιμήσεων χωρίς φόρτωση δεύτερου αντιγράφου αναφοράς, μειώνοντας στο μισό τη μνήμη GPU

Μια startup που ευθυγραμμίζει έναν βοηθό υποστήριξης πελατών ώστε να προτιμά ευγενικές απαντήσεις βάσει πολιτικής σε μια σειρά εκπαίδευσης αντί για SFT-then-DPO

Οι ερευνητές συγκρίνουν το ORPO με το DPO στο ίδιο σύνολο δεδομένων για να δείξουν συγκρίσιμη ευθυγράμμιση με χαμηλότερο υπολογισμό

Προσαρμογή ενός βασικού μοντέλου σε έναν εξειδικευμένο τομέα (π.χ. νομική σύνταξη) όπου υπάρχουν διαθέσιμα ζεύγη καλών και κακών παραδειγμάτων, αλλά ο προϋπολογισμός του μοντέλου ανταμοιβής δεν είναι

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.

Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.

Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.

2

Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.

3

Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.

4

Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Odds Ratio Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Βελτιστοποίηση άμεσης προτίμησης

Συχνές ερωτήσεις

What is Odds Ratio Preference Optimization?

Το Odds Ratio Preference Optimization (ORPO) είναι μια μέθοδος βελτιστοποίησης που διδάσκει σε ένα μοντέλο γλώσσας την καλή συμπεριφορά και τις ανθρώπινες προτιμήσεις σε ένα μόνο πάσο εκπαίδευσης. Έχει σημασία γιατί παρακάμπτει το συνηθισμένο ξεχωριστό μοντέλο ανταμοιβής και μοντέλο αναφοράς, καθιστώντας την ευθυγράμμιση φθηνότερη και απλούστερη.

Ποιο είναι το κύριο πρακτικό πλεονέκτημα του ORPO έναντι μεθόδων όπως το DPO;

Το ORPO διπλώνει την εκμάθηση προτιμήσεων στην απώλεια SFT και δεν χρειάζεται ένα παγωμένο αντίγραφο αναφοράς του μοντέλου, εξοικονομώντας μνήμη και υπολογισμό.

Τι συγκρίνει ο «λόγος πιθανοτήτων» στο ORPO;

Το ORPO χρησιμοποιεί την αναλογία πιθανοτήτων (p/(1-p)) που το μοντέλο εκχωρεί στην προτιμώμενη απάντηση έναντι της μη προτιμώμενης απάντησης.

Ποιες δύο εργασίες εκτελεί το ORPO σε ένα μόνο πάσο εκπαίδευσης;

Το ORPO συνδυάζει τον τυπικό στόχο του επόμενου συμβολικού SFT με μια ποινή προτίμησης σε μία ενοποιημένη απώλεια.

Γιατί το ORPO χρησιμοποιεί αποδόσεις αντί για ακατέργαστη διαφορά λογαριασμών πιθανότητας για την ποινή;

Η ποινή που βασίζεται στις πιθανότητες είναι ηπιότερη, βοηθώντας το μοντέλο χωρίς αναφορά να διατηρήσει εύρυθμη παραγωγή ενώ εξακολουθεί να προτιμά καλές απαντήσεις.

Ποιος συνδυασμός περιγράφεται καλύτερα η απώλεια ORPO;

Το ORPO προσθέτει έναν σταθμισμένο όρο λογαριθμικού σιγμοειδούς λόγου πιθανοτήτων πάνω από την εποπτευόμενη απώλεια διασταυρούμενης εντροπίας.