ΟΔΗΓΟΣ Βασικών Αρχών

Bradley-Terry Reward Modeling

Το μοντέλο Bradley-Terry είναι μια στατιστική μέθοδος αιώνων για τη μετατροπή των συγκρίσεων κατά ζεύγη (το Α κερδίζει το Β) σε αριθμητικές βαθμολογίες.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

In modern AI it powers reward models that learn human preferences from 'which answer is better?' labels, the backbone of RLHF.

Βαθιά κατάδυση

Ο Bradley-Terry, που εισήχθη το 1952, υποθέτει ότι κάθε στοιχείο έχει μια κρυφή βαθμολογία δύναμης και η πιθανότητα ότι το στοιχείο Α ξεπερνά το στοιχείο Β είναι η λογιστική συνάρτηση της διαφοράς βαθμολογίας τους. Στην ευθυγράμμιση τεχνητής νοημοσύνης, αυτό αντιστοιχίζεται προσεκτικά σε δεδομένα προτιμήσεων: οι άνθρωποι που σημαίνουν ετικέτες βλέπουν δύο αποκρίσεις μοντέλων και επιλέγουν το καλύτερο, αντί να δίνουν απόλυτες βαθμολογίες που είναι δύσκολο να βαθμονομηθούν. Ένα μοντέλο ανταμοιβής, συνήθως το μοντέλο γλώσσας με βαθμωτή κεφαλή εξόδου, εκπαιδεύεται έτσι ώστε η απόκριση που προτιμούν οι άνθρωποι να λαμβάνει υψηλότερη κλιμακωτή ανταμοιβή. Η απώλεια είναι η αρνητική λογαριθμική πιθανότητα της πιθανότητας Bradley-Terry: μεγιστοποιήστε το λογαριθμικό σιγμοειδές του (ανταμοιβή της επιλεγμένης μείον την ανταμοιβή της απόρριψης). Το προκύπτον μοντέλο ανταμοιβής βαθμολογεί στη συνέχεια αυθαίρετες εξόδους, παρέχοντας το σήμα με το οποίο βελτιστοποιούνται οι αλγόριθμοι μάθησης ενίσχυσης όπως το PPO για να κάνουν τα μοντέλα πιο χρήσιμα και ευθυγραμμισμένα.

Τεχνική διορατικότητα

Η απώλεια εκπαίδευσης για μια σύγκριση είναι απλώς μείον λογαριθμικό σιγμοειδές του (r_chosen − r_rejected), οπότε το μοντέλο μαθαίνει μόνο σχετικές διαφορές. Αυτό σημαίνει ότι οι ανταμοιβές είναι αναγνωρίσιμες μόνο μέχρι μια προσθετική σταθερά. η απόλυτη κλίμακα είναι αυθαίρετη. Επειδή οι συγκρίσεις είναι ευκολότερες και πιο συνεπείς για τους ανθρώπους από τις βαθμολογίες 1 προς 10, τα δεδομένα Bradley-Terry είναι λιγότερο θορυβώδη. Η βελτιστοποίηση άμεσης προτίμησης έδειξε αργότερα ότι μπορείτε να παραλείψετε το ξεχωριστό μοντέλο ανταμοιβής και να βελτιστοποιήσετε τον στόχο Bradley-Terry απευθείας στην πολιτική.

Στρατηγικός αντίκτυπος

Σαφέστερες αποφάσεις

Σας βοηθά να διαχωρίσετε σαφείς τεχνικούς ισχυρισμούς από τη γλώσσα μάρκετινγκ.

Κόστος και προϋπολογισμός

Μπορείτε να κάνετε καλύτερες ερωτήσεις εφαρμογής προτού ξοδέψετε χρήματα ή χρόνο.

Ομάδα και ροή εργασίας

Οι ομάδες με κοινή κατανόηση λαμβάνουν καλύτερες αποφάσεις για προϊόντα, πολιτικές και μάθηση.

Το μέλλον του Bradley-Terry Reward Modeling

Ο Bradley-Terry υποθέτει μια ενιαία σταθερή κατάταξη και μεταβατικές προτιμήσεις, οι οποίες καταρρέουν όταν οι άνθρωποι διαφωνούν ή οι προτιμήσεις κάνουν κύκλο. Η έρευνα κινείται προς μοντέλα που συλλαμβάνουν κατανομές προτιμήσεων, πολυδιάστατες ανταμοιβές (εξυπηρέτηση, ασφάλεια, ειλικρίνεια βαθμολογούνται ξεχωριστά) και μεθόδους όπως ο Nash που μαθαίνει από την ανθρώπινη ανατροφοδότηση που απορρίπτουν την υπόθεση της μοναδικής βαθμολογίας. Ο DPO και οι παραλλαγές του αναδιπλώνουν όλο και περισσότερο τον στόχο Bradley-Terry απευθείας στην κατάρτιση πολιτικής. Αναμένετε πλουσιότερα συστήματα σύγκρισης, συμπεριλαμβανομένων κατάταξης περισσότερων από δύο στοιχείων και σταθμισμένων προτιμήσεων εμπιστοσύνης, για να μειώσετε το hacking με ανταμοιβή.

Υλοποίηση σε πραγματικό κόσμο

Εκπαίδευση του μοντέλου ανταμοιβής στο RLHF που κατατάσσει δύο αποκρίσεις chatbot και τροφοδοτεί το σήμα καλύτερου χειρότερου στη λεπτομέρεια PPO.

Η Βελτιστοποίηση Άμεσης Προτίμησης τελειοποιεί ένα μοντέλο απευθείας σε ζεύγη απαντήσεων επιλεγμένων έναντι απορριφθέντων χρησιμοποιώντας την απώλεια λογαριθμικού σιγμοειδούς Bradley-Terry.

Κατάταξη παικτών σκακιού ή esports μέσω του Elo, το οποίο είναι μαθηματικά στενός ξάδερφος του μοντέλου Bradley-Terry στα αποτελέσματα των αγώνων.

Δημιουργία κατάταξης προτάσεων περιεχομένου από δεδομένα κλικ «οι χρήστες προτιμούν Α έναντι Β» αντί για απόλυτες βαθμολογίες με αστέρια.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Διαφορετικές ομάδες μπορεί να χρησιμοποιούν τον ίδιο όρο με διαφορετικό τρόπο, επομένως ορίστε το πεδίο εφαρμογής νωρίς.

Τα σημεία αναφοράς μπορεί να φαίνονται ισχυρά ενώ η απόδοση στον πραγματικό κόσμο είναι άνιση.

Η αγνόηση της ποιότητας των δεδομένων και των σχεδίων αξιολόγησης δημιουργεί συχνά εύθραυστα αποτελέσματα.

Οδικός Χάρτης Εφαρμογής

1

Ξεκινήστε με έναν ορισμό σε απλή γλώσσα του αποτελέσματος που χρειάζεστε.

2

Επιλέξτε μία μέτρηση επιτυχίας και μία συνθήκη αποτυχίας πριν από τη δοκιμή.

3

Εκτελέστε ένα μικρό πιλότο με αντιπροσωπευτικά δεδομένα, όχι ένα εκλεπτυσμένο σετ επίδειξης.

4

Τεκμηριώστε πού βοηθά το Bradley-Terry Reward Modeling και πού είναι καλύτερες οι απλούστερες μέθοδοι.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Bradley-Terry Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Μοντελοποίηση επιβράβευσης

Συχνές ερωτήσεις

What is Bradley-Terry Reward Modeling?

Το μοντέλο Bradley-Terry είναι μια στατιστική μέθοδος αιώνων για τη μετατροπή των συγκρίσεων κατά ζεύγη (το Α κερδίζει το Β) σε αριθμητικές βαθμολογίες. Στη σύγχρονη τεχνητή νοημοσύνη ενεργοποιεί μοντέλα ανταμοιβής που μαθαίνουν τις ανθρώπινες προτιμήσεις από το «ποια απάντηση είναι καλύτερη;» ετικέτες, η ραχοκοκαλιά του RLHF.

Τι μετατρέπει το μοντέλο Bradley-Terry σε αριθμητική βαθμολογία;

Ο Bradley-Terry λαμβάνει ανά δύο συγκρίσεις «A beats B» και συμπεραίνει μια κρυφή βαθμολογία αντοχής για κάθε στοιχείο, γι' αυτό ταιριάζει τόσο καλά στην ετικέτα ανθρώπινης προτίμησης.

Στο Bradley-Terry, η πιθανότητα το Α να νικήσει το Β είναι συνάρτηση τι;

Το μοντέλο θέτει το P(A beats B) ίσο με το λογιστικό (σιγμοειδές) της διαφοράς μεταξύ των βαθμολογιών κρυφής δύναμης του Α και του Β.

Γιατί οι ανταμοιβές Bradley-Terry είναι αναγνωρίσιμες μόνο μέχρι μια προσθετική σταθερά;

Η απώλεια προπόνησης χρησιμοποιεί μόνο τη διαφορά μεταξύ των επιλεγμένων και των απορριφθέντων ανταμοιβών, επομένως η μετατόπιση όλων των βαθμολογιών κατά την ίδια σταθερά αφήνει την απώλεια αμετάβλητη. η απόλυτη κλίμακα είναι αυθαίρετη.

Ποια είναι η τυπική απώλεια για μία σύγκριση προτιμήσεων στη μοντελοποίηση ανταμοιβής;

Η αρνητική λογαριθμική πιθανότητα του Bradley-Terry μειώνεται στο μείον λογαριθμικό σιγμοειδές της διαφοράς ανταμοιβής επιλεγμένο-μείον-απορρίφθηκε, ωθώντας την ανταμοιβή της επιλεγμένης απάντησης υψηλότερα.

Ποια μέθοδος παραλείπει ένα ξεχωριστό μοντέλο ανταμοιβής βελτιστοποιώντας τον στόχο Bradley-Terry απευθείας στην πολιτική;

Ο DPO επαναδιατυπώνει τον στόχο προτίμησης Bradley-Terry, ώστε να μπορεί να εφαρμοστεί απευθείας στο μοντέλο πολιτικής, καταργώντας την ανάγκη εκπαίδευσης και αναζήτησης ενός αυτόνομου μοντέλου ανταμοιβής.