ΟΔΗΓΟΣ ΓΛΩΣΣΑΣ AI

Μοντελοποίηση επιβράβευσης

Ένα μοντέλο ανταμοιβής είναι ένα νευρωνικό δίκτυο που έχει εκπαιδευτεί να προβλέπει πόσο καλή είναι μια απόκριση τεχνητής νοημοσύνης, που λειτουργεί ως αυτοματοποιημένη βάση για την ανθρώπινη κρίση.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It is the scoring engine that makes reinforcement learning from human feedback possible at scale.

Βαθιά κατάδυση

Η μοντελοποίηση ανταμοιβής λύνει ένα πρακτικό πρόβλημα: οι άνθρωποι δεν μπορούν να βαθμολογήσουν κάθε ένα από τα εκατομμύρια αποτελέσματα που παράγει ένα μοντέλο κατά τη διάρκεια της εκπαίδευσης. Αντίθετα, οι υπεύθυνοι ετικετών συγκρίνουν ένα μικρό σύνολο απαντήσεων, επιλέγοντας συνήθως ποια από τις δύο απαντήσεις στην ίδια προτροπή είναι καλύτερη. Στη συνέχεια, ένα μοντέλο ανταμοιβής εκπαιδεύεται σε αυτές τις συγκρίσεις για να εξάγει μια μοναδική βαθμολογία για οποιοδήποτε ζεύγος άμεσης απόκρισης. Ο τυπικός στόχος εκπαίδευσης είναι το μοντέλο Bradley-Terry, το οποίο μετατρέπει τις προτιμήσεις ανά ζεύγη σε πιθανότητα η μία απάντηση να υπερβαίνει την άλλη. Μόλις εκπαιδευτεί, αυτό το μοντέλο ανταμοιβής μπορεί να αξιολογήσει φθηνά απεριόριστες νέες εξόδους, παρέχοντας το σήμα που χρησιμοποιούν αλγόριθμοι όπως το PPO για να βελτιώσουν το γλωσσικό μοντέλο. Τα μοντέλα ανταμοιβής επαναχρησιμοποιούνται επίσης κατά το χρόνο συμπερασμάτων για δειγματοληψία με το καλύτερο από το Ν, όπου δημιουργούνται πολλοί υποψήφιοι και επιστρέφεται αυτός με τη μεγαλύτερη βαθμολογία.

Τεχνική διορατικότητα

Ένα μοντέλο ανταμοιβής είναι συνήθως το μοντέλο γλώσσας βάσης με την κεφαλή πρόβλεψης διακριτικών του να αντικαθίσταται από ένα ενιαίο γραμμικό στρώμα που εκπέμπει ένα βαθμωτό. Η εκπαίδευση μεγιστοποιεί την πιθανότητα καταγραφής ότι η επιλεγμένη απάντηση βαθμολογείται υψηλότερα από την απορριφθείσα: απώλεια = -log(sigmoid(r_chosen - r_rejected)). Σημασία έχει μόνο η σχετική διαφορά, οπότε η απόλυτη κλίμακα είναι αυθαίρετη. Η ποιότητα εξαρτάται από τη συνέπεια της ετικέτας και την ευρεία κάλυψη των στυλ απόκρισης.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.

Πρόσβαση και προσέγγιση χρηστών

Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.

Σαφέστερες αποφάσεις

Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.

The Future of Reward Modeling

Η έρευνα αντιμετωπίζει τις μεγαλύτερες αδυναμίες των μοντέλων ανταμοιβής: μπορούν να «χακαριστούν» (τα μοντέλα εκμεταλλεύονται ιδιορρυθμίες όπως να προτιμούν το μήκος) και απομακρύνονται από τη διανομή καθώς βελτιώνεται η πολιτική. Οι υποσχόμενες κατευθύνσεις περιλαμβάνουν μοντέλα ανταμοιβής διαδικασίας που βαθμολογούν κάθε βήμα συλλογισμού, σύνολα και εκτιμήσεις αβεβαιότητας για να αντισταθούν στο hacking, ετικέτες προτιμήσεων που δημιουργούνται από AI (RLAIF) και μοντέλα ανταμοιβής που παράγουν κριτικές και συλλογισμούς και όχι έναν απλό αριθμό.

Υλοποίηση σε πραγματικό κόσμο

Ενισχύοντας το RLHF για βοηθούς όπως ChatGPT και Claude βαθμολογώντας τις απαντήσεις των υποψηφίων κατά τη διάρκεια της εκπαίδευσης PPO

Δειγματοληψία Best-of-N, όπου ένα μοντέλο παράγει πολλές απαντήσεις και το μοντέλο ανταμοιβής επιλέγει το καλύτερο για τον χρήστη

Μαθηματικά και κωδικοποίηση «επαληθευτών» ή μοντέλων ανταμοιβής διαδικασίας που βαθμολογούν ενδιάμεσα συλλογιστικά βήματα για τη βελτίωση της επίλυσης προβλημάτων

Κατάταξη και φιλτράρισμα δεδομένων συνθετικής προπόνησης, διατηρώντας μόνο γενιές με υψηλή βαθμολογία για περαιτέρω βελτίωση

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.

Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.

Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.

2

Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.

3

Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.

4

Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Συχνές ερωτήσεις

What is Reward Modeling?

Ένα μοντέλο ανταμοιβής είναι ένα νευρωνικό δίκτυο που έχει εκπαιδευτεί να προβλέπει πόσο καλή είναι μια απόκριση τεχνητής νοημοσύνης, που λειτουργεί ως αυτοματοποιημένη βάση για την ανθρώπινη κρίση. Είναι η μηχανή βαθμολόγησης που καθιστά δυνατή την ενίσχυση της μάθησης από την ανθρώπινη ανατροφοδότηση σε κλίμακα.

Ποια είναι η κύρια έξοδος ενός μοντέλου ανταμοιβής για ένα δεδομένο ζεύγος προτροπής-απόκρισης;

Ένα μοντέλο ανταμοιβής χαρτογραφεί μια προτροπή και μια απάντηση σε έναν βαθμωτό αριθμό που αντιπροσωπεύει την προβλεπόμενη ποιότητα ή την ανθρώπινη προτίμηση.

Τι είδους ανθρώπινα δεδομένα χρησιμοποιούνται συχνότερα για την εκπαίδευση μοντέλων ανταμοιβής;

Οι υπεύθυνοι ετικετών συγκρίνουν συνήθως δύο απαντήσεις στην ίδια προτροπή και επιλέγουν την καλύτερη. το μοντέλο Bradley-Terry τα μετατρέπει σε κλιμακωτή ανταμοιβή.

Τι βελτιστοποιεί το τυπικό μοντέλο απώλειας ανταμοιβής;

Η απώλεια Bradley-Terry, -log(sigmoid(r_chosen - r_rejected)), ενδιαφέρεται μόνο για τη σχετική σειρά, επομένως η απόλυτη κλίμακα είναι αυθαίρετη.

Τι είναι το «hacking ανταμοιβής»;

Το hacking ανταμοιβής συμβαίνει όταν το μοντέλο βρίσκει συντομεύσεις (όπως υπερβολικό μήκος ή κολακεία) που το ατελές μοντέλο ανταμοιβής βαθμολογεί υψηλά, αλλά οι άνθρωποι όχι.

Πώς ένα μοντέλο επιβράβευσης προκύπτει αρχιτεκτονικά από ένα μοντέλο γλώσσας;

Ένα μοντέλο ανταμοιβής τυπικά επαναχρησιμοποιεί τη ραχοκοκαλιά LM, αλλά ανταλλάσσει το τελικό επίπεδο με ένα που παράγει μια ενιαία βαθμωτή ανταμοιβή.