ΟΔΗΓΟΣ Βασικών Αρχών

Κανονοποίηση ομαδοποιημένης ανταμοιβής σε RLHF

Η ομαδοποίηση κανονικοποίησης ανταμοιβών τυποποιεί τις ανταμοιβές ενός μοντέλου μέσα σε μια παρτίδα απαντήσεων στην ίδια προτροπή, μετατρέποντας τις θορυβώδεις βαθμολογίες σε ένα σταθερό σήμα εκπαίδευσης.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It is the core trick behind GRPO, the algorithm that powers many modern reasoning models.

Βαθιά κατάδυση

Στην ενισχυτική μάθηση από την ανθρώπινη ανάδραση (RLHF), ένα μοντέλο δημιουργεί απαντήσεις και ένα μοντέλο ανταμοιβής τις βαθμολογεί, αλλά οι ακατέργαστες ανταμοιβές είναι θορυβώδεις και ποικίλλουν πολύ μεταξύ των προτροπών. Η ομαδοποίηση ομαδοποιημένης ανταμοιβής το διορθώνει δειγματίζοντας μια ομάδα πολλών απαντήσεων στην ίδια προτροπή, στη συνέχεια κανονικοποιώντας κάθε ανταμοιβή αφαιρώντας τον μέσο όρο της ομάδας και διαιρώντας με την τυπική απόκλιση της ομάδας. Αυτό το z-score γίνεται το πλεονέκτημα. Η προσέγγιση είναι κεντρική στο Group Relative Policy Optimization (GRPO), που εισήχθη από το DeepSeek, το οποίο τροφοδότησε περίφημα το σκεπτικό του DeepSeek-R1. Κρίσιμα, το GRPO καταργεί το ξεχωριστό δίκτυο αξίας (κρίσιμο) που χρησιμοποιείται από το PPO, καθώς ο μέσος όρος της ομάδας χρησιμεύει ως βάση. Αυτό κάνει την προπόνηση απλούστερη, φθηνότερη και πιο αποδοτική στη μνήμη, διατηρώντας παράλληλα το σήμα κλίσης σε καλή κλίμακα.

Τεχνική διορατικότητα

Για μια ομάδα εξόδων με ανταμοιβές r_1...r_G, το πλεονέκτημα είναι A_i = (r_i − mean(r)) / std(r). Οι απαντήσεις καλύτερες από τον μέσο όρο της ομάδας τους έχουν θετικό πλεονέκτημα και ενισχύονται. χειρότερες από το μέσο όρο πιέζονται προς τα κάτω. Επειδή η σύγκριση είναι σχετική εντός μιας προτροπής, η απόλυτη κλίμακα ανταμοιβής και η δυσκολία ανά προτροπή ακυρώνονται, μειώνοντας τη διακύμανση. Το GRPO διατηρεί τον περιορισμένο στόχο και την ποινή KL του PPO έναντι μιας πολιτικής αναφοράς για να αποτρέψει την υπερβολική μετατόπιση του μοντέλου.

Στρατηγικός αντίκτυπος

Σαφέστερες αποφάσεις

Σας βοηθά να διαχωρίσετε σαφείς τεχνικούς ισχυρισμούς από τη γλώσσα μάρκετινγκ.

Κόστος και προϋπολογισμός

Μπορείτε να κάνετε καλύτερες ερωτήσεις εφαρμογής προτού ξοδέψετε χρήματα ή χρόνο.

Ομάδα και ροή εργασίας

Οι ομάδες με κοινή κατανόηση λαμβάνουν καλύτερες αποφάσεις για προϊόντα, πολιτικές και μάθηση.

Το μέλλον της ομαδοποιημένης κανονικοποίησης ανταμοιβής στο RLHF

Η ομαδοποιημένη κανονικοποίηση τροφοδοτεί την έκρηξη του συλλογισμού-μοντέλου, όπου τα μοντέλα μαθαίνουν από επαληθεύσιμες ανταμοιβές όπως σωστές μαθηματικές απαντήσεις χωρίς έμπειρο κριτικό. Η έρευνα το βελτιώνει: συζητήσεις σχετικά με το αν θα γίνει διαίρεση με τυπική απόκλιση, ο χειρισμός όλων των σωστών ή εντελώς λανθασμένων ομάδων που παράγουν μηδενικό πλεονέκτημα και κλιμάκωση του μεγέθους της ομάδας. Αναμένετε ομαδοποιημένες μεθόδους χωρίς κριτικούς να εξαπλωθούν στη χρήση πρακτόρων και στη δημιουργία κώδικα, όπου οι αυτόματοι επαληθευτές παρέχουν φθηνά, άφθονα σήματα ανταμοιβής.

Υλοποίηση σε πραγματικό κόσμο

Εκπαίδευση ενός μοντέλου μαθηματικής συλλογιστικής δειγματίζοντας 16 λύσεις ανά πρόβλημα και επιβραβεύοντας εκείνες που υπερβαίνουν τη μέση ορθότητα της ομάδας.

Βελτιώστε τη χρησιμότητα ενός chatbot κανονικοποιώντας τις βαθμολογίες του μοντέλου ανταμοιβής σε πολλές υποψήφιες απαντήσεις σε κάθε ερώτηση χρήστη.

Βελτίωση ενός βοηθού κωδικοποίησης όπου κάθε διάλυμα δειγματοληψίας βαθμολογείται με βάση το εάν περνάει σε δοκιμές μονάδας και στη συνέχεια κανονικοποιείται εντός της ομάδας.

Μείωση της μνήμης GPU σε μια διοχέτευση RLHF με την απόρριψη του κριτικού δικτύου PPO και τη χρήση του μέσου όρου ομάδας ως βάσης.

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Διαφορετικές ομάδες μπορεί να χρησιμοποιούν τον ίδιο όρο με διαφορετικό τρόπο, επομένως ορίστε το πεδίο εφαρμογής νωρίς.

Τα σημεία αναφοράς μπορεί να φαίνονται ισχυρά ενώ η απόδοση στον πραγματικό κόσμο είναι άνιση.

Η αγνόηση της ποιότητας των δεδομένων και των σχεδίων αξιολόγησης δημιουργεί συχνά εύθραυστα αποτελέσματα.

Οδικός Χάρτης Εφαρμογής

1

Ξεκινήστε με έναν ορισμό σε απλή γλώσσα του αποτελέσματος που χρειάζεστε.

2

Επιλέξτε μία μέτρηση επιτυχίας και μία συνθήκη αποτυχίας πριν από τη δοκιμή.

3

Εκτελέστε ένα μικρό πιλότο με αντιπροσωπευτικά δεδομένα, όχι ένα εκλεπτυσμένο σετ επίδειξης.

4

Τεκμηριώστε όπου βοηθάει η Ομαδοποίηση Κανονισμού ανταμοιβής στο RLHF και όπου οι απλούστερες μέθοδοι είναι καλύτερες.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped Reward Normalization in RLHF quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Επόμενος οδηγός

Κανονοποίηση μήκους στη βελτιστοποίηση προτιμήσεων

Συχνές ερωτήσεις

What is Grouped Reward Normalization in RLHF?

Η ομαδοποίηση κανονικοποίησης ανταμοιβών τυποποιεί τις ανταμοιβές ενός μοντέλου μέσα σε μια παρτίδα απαντήσεων στην ίδια προτροπή, μετατρέποντας τις θορυβώδεις βαθμολογίες σε ένα σταθερό σήμα εκπαίδευσης. Είναι το βασικό τέχνασμα πίσω από το GRPO, τον αλγόριθμο που τροφοδοτεί πολλά σύγχρονα συλλογιστικά μοντέλα.

Στην ομαδοποιημένη ομαλοποίηση ανταμοιβής, ποια είναι η ανταμοιβή κάθε απάντησης σε σύγκριση με;

Κάθε ανταμοιβή μετατρέπεται σε z-score χρησιμοποιώντας τον μέσο όρο και την τυπική απόκλιση της ομάδας απαντήσεων στην ίδια προτροπή.

Ποιος αλγόριθμος σχετίζεται περισσότερο με την ομαδοποίηση ομαδικής ανταμοιβής;

Το GRPO, που εισήχθη από το DeepSeek και χρησιμοποιείται στο DeepSeek-R1, βασίζεται στην ομαλοποίηση των ανταμοιβών μέσα σε μια ομάδα.

Ποιο στοιχείο του τυπικού PPO εξαλείφει το GRPO;

Χρησιμοποιώντας τον μέσο όρο της ομάδας ως βάση, το GRPO απορρίπτει τον μαθημένο κριτικό, εξοικονομώντας μνήμη και υπολογισμό.

Τι συμβαίνει σε μια απάντηση της οποίας η ανταμοιβή είναι κάτω από τη μέση τιμή της ομάδας της;

Η αφαίρεση του μέσου όρου της ομάδας κάνει τις απαντήσεις κάτω του μέσου όρου να έχουν αρνητικό πλεονέκτημα, απομακρύνοντας την πολιτική από αυτές.

Γιατί η κανονικοποίηση μέσα σε μια ομάδα μειώνει τη διακύμανση της προπόνησης;

Επειδή οι συγκρίσεις είναι σχετικές σε κάθε προτροπή, οι διαφορές στην απόλυτη κλίμακα και στην άμεση δυσκολία ξεπερνιούνται.