Βελτιστοποίηση σχετικής πολιτικής ομάδας
Το Group Relative Policy Optimization (GRPO) είναι μια μέθοδος ενίσχυσης εκμάθησης για τη βελτίωση των μοντέλων γλώσσας που κρίνει κάθε απάντηση έναντι μιας ομάδας αδελφών απαντήσεων στην ίδια προτροπή, εξαλείφοντας το ξεχωριστό δίκτυο τιμών που χρησιμοποιείται από το PPO.
Επισκόπηση
It became famous as the core training trick behind DeepSeek's reasoning models.
Βαθιά κατάδυση
Το GRPO είναι μια παραλλαγή της εκμάθησης ενίσχυσης βαθμίδας πολιτικής που έχει σχεδιαστεί για να κάνει τη βελτιστοποίηση RL μεγάλων γλωσσικών μοντέλων φθηνότερη και πιο σταθερή. Το τυπικό PPO χρειάζεται έναν μαθημένο «κριτικό» (μοντέλο αξίας), περίπου τόσο μεγάλο όσο η ίδια η πολιτική, για να εκτιμήσει πόσο καλό είναι κάθε διακριτικό. Το GRPO αφαιρεί εντελώς αυτόν τον κριτικό. Για κάθε προτροπή λαμβάνει δείγματα μιας ομάδας ολοκληρώσεων (ας πούμε 8-64), τις βαθμολογεί όλες με ένα σήμα ανταμοιβής και στη συνέχεια υπολογίζει το πλεονέκτημα κάθε ολοκλήρωσης τυποποιώντας την ανταμοιβή της έναντι του μέσου όρου και της τυπικής απόκλισης της ομάδας. Οι απαντήσεις άνω του μέσου όρου ενισχύονται και οι κάτω του μέσου όρου καταστέλλονται. Ένας όρος απόκλισης KL διατηρεί το μοντέλο κοντά σε μια πολιτική αναφοράς. Παρουσιάστηκε από το DeepSeek, τροφοδοτούσε το DeepSeekMath και τα μοντέλα συλλογισμού DeepSeek-R1.
Τεχνική διορατικότητα
Η βασική ιδέα είναι η αντικατάσταση της βασικής γραμμής μαθησιακής αξίας του PPO με μια γραμμή βάσης ομάδας Monte Carlo. Για μια ομάδα εξόδων με ανταμοιβές r_i, κάθε πλεονέκτημα είναι A_i = (r_i - mean(r)) / std(r). Αυτή η κανονικοποιημένη βαθμολογία πολλαπλασιάζει τον περικομμένο λόγο πιθανότητας, ακριβώς όπως στο PPO, και μια ποινή KL έναντι ενός παγωμένου μοντέλου αναφοράς περιορίζει την ολίσθηση. Επειδή κανένας κριτικός δεν είναι εκπαιδευμένος, η μνήμη και ο υπολογισμός μειώνονται χονδρικά στο μισό και η κανονικοποίηση ανά προτροπή παρέχει φυσικά πλεονεκτήματα χαμηλής διακύμανσης σε κλίμακα.
Στρατηγικός αντίκτυπος
Κόστος και προϋπολογισμός
Οι αποφάσεις για την αρχιτεκτονική καθορίζουν την απόδοση και το λειτουργικό κόστος για χρόνια.
Σαφέστερες αποφάσεις
Η τεχνική εκπαίδευση βοηθά τις ομάδες να επιλέξουν τη σωστή στοίβα, όχι μόνο τη νεότερη.
Ελεγχος ποιότητας
Οι καλύτερες επιλογές μηχανικής μειώνουν τα περιστατικά αξιοπιστίας στην παραγωγή.
Το μέλλον της βελτιστοποίησης σχετικής πολιτικής ομάδας
Το GRPO έχει γίνει γρήγορα μια προεπιλεγμένη συνταγή για την εκπαίδευση μοντέλων ανοιχτής συλλογιστικής και τα εργαστήρια επαναλαμβάνονται στα αδύνατα σημεία του. Οι ερευνητές διερευνούν επιδιορθώσεις για προκαταλήψεις μήκους και δυσκολίας (όπως το Dr. GRPO), κανονικοποίηση σε επίπεδο διακριτικού και όχι σε επίπεδο ακολουθίας και αφαιρώντας ή αναμορφώνοντας τον όρο KL. Αναμένετε αυστηρότερη ενσωμάτωση με επαληθεύσιμες ανταμοιβές (μαθηματικά, κώδικας, χρήση εργαλείων), καλύτερο χειρισμό αραιών σημάτων και υβρίδια που συνδυάζουν ομαδικές γραμμές βάσης με ελαφρούς κριτικούς για αντιπροσωπευτικές εργασίες πολλαπλών βημάτων.
Υλοποίηση σε πραγματικό κόσμο
Εκπαίδευση DeepSeek-R1 και DeepSeekMath για την παραγωγή συλλογισμών μακράς αλυσίδας σκέψης χρησιμοποιώντας ανταμοιβές ορθότητας βάσει κανόνων σε μαθηματικά προβλήματα
Μοντέλα δημιουργίας κώδικα λεπτής ρύθμισης όπου κάθε λύση δειγματοληψίας βαθμολογείται ανάλογα με το αν έχει περάσει τις δοκιμές μονάδας και η ομάδα κανονικοποιείται για να επιλέγει τους νικητές
Σωληνώσεις RLHF ανοιχτού κώδικα (π.χ. σε βιβλιοθήκες TRL και verl) που χρησιμοποιούν GRPO για την ευθυγράμμιση μοντέλων συνομιλίας χωρίς να πληρώνουν για ξεχωριστό δίκτυο αξίας
Βελτίωση της συμπεριφοράς παρακολούθησης οδηγιών ή ασφάλειας με δειγματοληψία πολλών απαντήσεων ανά προτροπή και επιβράβευση αυτών που ένα μοντέλο ανταμοιβής έχει υψηλότερα ποσοστά σε σχέση με τους συνομηλίκους του
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Η βελτιστοποίηση ενός σημείου αναφοράς μπορεί να κρύψει ευρύτερες αδυναμίες του συστήματος.
Το κόστος υποδομής και συντήρησης συχνά υποτιμάται.
Τα κενά ασφάλειας και παρατηρητικότητας μπορούν να αυξηθούν καθώς τα συστήματα γίνονται πιο πολύπλοκα.
Οδικός Χάρτης Εφαρμογής
Καθορίστε τους στόχους καθυστέρησης, ποιότητας και κόστους πριν από την εφαρμογή.
Σημείο αναφοράς υπό ρεαλιστικές συνθήκες φορτίου και δεδομένων.
Παρακολούθηση οργάνου για σφάλματα, μετατόπιση και επιπτώσεις από τον χρήστη.
Προετοιμάστε διαδρομές επαναφοράς και απόκρισης συμβάντος πριν την κλιμάκωση.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Βελτιστοποίηση εγγύς πολιτικής
Συχνές ερωτήσεις
What is Group Relative Policy Optimization?
Το Group Relative Policy Optimization (GRPO) είναι μια μέθοδος ενίσχυσης εκμάθησης για τη βελτίωση των μοντέλων γλώσσας που κρίνει κάθε απάντηση έναντι μιας ομάδας αδελφών απαντήσεων στην ίδια προτροπή, εξαλείφοντας το ξεχωριστό δίκτυο τιμών που χρησιμοποιείται από το PPO. Έγινε διάσημο ως το βασικό εκπαιδευτικό κόλπο πίσω από τα συλλογιστικά μοντέλα του DeepSeek.
Ποιο σημαντικό συστατικό του PPO εξαλείφει το GRPO;
Η αλλαγή της υπογραφής του GRPO απορρίπτει το μοντέλο εκμάθησης αξίας/κριτικής του PPO, το οποίο είναι συνήθως το ίδιο μέγεθος με την πολιτική, εξοικονομώντας σημαντική μνήμη και υπολογισμό.
Πώς υπολογίζει το GRPO το πλεονέκτημα για μια δεδομένη ολοκλήρωση;
Το πλεονέκτημα κάθε ολοκλήρωσης είναι (ανταμοιβή - μέσος όρος ομάδας) / τυπική απόκλιση ομάδας, επομένως η ομάδα απαντήσεων στην ίδια προτροπή λειτουργεί ως γραμμή βάσης.
Ποια μοντέλα έκαναν γνωστό το GRPO;
Το GRPO εισήχθη και διαδόθηκε από το DeepSeek, κυρίως στο DeepSeekMath και ως η μηχανή RL πίσω από τα μοντέλα συλλογισμού DeepSeek-R1.
Τι ρόλο παίζει ο όρος απόκλισης KL στο GRPO;
Μια ποινή KL έναντι ενός μοντέλου αναφοράς (συνήθως του προ-RL) τακτοποιεί την εκπαίδευση, ώστε η πολιτική να βελτιώνεται χωρίς να καταρρέει ή να παρασύρεται σε εκφυλισμένες εκροές.
Γιατί το GRPO είναι ιδιαίτερα ελκυστικό για την εκπαίδευση μοντέλων συλλογισμού σε μαθηματικά ή κώδικα;
Η δειγματοληψία πολλών λύσεων και η βαθμολόγησή τους με αυτόματους ελέγχους ορθότητας συνδυάζεται καθαρά με τα ομαδικά πλεονεκτήματα του GRPO, χωρίς να χρειάζεται κριτική.