Βελτιστοποίηση εγγύς πολιτικής
Το Proximal Policy Optimization (PPO) είναι ο αλγόριθμος ενίσχυσης μάθησης που σχετίζεται περισσότερο με τη βελτίωση των μοντέλων γλώσσας από την ανθρώπινη ανατροφοδότηση.
Επισκόπηση
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Βαθιά κατάδυση
Το PPO εισήχθη από τον OpenAI το 2017 και έγινε η κινητήρια δύναμη πίσω από το RLHF για συστήματα όπως το InstructGPT και το ChatGPT. Η βασική πρόκληση στο RL με διαβάθμιση πολιτικής είναι ότι μια μεμονωμένη υπερβολικά μεγάλη ενημέρωση μπορεί να καταρρεύσει την απόδοση. Το PPO το αντιμετωπίζει με έναν «περικομμένο υποκατάστατο στόχο»: μετρά πόσο περισσότερο (ή λιγότερο) πιθανή έχει γίνει μια ενέργεια σε σχέση με την παλιά πολιτική, πολλαπλασιάζει αυτή την αναλογία με το πλεονέκτημα (πόσο καλύτερη ήταν η δράση από την αναμενόμενη) και περικόπτει την αναλογία σε ένα μικρό εύρος όπως 0,8 έως 1,2. Αυτό καθορίζει πόσο μακριά μπορεί να προχωρήσει η πολιτική ανά ενημέρωση, διατηρώντας σταθερή τη μάθηση ενώ παράλληλα επιτρέπει τη σταθερή βελτίωση. Στο μοντέλο γλώσσας RLHF, η «δράση» δημιουργεί ένα διακριτικό ή απάντηση, η ανταμοιβή προέρχεται από ένα μοντέλο ανταμοιβής και μια ποινή απόκλισης KL εμποδίζει το μοντέλο να απομακρυνθεί πολύ από την αρχική του συμπεριφορά.
Τεχνική διορατικότητα
Το PPO μεγιστοποιεί έναν αποκομμένο στόχο: ελάχ. Τα πλεονεκτήματα εκτιμώνται συνήθως με Γενικευμένη Εκτίμηση Πλεονεκτημάτων και ένα δίκτυο μαθησιακής αξίας (κρίσιμο). Στο RLHF, η συνολική ανταμοιβή συνδυάζει τη βαθμολογία του μοντέλου ανταμοιβής με μια ποινή KL ανά διακριτικό έναντι της πολιτικής αναφοράς, εξισορροπώντας το κέρδος ανταμοιβής έναντι της παραμονής κοντά στο αρχικό μοντέλο.
Στρατηγικός αντίκτυπος
Ταχύτητα και κλίμακα
Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.
Πρόσβαση και προσέγγιση χρηστών
Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.
Σαφέστερες αποφάσεις
Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.
Το μέλλον της εγγύς βελτιστοποίησης πολιτικής
Το PPO παραμένει ισχυρό, αλλά είναι διαβόητο δυσνόητο: χρειάζεται ξεχωριστό δίκτυο τιμών, προσεκτικό συντονισμό υπερπαραμέτρων και πολύ υπολογισμό. Οι απλούστερες εναλλακτικές λύσεις κερδίζουν έδαφος, συμπεριλαμβανομένου του DPO (καθόλου RL) και του GRPO, το οποίο απορρίπτει το δίκτυο αξίας εκτιμώντας τα πλεονεκτήματα από ομάδες δειγματοληπτικών απαντήσεων και έχει ενεργοποιήσει πρόσφατα μοντέλα συλλογιστικής. Το PPO θα παραμείνει εκεί όπου η εξερεύνηση εντός πολιτικής βοηθά πραγματικά, αλλά το πεδίο ανταλλάσσει ενεργά μέρος της πολυπλοκότητάς του για φθηνότερες μεθόδους.
Υλοποίηση σε πραγματικό κόσμο
Βελτιστοποίηση InstructGPT και ChatGPT για να ακολουθήσετε τις οδηγίες και τις ανθρώπινες προτιμήσεις μέσω του RLHF
Εκπαίδευση πρακτόρων ελέγχου παιχνιδιών και ρομποτικής, αρχικός τομέας PPO πριν από μοντέλα γλώσσας
Μείωση της τοξικότητας ή βελτίωση της εξυπηρετικότητας μεγιστοποιώντας τη βαθμολογία του μοντέλου ανταμοιβής κάτω από έναν περιορισμό KL
Βελτιστοποίηση της συμπεριφοράς του παράγοντα χρήσης εργαλείων ή πολλαπλών βημάτων όπου ένα μοντέλο ανταμείβεται για τη σωστή ολοκλήρωση εργασιών
Κίνδυνοι & προστατευτικά κιγκλιδώματα
Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.
Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.
Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.
Οδικός Χάρτης Εφαρμογής
Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.
Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.
Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.
Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.
Συνεχίστε την εξερεύνηση
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Επόμενος οδηγός
Βελτιστοποίηση σχετικής πολιτικής ομάδας
Συχνές ερωτήσεις
What is Proximal Policy Optimization?
Το Proximal Policy Optimization (PPO) είναι ο αλγόριθμος ενίσχυσης μάθησης που σχετίζεται περισσότερο με τη βελτίωση των μοντέλων γλώσσας από την ανθρώπινη ανατροφοδότηση. Βελτιώνει μια πολιτική με προσεκτικά, μικρά βήματα για να αποφευχθεί η αστάθεια που μαστίζει τις αφελείς μεθόδους κλίσης πολιτικής.
Ποιο πρόβλημα αντιμετωπίζει πρωτίστως το «κλιπ» του PPO;
Η περικοπή του λόγου πιθανότητας αποτρέπει οποιαδήποτε μεμονωμένη ενημέρωση από το να μετακινήσει την πολιτική πολύ μακριά, η οποία είναι η κύρια πηγή αστάθειας στις μεθόδους διαβάθμισης πολιτικής.
Στο μοντέλο γλώσσας RLHF με PPO, από πού προέρχεται συνήθως το σήμα ανταμοιβής;
Ένα μοντέλο ανταμοιβής παρέχει τη βαθμωτή ανταμοιβή για τις δημιουργούμενες αποκρίσεις, καθώς το να σκοράρουν οι άνθρωποι σε κάθε έξοδο κατά τη διάρκεια της RL θα ήταν ανέφικτο.
Τι κάνει η ποινή απόκλισης KL σε RLHF που βασίζεται σε PPO;
Η ποινή KL ανά διακριτικό έναντι της αρχικής πολιτικής (αναφοράς) αποθαρρύνει το μοντέλο να αλλάξει πολύ δραστικά τη συμπεριφορά του ενώ κυνηγά ανταμοιβή.
Ποιος είναι ο ρόλος του δικτύου αξίας (κριτικής) στο PPO;
Το PPO είναι μια μέθοδος που ασκεί κριτική. το δίκτυο αξίας εκτιμά την αναμενόμενη ανταμοιβή, επιτρέποντας εκτιμήσεις πλεονεκτημάτων (συχνά μέσω GAE) που μειώνουν τη διακύμανση.
Τι αντιπροσωπεύει το «πλεονέκτημα» στο PPO;
Το πλεονέκτημα μετρά πόσο καλύτερη (ή χειρότερη) ήταν μια επιλεγμένη ενέργεια σε σχέση με την εκτίμηση της αξίας, δηλώνοντας στην πολιτική ποιες ενέργειες πρέπει να ενισχύσει.