ΟΔΗΓΟΣ ΓΛΩΣΣΑΣ AI

Βελτιστοποίηση δειγματοληψίας απόρριψης

Το Rejection Sampling Fine-Tuning (RFT) δημιουργεί πολλές υποψήφιες απαντήσεις, διατηρεί μόνο αυτές με τις καλύτερες βαθμολογίες και επανεκπαιδεύει το μοντέλο σε αυτούς τους νικητές.

2 λεπτά ανάγνωσηΤελευταία ενημέρωση

Επισκόπηση

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

Βαθιά κατάδυση

Δειγματοληψία απόρριψης Το Fine-Tuning, που μερικές φορές αποκαλείται καλύτερος συντονισμός, είναι ένα βασικό συστατικό στον τρόπο με τον οποίο ευθυγραμμίστηκαν μοντέλα όπως το Llama 2 και το Llama 3 του Meta. Η συνταγή είναι απλή: για κάθε ερώτηση, δοκιμάστε πολλές απαντήσεις (ας πούμε από 4 έως 64) από το τρέχον μοντέλο, βαθμολογήστε την καθεμία με ένα μοντέλο ανταμοιβής ή έναν αυτόματο έλεγχο και, στη συνέχεια, απορρίψτε («απόρριψη») όλες εκτός από τις εξόδους στην κορυφή. Τα σωζόμενα δείγματα υψηλής ποιότητας γίνονται ένα φρέσκο ​​εποπτευόμενο σύνολο δεδομένων λεπτομέρειας και το μοντέλο εκπαιδεύεται σε αυτά με συνηθισμένη απώλεια επόμενου συμβολαίου. Η επανάληψη αυτού του βρόχου ωθεί επαναληπτικά το μοντέλο προς τη δημιουργία καλύτερων απαντήσεων από μόνο του. Επειδή το μοντέλο μαθαίνει από τις δικές του φιλτραρισμένες εξόδους, το RFT αποφεύγει τους πονοκεφάλους αστάθειας και συντονισμού του RL με κλίση πολιτικής, ενώ εξακολουθεί να αξιοποιεί ένα σήμα ανταμοιβής.

Τεχνική διορατικότητα

Το RFT εκμεταλλεύεται το γεγονός ότι η δειγματοληψία πολλές φορές και η διατήρηση της απόκρισης μέγιστης ανταμοιβής προσεγγίζει την επιλογή από μια οξυμένη, υψηλότερης ποιότητας διανομή. Η εκπαίδευση σε αυτούς τους νικητές μέσω τυπικής διασταυρούμενης εντροπίας αποστάζει αποτελεσματικά αυτή την καλύτερη συμπεριφορά πίσω στις εξόδους ενός δείγματος του μοντέλου. Για επαληθεύσιμους τομείς όπως τα μαθηματικά ή ο κώδικας, η «ανταμοιβή» μπορεί απλώς να είναι εάν η τελική απάντηση ή η δοκιμασία μονάδας περάσει, καταργώντας εντελώς την ανάγκη για ένα μοντέλο μαθημένης ανταμοιβής.

Στρατηγικός αντίκτυπος

Ταχύτητα και κλίμακα

Οι ροές εργασίας της γλώσσας μπορούν να κινηθούν πιο γρήγορα χωρίς να θυσιάζεται η συνέπεια.

Πρόσβαση και προσέγγιση χρηστών

Επεκτείνει την πρόσβαση σε όλες τις γλώσσες και τα στυλ επικοινωνίας.

Σαφέστερες αποφάσεις

Οι ομάδες μπορούν να αφιερώσουν περισσότερο χρόνο στην κρίση, ενώ ο αυτοματισμός χειρίζεται την επανάληψη.

Βελτιστοποίηση του μέλλοντος της δειγματοληψίας απόρριψης

Η RFT είναι κεντρική στη σύγχρονη μετα-εκπαίδευση, που χρησιμοποιείται συχνά πριν ή παράλληλα με μεθόδους RL όπως η PPO και η DPO. Η απήχησή του μεγαλώνει με φθηνά συμπεράσματα και ισχυρούς αυτόματους επαληθευτές: καθώς τα μοντέλα βελτιώνονται στην αυτο-δημιουργία και τον αυτοέλεγχο, η επαναλαμβανόμενη δειγματοληψία απόρριψης υποστηρίζει βρόχους συνθετικών δεδομένων και αυτοβελτίωσης. Αναμένετε στενότερη ενοποίηση με μοντέλα συλλογιστικής που παράγουν επαληθεύσιμες αλυσίδες σκέψης και συνεχή μελέτη για το πώς να αποφύγετε το hacking ανταμοιβής και την κατάρρευση της διαφορετικότητας όταν εκπαιδεύεστε επανειλημμένα στα αποτελέσματα του ίδιου του μοντέλου.

Υλοποίηση σε πραγματικό κόσμο

Ευθυγράμμιση μοντέλων τύπου Llama με δειγματοληψία πολλαπλών απαντήσεων ανά ερώτηση, διατηρώντας τις υψηλότερες βαθμολογίες μοντέλου ανταμοιβής και, στη συνέχεια, SFT σε αυτές

Βελτίωση ενός λύτη μαθηματικών δημιουργώντας πολλές λύσεις και διατηρώντας μόνο αυτές που φτάνουν στη σωστή, ελέγξιμη απάντηση

Δημιουργία κώδικα όπου οι υποψήφιοι διατηρούνται μόνο εάν περάσουν τις δοκιμασίες μονάδας και στη συνέχεια χρησιμοποιούνται ως δεδομένα εκπαίδευσης

Δημιουργία συνθετικών συνόλων δεδομένων εντολών φιλτράροντας τις καλύτερες αυτοπαραγόμενες απαντήσεις ενός μοντέλου για τον επόμενο κύκλο εκπαίδευσης

Κίνδυνοι & προστατευτικά κιγκλιδώματα

Τα παραισθησιακά γεγονότα μπορούν να εισάγουν αθόρυβα αναφορές, να υποστηρίζουν ροές ή αποτελέσματα έρευνας.

Η άμεση ευαισθησία μπορεί να δημιουργήσει ασυνεπή αποτελέσματα σε παρόμοια αιτήματα.

Τα ευαίσθητα δεδομένα κειμένου ενδέχεται να εκτεθούν εάν τα στοιχεία ελέγχου πρόσβασης είναι αδύναμα.

Οδικός Χάρτης Εφαρμογής

1

Καθορίστε τη μορφή εξόδου, τον τόνο και τα πρότυπα ποιότητας πριν από την κυκλοφορία.

2

Επίγειες απαντήσεις με αξιόπιστες πηγές όποτε έχει σημασία η ακρίβεια.

3

Διατηρήστε ένα σημείο ελέγχου ανθρώπινης αξιολόγησης για αποτελέσματα υψηλού πονταρίσματος.

4

Παρακολουθήστε τα μοτίβα αποτυχίας και επανεκπαιδεύστε τις προτροπές ή τις ροές εργασίας τακτικά.

Συνεχίστε την εξερεύνηση

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Έναρξη κουίζ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Συχνές ερωτήσεις

What is Rejection Sampling Fine-Tuning?

Το Rejection Sampling Fine-Tuning (RFT) δημιουργεί πολλές υποψήφιες απαντήσεις, διατηρεί μόνο αυτές με τις καλύτερες βαθμολογίες και επανεκπαιδεύει το μοντέλο σε αυτούς τους νικητές. Έχει σημασία γιατί προσφέρει μεγάλο μέρος του πλεονεκτήματος του RLHF χρησιμοποιώντας την απλή εποπτευόμενη μάθηση αντί για τη σύνθετη ενισχυτική μάθηση.

Ποια είναι η βασική ιδέα του Rejection Sampling Fine-Tuning;

Το RFT δειγματίζει πολλαπλές αποκρίσεις, φιλτράρει με αυτές που έχουν την καλύτερη βαθμολογία και προσαρμόζει το μοντέλο σε αυτούς τους νικητές.

Σε επαληθεύσιμους τομείς όπως τα μαθηματικά ή ο κώδικας, τι μπορεί να χρησιμεύσει ως ανταμοιβή;

Για ελεγχόμενες εργασίες, το RFT μπορεί να χρησιμοποιήσει την ακριβή ορθότητα ή να περάσει δοκιμές μονάδας, αποφεύγοντας ένα μοντέλο μαθημένης ανταμοιβής.

Ποια οικογένεια μοντέλων χρησιμοποίησε περίφημα τη δειγματοληψία απόρριψης κατά τη διάρκεια της ευθυγράμμισης;

Ο Meta περιέγραψε τη χρήση δειγματοληψίας απόρριψης ως μέρος της συνταγής μετά την εκπαίδευση για τα μοντέλα Llama 2 και Llama 3.

Γιατί μπορεί οι ομάδες να προτιμούν το RFT έναντι του RL με κλίση πολιτικής όπως το PPO;

Το RFT επανεκπαιδεύεται με τυπική απώλεια επόμενου συμβολισμού σε φιλτραρισμένα δείγματα, παρακάμπτοντας τη δυσκολία συντονισμού και την αστάθεια των μεθόδων κλίσης πολιτικής.

Τι κάνει αποτελεσματικά η εκπαίδευση στα δείγματα μέγιστης ανταμοιβής;

Μαθαίνοντας από τις κορυφαίες φιλτραρισμένες απαντήσεις, το μοντέλο εσωτερικεύει συμπεριφορά υψηλότερης ποιότητας σε μία μόνο γενιά.