Sprach-KI-GUIDE

Feinabstimmung der Ablehnungsstichprobe

Rejection Sampling Fine-Tuning (RFT) generiert viele Kandidatenantworten, behält nur die Antworten mit der besten Bewertung bei und trainiert das Modell auf diese Gewinner neu.

2 Minuten gelesenZuletzt aktualisiert

Übersicht

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

Tiefer Einblick

Die Feinabstimmung der Ablehnungsstichprobe, manchmal auch Best-of-N-Feinabstimmung genannt, ist ein wichtiger Bestandteil bei der Ausrichtung von Modellen wie Llama 2 und Llama 3 von Meta. Das Rezept ist einfach: Probieren Sie für jede Eingabeaufforderung mehrere Antworten (z. B. 4 bis 64) aus dem aktuellen Modell aus, bewerten Sie jede mit einem Belohnungsmodell oder einem automatischen Prüfer und verwerfen Sie dann alle Ergebnisse mit Ausnahme der am höchsten bewerteten Ergebnisse („ablehnen“). Die verbleibenden qualitativ hochwertigen Proben werden zu einem neuen, überwachten Feinabstimmungsdatensatz, und das Modell wird darauf mit normalem Verlust des nächsten Tokens trainiert. Durch die iterative Wiederholung dieser Schleife wird das Modell dazu gebracht, selbst bessere Antworten zu generieren. Da das Modell aus seinen eigenen gefilterten Ausgaben lernt, vermeidet RFT die Instabilität und Abstimmungsprobleme von Policy-Gradient-RL und nutzt dennoch ein Belohnungssignal.

Technischer Einblick

RFT nutzt die Tatsache aus, dass die wiederholte Stichprobe und die Beibehaltung der Antwort mit der maximalen Belohnung einer Auswahl aus einer geschärften Verteilung mit höherer Qualität nahe kommen. Das Training dieser Gewinner mittels Standard-Kreuzentropie destilliert dieses Best-of-N-Verhalten effektiv zurück in die Einzelstichprobenausgaben des Modells. Bei überprüfbaren Bereichen wie Mathematik oder Code kann die „Belohnung“ einfach darin bestehen, ob die endgültige Antwort oder der Komponententest bestanden wird, sodass kein erlerntes Belohnungsmodell erforderlich ist.

Strategische Auswirkungen

Geschwindigkeit und Umfang

Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.

Zugang und Erreichbarkeit

Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.

Klarere Entscheidungen

Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.

Die Zukunft der Feinabstimmung der Ablehnungsstichprobe

RFT ist für das moderne Post-Training von zentraler Bedeutung und wird häufig vor oder neben RL-Methoden wie PPO und DPO eingesetzt. Seine Attraktivität wächst mit kostengünstigen Schlussfolgerungen und starken automatischen Verifizierern: Da Modelle besser in der Lage sind, sich selbst zu generieren und zu überprüfen, unterstützt die iterierte Ablehnungsstichprobe Schleifen für synthetische Daten und Selbstverbesserung. Erwarten Sie eine engere Integration mit Argumentationsmodellen, die überprüfbare Gedankenketten erzeugen, und fortlaufende Untersuchungen darüber, wie Belohnungs-Hacking und Diversity-Zusammenbruch vermieden werden können, wenn wiederholt an den eigenen Ergebnissen eines Modells trainiert wird.

Reale Umsetzung

Ausrichtung von Modellen im Lama-Stil durch Stichprobenziehung mehrerer Antworten pro Eingabeaufforderung, Beibehaltung der höchsten Belohnungsmodellwerte und anschließende SFT für diese

Verbesserung eines Mathe-Lösers, indem viele Lösungen generiert und nur diejenigen beibehalten werden, die die richtige, überprüfbare Antwort ergeben

Codegenerierung, bei der Kandidaten nur dann behalten werden, wenn sie Unit-Tests bestehen, und dann als Trainingsdaten verwendet werden

Erstellen synthetischer Befehlsdatensätze durch Filtern der besten selbst generierten Antworten eines Modells für die nächste Trainingsrunde

Risiken und Leitplanken

Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.

Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.

Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.

Implementierungs-Roadmap

1

Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.

2

Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.

3

Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.

4

Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.

Entdecken Sie weiter

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz starten

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Nächster Leitfaden

QLoRA und 4-Bit-Feinabstimmung

Häufig gestellte Fragen

What is Rejection Sampling Fine-Tuning?

Rejection Sampling Fine-Tuning (RFT) generiert viele Kandidatenantworten, behält nur die Antworten mit der besten Bewertung bei und trainiert das Modell auf diese Gewinner neu. Dies ist wichtig, weil es einen Großteil der Vorteile von RLHF bietet, indem es einfaches überwachtes Lernen anstelle von komplexem Verstärkungslernen nutzt.

Was ist die Kernidee der Feinabstimmung der Ablehnungsstichprobe?

RFT prüft mehrere Antworten, filtert die Antworten mit der höchsten Punktzahl und passt das Modell anhand dieser Gewinner an.

Was kann in überprüfbaren Bereichen wie Mathematik oder Code als Belohnung dienen?

Für überprüfbare Aufgaben kann RFT die exakte Korrektheit oder das Bestehen von Unit-Tests verwenden und so ein erlerntes Belohnungsmodell vermeiden.

Welche Modellfamilie nutzte bekanntermaßen die Ablehnungsstichprobe während der Ausrichtung?

Meta beschrieben die Verwendung von Ablehnungsstichproben als Teil des Post-Training-Rezepts für die Modelle Llama 2 und Llama 3.

Warum bevorzugen Teams möglicherweise RFT gegenüber Policy-Gradient-RL wie PPO?

RFT trainiert mit Standard-Next-Token-Verlust bei gefilterten Stichproben neu und umgeht so die Optimierungsschwierigkeiten und die Instabilität von Policy-Gradient-Methoden.

Was bewirkt das Training an den Beispielen mit der maximalen Belohnung effektiv?

Durch das Lernen aus den am besten gefilterten Antworten verinnerlicht das Modell Verhalten höherer Qualität in einer einzigen Generation.