PRZEWODNIK Językowy AI

Bezpośrednia optymalizacja preferencji

Direct Preference Optimization (DPO) to sposób na dostosowanie modeli językowych do ludzkich preferencji bez szkolenia osobnego modelu nagrody lub uczenia się przez wzmacnianie.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It collapses a complex multi-stage pipeline into a single, stable training loss.

Głębokie nurkowanie

DPO, wprowadzony przez Rafailova i współpracowników na Uniwersytecie Stanforda w 2023 r., zmienia sposób, w jaki uczymy model, co wolą ludzie. Tradycyjne podejście (RLHF) uczy modelu nagrody na podstawie porównań między ludźmi, a następnie wykorzystuje uczenie się przez wzmacnianie, aby zmaksymalizować tę nagrodę. Kluczowe spostrzeżenie DPO ma charakter matematyczny: optymalna polityka w ramach tego celu RLHF ma związek w formie zamkniętej z nagrodą, dzięki czemu można zmienić układ równań i zoptymalizować model językowy bezpośrednio na podstawie par preferencji. Dajesz mu podpowiedź, „wybraną” (preferowaną) odpowiedź i „odrzuconą” odpowiedź, a prosta strata w stylu klasyfikacji popycha model do tego, aby wybrana odpowiedź była stosunkowo bardziej prawdopodobna. Brak modelu nagrody, brak pętli próbkowania, brak hakowania nagród. Jest znacznie prostszy i stabilniejszy w obsłudze.

Wgląd techniczny

DPO wykorzystuje binarną stratę entropii krzyżowej w przypadku par preferencji. Zwiększa logarytm prawdopodobieństwa wybranej odpowiedzi w stosunku do odrzuconej, każdy mierzony w oparciu o zamrożony model referencyjny (zwykle nadzorowany, dostrojony punkt początkowy). Parametr temperatury beta kontroluje, jak daleko polityka może odbiegać od tego odniesienia, w sposób dorozumiany wymuszając ograniczenie KL, które RLHF stosuje jawnie. Nagroda nigdy się nie materializuje; jest to ukryte we własnych logach prawdopodobieństw polityki.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość optymalizacji preferencji bezpośrednich

DPO stało się domyślną metodą dopasowywania, ponieważ jest tanie i powtarzalne, i dało początek rodzinie wariantów: IPO naprawia nadmierne dopasowanie do niemal deterministycznych preferencji, KTO uczy się na podstawie pojedynczych etykiet dobry lub zły zamiast par, a ORPO łączy uczenie się preferencji w dostrajanie bez modelu referencyjnego. Można się spodziewać ciągłych prac nad połączeniem DPO z danymi zgodnymi z zasadami oraz oceną długości/jakości, co zawęzi pozostałą lukę dzięki pełnemu RLHF online.

Implementacja w świecie rzeczywistym

Dostrajanie modeli czatów o otwartej wadze, takich jak Zephyr oraz wiele pochodnych Lamy i Mistrala, które zostały dostosowane do DPO w zestawach danych preferencji

Ograniczanie szkodliwych lub niepomocnych wyników za pomocą par, w których „wybiera się” bezpieczną, pomocną odpowiedź zamiast problematycznej

Nauczenie asystenta kodowania, aby preferował prawidłowe, dobrze udokumentowane rozwiązania zamiast błędnych, korzystając z porównań ocenianych przez programistów

Dostosowanie stylu podsumowań, aby modele preferowały zwięzłe i wierne streszczenia zamiast gadatliwych lub halucynacyjnych

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Optymalizacja preferencji ilorazu szans

Często zadawane pytania

What is Direct Preference Optimization?

Direct Preference Optimization (DPO) to sposób na dostosowanie modeli językowych do ludzkich preferencji bez szkolenia osobnego modelu nagrody lub uczenia się przez wzmacnianie. Łączy złożony, wieloetapowy proces w jedną, stabilną stratę szkoleniową.

Co eliminuje DPO w porównaniu z tradycyjnym RLHF?

Główną zaletą DPO jest usunięcie jawnego modelu nagrody i pętli próbkowania RL, zamiast tego optymalizacja polityki bezpośrednio na parach preferencji.

Z jakich danych składa się pojedynczy przykład szkolenia DPO?

DPO szkoli się na parach preferencji: zachęta plus jedna preferowana („wybrana”) i jedna preferowana („odrzucona”) odpowiedź.

Jaką rolę odgrywa model referencyjny w DPO?

Zamrożone odniesienie (zazwyczaj model SFT) zakotwicza stratę; parametr beta kontroluje, jak daleko mogą się od niego odsunąć przeszkolone zasady.

Gdzie w DPO jest reprezentowana „nagroda”?

Wyprowadzenie DPO pokazuje, że nagroda jest zawarta w logarytmie współczynnika prawdopodobieństwa pomiędzy polityką a odniesieniem, zatem nie jest potrzebny żaden wyraźny model nagrody.

Co kontroluje parametr beta (temperatura) w DPO?

Beta reguluje ukryte ograniczenie KL: wyższa beta utrzymuje politykę bliżej odniesienia, niższa beta pozwala na większe odchylenia.