PRZEWODNIK Językowy AI

Optymalizacja preferencji ilorazu szans

Optymalizacja preferencji ilorazu szans (ORPO) to metoda dostrajania, która uczy modelu językowego dobrego zachowania i ludzkich preferencji w jednym przejściu szkoleniowym.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.

Głębokie nurkowanie

ORPO, wprowadzone przez Honga, Lee i Thorne’a w 2024 r., łączy w jednym kroku nadzorowane dostrajanie i dostosowywanie preferencji. Większość potoków dopasowujących najpierw wykonuje SFT na dobrych przykładach, a następnie uruchamia drugą metodę, taką jak RLHF lub DPO, która wymaga zamrożonej kopii modelu (odniesienia) oraz przechowywanych par preferencji. ORPO całkowicie usuwa model referencyjny. Jego strata dodaje karę do standardowego celu następnego żetonu: zwiększa szanse, które model przypisuje wybranej (preferowanej) reakcji, jednocześnie zmniejszając szanse odrzuconej. Ponieważ wykorzystuje iloraz szans, a nie silną lukę logarytmiczną prawdopodobieństwa, kara jest delikatna, więc model uczy się faworyzować dobre odpowiedzi, nie zapominając katastrofalnie o płynnym generowaniu.

Wgląd techniczny

Strata ORPO to strata entropii krzyżowej SFT plus ważona log-esigmoida logarytmu ilorazu szans pomiędzy wybranymi i odrzuconymi odpowiedziami. Szanse są równe p/(1-p), więc stosunek porównuje, o ile bardziej prawdopodobne jest, że model znajdzie dobrą odpowiedź w porównaniu ze złą. Używanie kursów zamiast surowego prawdopodobieństwa pozwala zachować łagodny kontrast, co zapobiega nadmiernemu tłumieniu odrzuconych tokenów, co może pogorszyć model bez odniesienia.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość optymalizacji preferencji ilorazu szans

ORPO zyskuje na popularności, ponieważ ogranicza pamięć i moc obliczeniową poprzez porzucenie modelu referencyjnego, co jest atrakcyjne dla zespołów dostrajających na ograniczonym sprzęcie. Spodziewaj się, że będzie pojawiał się częściej w przepisach open source i jako opcja domyślna w bibliotekach takich jak Hugging Face TRL. Przyszłe prace prawdopodobnie automatycznie dostosują ważenie lambda, połączą ORPO z innymi celami niewymagającymi odniesienia i rozszerzą je na modele multimodalne i bardzo duże, w przypadku których przechowywanie dwóch kopii w pamięci jest kosztowne.

Implementacja w świecie rzeczywistym

Dostrajanie modelu czatu 7B o otwartym kodzie źródłowym na parach preferencji bez ładowania drugiej kopii referencyjnej, zmniejszając o połowę pamięć GPU

Startup, który dostosowuje asystenta obsługi klienta do preferowania uprzejmych, zgodnych z zasadami odpowiedzi w jednym szkoleniu zamiast SFT-potem-DPO

Naukowcy porównujący ORPO z DPO w tym samym zestawie danych, aby wykazać porównywalne dopasowanie przy niższych obliczeniach

Dostosowanie modelu podstawowego do wyspecjalizowanej dziedziny (np. redagowania tekstów prawnych), gdzie dostępne są dobre i złe pary przykładów, ale nie jest dostępny budżet modelu nagrody

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Odds Ratio Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Bezpośrednia optymalizacja preferencji

Często zadawane pytania

What is Odds Ratio Preference Optimization?

Optymalizacja preferencji ilorazu szans (ORPO) to metoda dostrajania, która uczy modelu językowego dobrego zachowania i ludzkich preferencji w jednym przejściu szkoleniowym. Ma to znaczenie, ponieważ pomija zwykły, oddzielny model nagrody i model referencyjny, dzięki czemu dostosowanie jest tańsze i prostsze.

Jaka jest główna praktyczna przewaga ORPO nad metodami takimi jak DPO?

ORPO łączy uczenie się preferencji ze stratą SFT i nie potrzebuje zamrożonej kopii referencyjnej modelu, co oszczędza pamięć i obliczenia.

Co porównuje „iloraz szans” w ORPO?

ORPO wykorzystuje stosunek szans (p/(1-p)), który model przypisuje preferowanej odpowiedzi do odpowiedzi preferowanej.

Jakie dwa zadania ORPO wykonuje w ramach jednego karnetu szkoleniowego?

ORPO łączy standardowy cel następnego żetonu SFT z karą preferencyjną w jednej wspólnej stracie.

Dlaczego ORPO w przypadku kary stosuje kursy, a nie surową różnicę logarytmiczną prawdopodobieństwa?

Kara oparta na prawdopodobieństwie jest łagodniejsza, co pomaga modelowi bez odniesienia zachować płynne generowanie, jednocześnie preferując dobre odpowiedzi.

Jaka kombinacja najlepiej opisuje stratę ORPO?

ORPO dodaje ważony składnik ilorazu szans log-esigmoidalny do nadzorowanej straty entropii krzyżowej.