PANDUAN AI Bahasa

Optimasi Preferensi Langsung

Pengoptimalan Preferensi Langsung (DPO) adalah cara untuk menyelaraskan model bahasa dengan preferensi manusia tanpa melatih model penghargaan terpisah atau menjalankan pembelajaran penguatan.

2 min readTerakhir diperbarui

Ikhtisar

It collapses a complex multi-stage pipeline into a single, stable training loss.

Menyelam Lebih Dalam

DPO, yang diperkenalkan oleh Rafailov dan rekan-rekannya di Stanford pada tahun 2023, memikirkan kembali cara kami mengajarkan model yang disukai orang. Pendekatan tradisional (RLHF) melatih model penghargaan pada perbandingan manusia, kemudian menggunakan pembelajaran penguatan untuk memaksimalkan penghargaan tersebut. Wawasan utama DPO bersifat matematis: kebijakan optimal berdasarkan tujuan RLHF tersebut memiliki hubungan tertutup dengan imbalannya, sehingga Anda dapat mengatur ulang persamaan dan mengoptimalkan model bahasa secara langsung pada pasangan preferensi. Anda memberikannya prompt, respons 'dipilih' (disukai), dan respons 'ditolak', dan kerugian gaya klasifikasi sederhana mendorong model untuk membuat jawaban yang dipilih relatif lebih mungkin. Tidak ada model imbalan, tidak ada putaran pengambilan sampel, tidak ada peretasan imbalan. Jauh lebih sederhana dan lebih stabil untuk dijalankan.

Wawasan Teknis

DPO menggunakan kerugian entropi silang biner atas pasangan preferensi. Hal ini meningkatkan rasio log-probabilitas dari respons yang dipilih relatif terhadap respons yang ditolak, masing-masing diukur berdasarkan model referensi yang dibekukan (biasanya titik awal yang diawasi dan disesuaikan). Parameter suhu beta mengontrol seberapa jauh kebijakan dapat menyimpang dari referensi tersebut, dan secara implisit menerapkan batasan KL yang diterapkan oleh RLHF secara eksplisit. Imbalannya tidak pernah terwujud; hal ini tersirat dalam probabilitas log kebijakan itu sendiri.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Optimasi Preferensi Langsung

DPO telah menjadi metode penyelarasan default karena murah dan dapat direproduksi, serta melahirkan serangkaian varian: IPO memperbaiki overfitting pada preferensi yang hampir deterministik, KTO belajar dari satu label baik atau buruk, bukan berpasangan, dan ORPO melipatgandakan pembelajaran preferensi menjadi penyesuaian tanpa model referensi. Diharapkan adanya upaya berkelanjutan untuk menggabungkan DPO dengan data sesuai kebijakan dan debiasing panjang/kualitas, sehingga mempersempit kesenjangan yang tersisa dengan RLHF online penuh.

Implementasi Dunia Nyata

Menyempurnakan model obrolan terbuka seperti Zephyr dan banyak turunan Llama dan Mistral, yang diselaraskan dengan DPO pada kumpulan data preferensi

Mengurangi keluaran yang merugikan atau tidak membantu dengan menggunakan pasangan dimana jawaban yang aman dan bermanfaat 'dipilih' daripada jawaban yang bermasalah

Mengajari asisten pengkodean untuk memilih solusi yang benar dan terdokumentasi dengan baik daripada solusi yang bermasalah menggunakan perbandingan yang dinilai pengembang

Menyesuaikan gaya peringkasan sehingga model lebih menyukai ringkasan yang ringkas dan tepat dibandingkan ringkasan yang bertele-tele atau berhalusinasi

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Optimasi Preferensi Rasio Odds

Pertanyaan yang sering diajukan

What is Direct Preference Optimization?

Pengoptimalan Preferensi Langsung (DPO) adalah cara untuk menyelaraskan model bahasa dengan preferensi manusia tanpa melatih model penghargaan terpisah atau menjalankan pembelajaran penguatan. Ini meruntuhkan pipeline multi-tahap yang kompleks menjadi satu kerugian pelatihan yang stabil.

Apa yang dihilangkan DPO dibandingkan dengan RLHF tradisional?

Keuntungan utama DPO adalah menghilangkan model penghargaan eksplisit dan loop pengambilan sampel RL, dan mengoptimalkan kebijakan langsung pada pasangan preferensi.

Data apa saja yang terdapat dalam satu contoh pelatihan DPO?

DPO melatih pasangan preferensi: satu respons cepat ditambah satu respons yang disukai ('dipilih') dan satu respons tidak disukai ('ditolak').

Peran apa yang dimainkan model referensi dalam DPO?

Referensi yang dibekukan (biasanya model SFT) menahan kerugian; parameter beta mengontrol seberapa jauh kebijakan yang dilatih dapat berpindah dari kebijakan tersebut.

Dalam DPO, di mana 'reward' diwakilkan?

Derivasi DPO menunjukkan bahwa imbalan bersifat implisit dalam rasio log-probabilitas antara kebijakan dan referensi, sehingga tidak diperlukan model imbalan yang eksplisit.

Apa yang dikontrol parameter beta (suhu) di DPO?

Beta mengatur batasan implisit KL: beta yang lebih tinggi membuat kebijakan lebih dekat dengan referensi, beta yang lebih rendah memungkinkan lebih banyak penyimpangan.