PANDUAN AI Bahasa

Optimasi Preferensi Rasio Odds

Odds Ratio Preference Optimization (ORPO) adalah metode penyesuaian yang mengajarkan model bahasa perilaku yang baik dan preferensi manusia dalam satu pelatihan.

2 min readTerakhir diperbarui

Ikhtisar

It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.

Menyelam Lebih Dalam

ORPO, yang diperkenalkan oleh Hong, Lee, dan Thorne pada tahun 2024, menggabungkan penyesuaian yang diawasi dan penyelarasan preferensi menjadi satu langkah. Sebagian besar saluran penyelarasan terlebih dahulu melakukan SFT pada contoh yang baik, kemudian menjalankan metode kedua seperti RLHF atau DPO yang memerlukan salinan model yang dibekukan (referensi) ditambah pasangan preferensi yang disimpan. ORPO menghapus model referensi seluruhnya. Kerugiannya menambahkan istilah penalti pada tujuan standar token berikutnya: hal ini meningkatkan peluang yang diberikan model pada respons yang dipilih (disukai) sekaligus menekan peluang respons yang ditolak. Karena menggunakan rasio odds dan bukan kesenjangan log-probabilitas yang kuat, hukumannya tidak terlalu besar, sehingga model belajar untuk memilih jawaban yang baik tanpa melupakan generasi yang fasih.

Wawasan Teknis

Kerugian ORPO adalah kerugian lintas entropi SFT ditambah log-sigmoid tertimbang dari rasio odds log antara respons yang dipilih dan ditolak. Peluangnya sama dengan p/(1-p), jadi rasionya membandingkan seberapa besar kemungkinan model menemukan jawaban yang baik versus jawaban yang buruk. Menggunakan peluang alih-alih probabilitas mentah menjaga kontras tetap ringan, sehingga mencegah penekanan berlebihan pada token yang ditolak yang dapat menurunkan model yang tidak direferensikan.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Optimasi Preferensi Rasio Odds

ORPO mendapatkan daya tarik karena memotong memori dan komputasi dengan menghilangkan model referensi, yang menarik bagi tim yang melakukan penyesuaian pada perangkat keras terbatas. Harapkan ini muncul lebih sering di resep sumber terbuka dan sebagai opsi default di perpustakaan seperti Hugging Face TRL. Pekerjaan di masa depan kemungkinan akan menyesuaikan bobot lambda secara otomatis, memadukan ORPO dengan tujuan bebas referensi lainnya, dan memperluasnya ke model multimodal dan sangat besar di mana menyimpan dua salinan dalam memori memerlukan biaya yang mahal.

Implementasi Dunia Nyata

Menyempurnakan model obrolan 7B sumber terbuka pada pasangan preferensi tanpa memuat salinan referensi kedua, sehingga mengurangi separuh memori GPU

Sebuah startup yang menyelaraskan asisten dukungan pelanggan untuk memilih jawaban yang sopan dan sesuai kebijakan dalam satu pelatihan dibandingkan SFT lalu DPO

Peneliti membandingkan ORPO dengan DPO pada kumpulan data yang sama untuk menunjukkan keselarasan yang sebanding dengan komputasi yang lebih rendah

Mengadaptasi model dasar ke domain khusus (misalnya, penyusunan undang-undang) di mana pasangan contoh yang baik dan buruk tersedia tetapi anggaran model penghargaan tidak tersedia

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Odds Ratio Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Optimasi Preferensi Langsung

Pertanyaan yang sering diajukan

What is Odds Ratio Preference Optimization?

Odds Ratio Preference Optimization (ORPO) adalah metode penyesuaian yang mengajarkan model bahasa perilaku yang baik dan preferensi manusia dalam satu pelatihan. Hal ini penting karena mengabaikan model penghargaan dan model referensi terpisah yang biasa, sehingga membuat penyelarasan menjadi lebih murah dan sederhana.

Apa keuntungan praktis utama ORPO dibandingkan metode seperti DPO?

ORPO melipatgandakan pembelajaran preferensi ke dalam kerugian SFT dan tidak memerlukan salinan referensi model yang dibekukan, sehingga menghemat memori dan komputasi.

Apa perbandingan 'rasio odds' di ORPO?

ORPO menggunakan rasio peluang (p/(1-p)) yang diberikan model pada jawaban yang disukai versus jawaban yang tidak disukai.

ORPO melakukan dua tugas yang mana dalam satu kali pelatihan?

ORPO menggabungkan tujuan token berikutnya SFT standar dengan penalti preferensi dalam satu kerugian terpadu.

Mengapa ORPO menggunakan odds dibandingkan perbedaan log-probabilitas mentah sebagai penalti?

Hukuman berbasis peluang lebih ringan, membantu model yang tidak direferensikan tetap menghasilkan generasi yang lancar sambil tetap memilih jawaban yang baik.

Kerugian ORPO paling tepat digambarkan sebagai kombinasi yang mana?

ORPO menambahkan istilah rasio odds log-sigmoid tertimbang di atas kerugian lintas-entropi yang diawasi.