Optimalisasi Kebijakan Proksimal
Pengoptimalan Kebijakan Proksimal (PPO) adalah algoritme pembelajaran penguatan yang paling terkait dengan penyempurnaan model bahasa dari umpan balik manusia.
Ikhtisar
It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.
Menyelam Lebih Dalam
PPO diperkenalkan oleh OpenAI pada tahun 2017 dan menjadi pekerja keras di balik RLHF untuk sistem seperti InstructGPT dan ChatGPT. Tantangan inti dalam RL gradien kebijakan adalah bahwa satu pembaruan yang terlalu besar dapat menurunkan kinerja. PPO mengatasi hal ini dengan 'tujuan pengganti yang terpotong': PPO mengukur seberapa besar (atau kecil) kemungkinan suatu tindakan dibandingkan dengan kebijakan lama, mengalikan rasio tersebut dengan keuntungan (seberapa jauh lebih baik tindakan tersebut dibandingkan yang diharapkan), dan memotong rasio tersebut ke kisaran kecil seperti 0,8 hingga 1,2. Hal ini membatasi sejauh mana kebijakan dapat bergerak per pembaruan, menjaga pembelajaran tetap stabil dan tetap memungkinkan peningkatan yang berkelanjutan. Dalam model bahasa RLHF, 'tindakan' menghasilkan token atau respons, imbalan berasal dari model imbalan, dan penalti divergensi KL menjaga model agar tidak menyimpang terlalu jauh dari perilaku aslinya.
Wawasan Teknis
PPO memaksimalkan tujuan yang terpotong: min(rasio * keuntungan, klip(rasio, 1-eps, 1+eps) * keuntungan), dengan rasio adalah probabilitas tindakan baru-dari-lama. Keuntungan biasanya diperkirakan dengan Generalized Advantage Estimation dan jaringan nilai yang dipelajari (kritik). Di RLHF, total imbalan menggabungkan skor model imbalan dengan penalti KL per token terhadap kebijakan referensi, sehingga menyeimbangkan perolehan imbalan agar tetap mendekati model asli.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Optimalisasi Kebijakan Proksimal
PPO tetap kuat tetapi terkenal rumit: memerlukan jaringan nilai terpisah, penyetelan hyperparameter yang cermat, dan banyak komputasi. Alternatif yang lebih sederhana kini semakin populer, termasuk DPO (tidak ada RL sama sekali) dan GRPO, yang menghilangkan jaringan nilai dengan memperkirakan keuntungan dari kelompok respons yang dijadikan sampel dan telah mendukung model penalaran terkini. PPO akan bertahan jika eksplorasi sesuai kebijakan benar-benar membantu, namun bidang ini secara aktif menukar kompleksitasnya dengan metode yang lebih murah.
Implementasi Dunia Nyata
Menyempurnakan InstructGPT dan ChatGPT untuk mengikuti instruksi dan preferensi manusia melalui RLHF
Melatih agen kontrol permainan dan robotika, domain asli PPO sebelum model bahasa
Mengurangi toksisitas atau meningkatkan kegunaan dengan memaksimalkan skor model penghargaan berdasarkan batasan KL
Mengoptimalkan perilaku penggunaan alat atau agen multi-langkah di mana model diberi penghargaan karena menyelesaikan tugas dengan benar
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Proximal Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Optimasi Kebijakan Relatif Grup
Pertanyaan yang sering diajukan
What is Proximal Policy Optimization?
Pengoptimalan Kebijakan Proksimal (PPO) adalah algoritme pembelajaran penguatan yang paling terkait dengan penyempurnaan model bahasa dari umpan balik manusia. Hal ini memperbaiki kebijakan dengan langkah-langkah kecil dan hati-hati untuk menghindari ketidakstabilan yang mengganggu metode gradien kebijakan yang naif.
Masalah apa yang terutama diatasi oleh 'kliping' PPO?
Memotong rasio probabilitas akan mencegah pembaruan apa pun untuk menggerakkan kebijakan terlalu jauh, yang merupakan sumber utama ketidakstabilan dalam metode gradien kebijakan.
Dalam model bahasa RLHF dengan PPO, sinyal reward biasanya berasal dari mana?
Model penghargaan memberikan imbalan skalar untuk respons yang dihasilkan, karena meminta manusia untuk menilai setiap keluaran selama RL tidak mungkin dilakukan.
Apa dampak penalti KL-divergence pada RLHF berbasis PPO?
Penalti KL per token terhadap kebijakan (referensi) asli membuat model enggan mengubah perilakunya terlalu drastis sambil mengejar imbalan.
Apa peran jaringan nilai (kritik) dalam PPO?
PPO adalah metode aktor-kritikus; jaringan nilai memperkirakan imbalan yang diharapkan, memungkinkan estimasi keuntungan (seringkali melalui GAE) yang mengurangi varians.
Apa yang dimaksud dengan 'keuntungan' dalam PPO?
Keuntungannya mengukur seberapa baik (atau lebih buruk) suatu tindakan yang dipilih dibandingkan dengan perkiraan nilai, sehingga memberi tahu kebijakan tindakan mana yang harus diperkuat.