PANDUAN AI Bahasa

Optimalisasi Kebijakan Proksimal

Pengoptimalan Kebijakan Proksimal (PPO) adalah algoritme pembelajaran penguatan yang paling terkait dengan penyempurnaan model bahasa dari umpan balik manusia.

2 min readTerakhir diperbarui

Ikhtisar

It improves a policy in careful, small steps to avoid the instability that plagues naive policy gradient methods.

Menyelam Lebih Dalam

PPO diperkenalkan oleh OpenAI pada tahun 2017 dan menjadi pekerja keras di balik RLHF untuk sistem seperti InstructGPT dan ChatGPT. Tantangan inti dalam RL gradien kebijakan adalah bahwa satu pembaruan yang terlalu besar dapat menurunkan kinerja. PPO mengatasi hal ini dengan 'tujuan pengganti yang terpotong': PPO mengukur seberapa besar (atau kecil) kemungkinan suatu tindakan dibandingkan dengan kebijakan lama, mengalikan rasio tersebut dengan keuntungan (seberapa jauh lebih baik tindakan tersebut dibandingkan yang diharapkan), dan memotong rasio tersebut ke kisaran kecil seperti 0,8 hingga 1,2. Hal ini membatasi sejauh mana kebijakan dapat bergerak per pembaruan, menjaga pembelajaran tetap stabil dan tetap memungkinkan peningkatan yang berkelanjutan. Dalam model bahasa RLHF, 'tindakan' menghasilkan token atau respons, imbalan berasal dari model imbalan, dan penalti divergensi KL menjaga model agar tidak menyimpang terlalu jauh dari perilaku aslinya.

Wawasan Teknis

PPO memaksimalkan tujuan yang terpotong: min(rasio * keuntungan, klip(rasio, 1-eps, 1+eps) * keuntungan), dengan rasio adalah probabilitas tindakan baru-dari-lama. Keuntungan biasanya diperkirakan dengan Generalized Advantage Estimation dan jaringan nilai yang dipelajari (kritik). Di RLHF, total imbalan menggabungkan skor model imbalan dengan penalti KL per token terhadap kebijakan referensi, sehingga menyeimbangkan perolehan imbalan agar tetap mendekati model asli.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Optimalisasi Kebijakan Proksimal

PPO tetap kuat tetapi terkenal rumit: memerlukan jaringan nilai terpisah, penyetelan hyperparameter yang cermat, dan banyak komputasi. Alternatif yang lebih sederhana kini semakin populer, termasuk DPO (tidak ada RL sama sekali) dan GRPO, yang menghilangkan jaringan nilai dengan memperkirakan keuntungan dari kelompok respons yang dijadikan sampel dan telah mendukung model penalaran terkini. PPO akan bertahan jika eksplorasi sesuai kebijakan benar-benar membantu, namun bidang ini secara aktif menukar kompleksitasnya dengan metode yang lebih murah.

Implementasi Dunia Nyata

Menyempurnakan InstructGPT dan ChatGPT untuk mengikuti instruksi dan preferensi manusia melalui RLHF

Melatih agen kontrol permainan dan robotika, domain asli PPO sebelum model bahasa

Mengurangi toksisitas atau meningkatkan kegunaan dengan memaksimalkan skor model penghargaan berdasarkan batasan KL

Mengoptimalkan perilaku penggunaan alat atau agen multi-langkah di mana model diberi penghargaan karena menyelesaikan tugas dengan benar

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Proximal Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Optimasi Kebijakan Relatif Grup

Pertanyaan yang sering diajukan

What is Proximal Policy Optimization?

Pengoptimalan Kebijakan Proksimal (PPO) adalah algoritme pembelajaran penguatan yang paling terkait dengan penyempurnaan model bahasa dari umpan balik manusia. Hal ini memperbaiki kebijakan dengan langkah-langkah kecil dan hati-hati untuk menghindari ketidakstabilan yang mengganggu metode gradien kebijakan yang naif.

Masalah apa yang terutama diatasi oleh 'kliping' PPO?

Memotong rasio probabilitas akan mencegah pembaruan apa pun untuk menggerakkan kebijakan terlalu jauh, yang merupakan sumber utama ketidakstabilan dalam metode gradien kebijakan.

Dalam model bahasa RLHF dengan PPO, sinyal reward biasanya berasal dari mana?

Model penghargaan memberikan imbalan skalar untuk respons yang dihasilkan, karena meminta manusia untuk menilai setiap keluaran selama RL tidak mungkin dilakukan.

Apa dampak penalti KL-divergence pada RLHF berbasis PPO?

Penalti KL per token terhadap kebijakan (referensi) asli membuat model enggan mengubah perilakunya terlalu drastis sambil mengejar imbalan.

Apa peran jaringan nilai (kritik) dalam PPO?

PPO adalah metode aktor-kritikus; jaringan nilai memperkirakan imbalan yang diharapkan, memungkinkan estimasi keuntungan (seringkali melalui GAE) yang mengurangi varians.

Apa yang dimaksud dengan 'keuntungan' dalam PPO?

Keuntungannya mengukur seberapa baik (atau lebih buruk) suatu tindakan yang dipilih dibandingkan dengan perkiraan nilai, sehingga memberi tahu kebijakan tindakan mana yang harus diperkuat.