PANDUAN Teknis

Pembelajaran Penguatan Terbalik

Pembelajaran penguatan terbalik (IRL) membalik RL standar: alih-alih diberi imbalan dan menemukan kebijakan, pembelajaran ini mengamati perilaku ahli dan menyimpulkan fungsi imbalan tersembunyi yang menjelaskannya.

2 min readTerakhir diperbarui

Ikhtisar

This matters because a recovered reward generalizes to new situations far better than directly copied actions.

Menyelam Lebih Dalam

Pembelajaran penguatan terbalik menanyakan: tujuan apa yang harus dicapai oleh seorang pakar agar dapat berperilaku seperti itu? Dengan adanya demonstrasi, IRL memulihkan fungsi penghargaan di mana perilaku tersebut terlihat optimal (atau mendekati optimal), kemudian menggunakan RL standar untuk mendapatkan kebijakan. Motivasinya adalah generalisasi - imbalan yang dipelajari menangkap alasan di balik perilaku, sehingga agen dapat bertindak secara bijaksana dalam keadaan yang tidak pernah dicakup oleh demonstrasi, tidak seperti kloning perilaku yang hanya meniru tindakan. Masalahnya pada dasarnya tidak tepat: banyak fungsi penghargaan menjelaskan perilaku yang sama, termasuk perilaku yang sepele. Pendekatan utama menyelesaikan ambiguitas ini, termasuk metode margin maksimum yang lebih memilih imbalan yang menjadikan pakar jelas-jelas yang terbaik, dan IRL entropi maksimum, yang memilih distribusi imbalan dengan komitmen paling rendah yang konsisten dengan data.

Wawasan Teknis

Tantangan utamanya adalah ambiguitas: tidak ada imbalan yang terus-menerus membuat setiap kebijakan menjadi optimal, sehingga banyak sekali imbalan yang bisa menjelaskan demonstrasi apa pun. IRL entropi maksimum menyelesaikan masalah ini dengan memodelkan demonstrasi yang diambil dari distribusi di mana probabilitas lintasan tumbuh secara eksponensial dengan total imbalan. Hal ini menghasilkan tujuan yang unik dan terdefinisi dengan baik dan tentu saja menangani para ahli yang berisik dan tidak sempurna, karena lintasan yang kurang optimal hanya menerima probabilitas yang lebih rendah namun bukan nol daripada dikesampingkan.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan Pembelajaran Penguatan Terbalik

IRL semakin mendukung pembelajaran penghargaan untuk keselarasan: dibandingkan dengan pemberian kode oleh manusia, sistem menyimpulkan apa yang dihargai oleh orang-orang dari perilaku dan umpan balik. Harapkan hubungan yang lebih erat dengan pembelajaran penguatan dari umpan balik manusia dan pembelajaran preferensi, penskalaan ke model bahasa dan pengaturan robotika. Penelitian sedang mendorong pemulihan imbalan dari video mentah dan observasi parsial, serta menuju imbalan yang dapat diidentifikasi dan tahan terhadap peretasan imbalan dan masalah ambiguitas yang mengganggu metode saat ini.

Implementasi Dunia Nyata

Kendaraan otonom menyimpulkan preferensi berkendara (kelancaran, margin keselamatan) dari pengemudi manusia

Robot mempelajari tujuan tugas dari demonstrasi manusia untuk menggeneralisasi ke tata letak baru

Memodelkan pergerakan pejalan kaki atau hewan dengan memulihkan tujuan di balik lintasan yang diamati

Hadiahi inferensi untuk penyelarasan AI, pelajari nilai-nilai kemanusiaan dari pilihan yang ditunjukkan

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Inverse Reinforcement Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pembelajaran Penguatan Dari Umpan Balik Manusia

Pertanyaan yang sering diajukan

What is Inverse Reinforcement Learning?

Pembelajaran penguatan terbalik (IRL) membalik RL standar: alih-alih diberi imbalan dan menemukan kebijakan, pembelajaran ini mengamati perilaku ahli dan menyimpulkan fungsi imbalan tersembunyi yang menjelaskannya. Hal ini penting karena imbalan yang diperoleh dapat digeneralisasikan ke situasi baru dengan jauh lebih baik daripada tindakan yang ditiru secara langsung.

Apa yang ingin dipulihkan oleh pembelajaran penguatan terbalik?

IRL mengambil demonstrasi sebagai masukan dan menyimpulkan fungsi imbalan yang mendasari perilaku pakar tampak optimal.

Mengapa masalah IRL digambarkan sebagai masalah yang tidak tepat atau ambigu?

Berbagai fungsi imbalan, termasuk imbalan yang semuanya nol, dapat membuat perilaku yang diamati menjadi optimal, sehingga imbalan tidak ditentukan secara unik oleh demonstrasi saja.

Keuntungan utama apa yang dimiliki oleh pemulihan hadiah dibandingkan kloning perilaku?

Fungsi penghargaan mengkodekan alasan pakar bertindak seperti itu, membiarkan kebijakan turunan berperilaku wajar di negara bagian baru, sedangkan kloning hanya menyalin tindakan yang terlihat dalam data.

Bagaimana IRL entropi maksimum mengatasi ambiguitas penghargaan?

IRL entropi maksimum mengasumsikan lintasan dengan imbalan yang lebih tinggi memiliki kemungkinan yang lebih besar secara eksponensial, sehingga memberikan tujuan unik yang juga menoleransi pakar yang tidak sempurna dan berisik.

Setelah IRL memulihkan fungsi hadiah, apa yang biasanya dilakukan selanjutnya?

IRL menghasilkan imbalan, yang kemudian diserahkan ke algoritme RL normal untuk menghitung kebijakan optimal berdasarkan tujuan yang disimpulkan tersebut.