Lewati ke konten
Donasi
Mulai di siniMulailah belajar
Belajar
Pergi ke BelajarKursusPanduanTutor AIPrompt libraryKuisSertifikatGlosarium
Berita
Pergi ke BeritaBerita AI terbaruPelacak topikResearch & datasetsBlogStandar editorialKoreksi
Alat
Pergi ke AlatDirektori alatDaftar terbaikBandingkan alatCost calculatorPemurni CepatKirim alat
Lowongan
Pergi ke LowonganTelusuri pekerjaan AIPosting pekerjaanMensponsori AIU
Misi
Pergi ke MisiMisiDampak & statistikPenulisHelp centreWhat's newBantuan
Donasi
Rumah/Glosarium/Pembelajaran Penguatan dari Umpan Balik Manusia (RLHF)
Istilah Glosarium AI

Apa itu Pembelajaran Penguatan dari Umpan Balik Manusia (RLHF)?

Definisi

Sebuah metode pelatihan yang menggunakan sinyal preferensi manusia untuk membentuk perilaku model.

Istilah terkait

Pembelajaran Penguatan
Pelatihan dengan imbalan memberi sinyal saat agen mempelajari tindakan yang memaksimalkan keuntungan jangka panjang.
Model Hadiah
Model yang menilai keluaran berdasarkan sinyal preferensi, sering digunakan dalam saluran RLHF.
DPO (Optimasi Preferensi Langsung)
Metode pelatihan yang menyempurnakan model secara langsung pada pasangan preferensi tanpa memerlukan model imbalan terpisah.
Pembelajaran Berkelanjutan
Pendekatan pelatihan yang memungkinkan model terus belajar dari data baru tanpa melupakan pengetahuan sebelumnya.
Pembelajaran Sedikit-Tembakan
Mempelajari atau mengadaptasi perilaku hanya dari sejumlah kecil contoh.
Model Melayang
Penurunan kinerja seiring berjalannya waktu karena kondisi dunia nyata berbeda dari asumsi pelatihan.

Pelajari lebih lanjut di panduan gratis kami

Deep LearningReinforcement LearningMachine Learning BasicsSupervised Learning

See also

RetrievalRed TeamingRecommendation SystemRobustnessRecallSafety FilterRAG (Retrieval-Augmented Generation)Scaling Law
PreviousReinforcement LearningNextRetrieval
Jelajahi Glosarium AI selengkapnyaJelajahi semua panduan AI gratis
Buletin

Sedikit kejelasan. Di kotak masuk Anda.

Berita, alat, pilihan pembelajaran, dan peluang AI paling berguna minggu ini. Sinyal jelas, tidak ada spam.

Tidak ada spam. Berhenti berlangganan dalam satu klik. Kebijakan Privasi

AI Understanding

Pendidikan AI tetap gratis. Sebuah organisasi nirlaba 501(c)(3) yang mengajarkan kepada masyarakat cara kerja AI - dan cara menggunakannya dengan baik.

Baca misi kami↗
Badan amal publik 501(c)(3)

EIN 41-3273048

Belajar

  • Kursus
  • Semua Panduan
  • Apa Itu AI
  • ChatGPT & LLM
  • Prompt Engineering
  • AI Generatif
  • Generator Gambar AI
  • Etika AI
  • Masa Depan AI
  • Glosarium
  • Kuis
  • Sertifikasi

Sumber Daya

  • Berita
  • Blog
  • Buletin
  • Direktori Alat AI
  • Perbandingan
  • Kalkulator Biaya AI
  • Perpustakaan Cepat
  • Dewan Pekerjaan AI
  • Statistik AI
  • Research & datasets
  • Kirim Alat

Organisasi

  • Misi
  • Standar Editorial
  • Koreksi
  • Sponsor
  • Donasi
  • Pusat Bantuan
  • Apa yang Baru
  • Kontak
  • Laporkan Masalah

Hukum

  • Keamanan
  • Kebijakan Privasi
  • Kebijakan Cookie
  • Syarat Penggunaan
  • Pengungkapan
  • Kebijakan Donatur
  • Semua halaman legal
  • Peta Situs

Akun

  • Masuk
  • Daftar
  • Kirim Alat
Mandiri. Membuka. Untuk semua orang.

Jaga agar pendidikan AI tetap gratis dan terbuka

Dukung misi kami

© 2026 AI Understanding. Hak cipta dilindungi undang-undang.

Standar editorialKoreksiPendanaan & pengungkapanHubungi kami