Lewati ke konten
Belajar
Berita
Alat
Lowongan
Misi
Cari
⌘K
English
Donasi
Tidak bisa
×
Mulai di sini
Mulailah belajar
Belajar
Pergi ke Belajar
Kursus
Panduan
Tutor AI
Prompt library
Kuis
Sertifikat
Glosarium
Berita
Pergi ke Berita
Berita AI terbaru
Pelacak topik
Research & datasets
Blog
Standar editorial
Koreksi
Alat
Pergi ke Alat
Direktori alat
Daftar terbaik
Bandingkan alat
Cost calculator
Pemurni Cepat
Kirim alat
Lowongan
Pergi ke Lowongan
Telusuri pekerjaan AI
Posting pekerjaan
Mensponsori AIU
Misi
Pergi ke Misi
Misi
Dampak & statistik
Penulis
Help centre
What's new
Bantuan
Donasi
Rumah
/
Glosarium
/
Model Hadiah
Istilah Glosarium AI
Apa itu
Model Hadiah
?
Definisi
Model yang menilai keluaran berdasarkan sinyal preferensi, sering digunakan dalam saluran RLHF.
Istilah terkait
Pembelajaran Penguatan dari Umpan Balik Manusia (RLHF)
Sebuah metode pelatihan yang menggunakan sinyal preferensi manusia untuk membentuk perilaku model.
Pembelajaran Penguatan
Pelatihan dengan imbalan memberi sinyal saat agen mempelajari tindakan yang memaksimalkan keuntungan jangka panjang.
Kebenaran Dasar
Label referensi tepercaya yang digunakan untuk melatih atau mengevaluasi keluaran model.
DPO (Optimasi Preferensi Langsung)
Metode pelatihan yang menyempurnakan model secara langsung pada pasangan preferensi tanpa memerlukan model imbalan terpisah.
Pertengahan pelatihan
Fase pelatihan perantara antara pra-pelatihan dan pasca-pelatihan, sering kali digunakan untuk penyesuaian kemampuan atau domain.
Agen AI
Sebuah sistem perangkat lunak yang dapat mengamati, menalar, dan mengambil tindakan untuk mencapai suatu tujuan, sering kali menggunakan alat dan memori.
Pelajari lebih lanjut di panduan gratis kami
AI Models Explained
Model Collapse
Model Lifecycle
Model Context Protocol
See also
Retrieval
Robustness
Safety Filter
Scaling Law
Red Teaming
Semantic Search
Recommendation System
Self-Supervised Learning
Previous
Retrieval
Next
Robustness
Jelajahi Glosarium AI selengkapnya
Jelajahi semua panduan AI gratis