Tsallake zuwa abun ciki
Koyi
Labarai
Kayan aiki
Ayyuka
Manufa
Bincika
⌘K
English
Ba da gudummawa
Menu
Fara a nan
Fara koyo
Koyi
Je zuwa Koyi
Darussa
Jagorori
Malamin AI
Laburaren gaggawa
Gwaje-gwaje
Shaida
Ƙamus
Labarai
Je zuwa Labarai
Sabbin labarai na AI
Masoyan magana
Bincike & bayanan bayanai
Blog
Ka'idojin edita
Gyara
Kayan aiki
Je zuwa Kayan aiki
Kundin kayan aiki
Mafi kyawun jeri
Kwatanta kayan aiki
Kalkuleta mai tsada
Mai Refiner mai sauri
Aika kayan aikin AI
Ayyuka
Je zuwa Ayyuka
Nemo ayyukan AI
Buga aiki
Mai tallafawa AIU
Manufa
Je zuwa Manufa
Manufa
Tasiri & ƙididdiga
Marubuta
Cibiyar taimako
Menene sabo
Taimako
Ba da gudummawa
Gida
/
Ƙamus na kalmomi
/
Ƙarfafa Koyo daga Sauraron Dan Adam (RLHF)
Kamus na AI
Menene
Ƙarfafa Koyo daga Sauraron Dan Adam (RLHF)
?
Ma'anarsa
Hanyar horon da ke amfani da sigina na zaɓin ɗan adam don tsara halayen samfuri.
Sharuɗɗa masu alaƙa
Ƙarfafa Koyo
Horowa ta siginar lada inda wakili ke koyon ayyuka waɗanda ke haɓaka dawowa na dogon lokaci.
Samfurin Kyauta
Samfurin da ke ba da ƙima bisa ga siginar fifiko, galibi ana amfani da shi a cikin bututun RLHF.
DPO (Haɓaka fifiko kai tsaye)
Hanyar horarwa wacce ke daidaita ƙira kai tsaye akan nau'ikan zaɓin zaɓi ba tare da buƙatar samfurin lada daban ba.
Ci gaba da Koyo
Hanyoyi na horarwa waɗanda ke barin abin ƙira ya ci gaba da koyo daga sababbin bayanai ba tare da manta da ilimin farko ba.
Koyo Kadan-Shot
Koyo ko daidaita ɗabi'a daga ƙaramin adadin misalai.
Model Drift
Lalacewar ayyuka a kan lokaci yayin da yanayin duniya na ainihi ya bambanta daga tunanin horo.
Ƙara koyo a cikin jagororinmu na kyauta
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
Duba kuma
Retrieval
Red Teaming
Recommendation System
Robustness
Recall
Safety Filter
RAG (Retrieval-Augmented Generation)
Scaling Law
Previous
Reinforcement Learning
Next
Retrieval
Nemo cikakken AI ƙamus
Bincika duk jagororin AI kyauta