Treci la conținut
ÎnvațăȘtiriUnelteJoburiMisiune
Donează
Începeți de aiciÎncepeți să învățați
Învață
Du-te la ÎnvațăCursuriGhiduriTutore AIBiblioteca promptăQuizuriCertificatGlosar
Știri
Du-te la ȘtiriCele mai recente știri despre AITrackere de subiecteCercetare și seturi de dateBlogStandarde editorialeCorectări
Unelte
Du-te la UnelteDirectorul de instrumenteCele mai bune listeComparați instrumenteleCalculator de costuriRafinator promptTrimite unealtă
Joburi
Du-te la JoburiRăsfoiți joburi AIPostează un loc de muncăSponsoreaza AIU
Misiune
Du-te la MisiuneMisiuneImpact și statisticiAutoriiHelp centerCe este nouSuport
Donează
Acasă/Glosar/Învățare prin consolidare din feedbackul uman (RLHF)
Termen de glosar AI

Ce este Învățare prin consolidare din feedbackul uman (RLHF)?

Definiție

O metodă de antrenament care utilizează semnale de preferințe umane pentru a modela comportamentul modelului.

Termeni înrudiți

Învățare prin întărire
Antrenamentul prin recompensă semnalează în cazul în care un agent învață acțiuni care maximizează rentabilitatea pe termen lung.
Model de recompensă
Un model care punctează ieșirile pe baza semnalelor de preferință, adesea folosit în conductele RLHF.
DPO (Optimizare directă a preferințelor)
O metodă de antrenament care ajustează modelele direct pe perechile de preferințe, fără a avea nevoie de un model de recompensă separat.
Învățare continuă
Abordări de formare care permit unui model să continue să învețe din date noi, fără a uita cunoștințele anterioare.
Învățare cu câteva lovituri
Învățarea sau adaptarea comportamentului dintr-un număr mic de exemple.
Model Drift
Degradarea performanței în timp, deoarece condițiile din lumea reală diferă de ipotezele de antrenament.

Aflați mai multe în ghidurile noastre gratuite

Deep LearningReinforcement LearningMachine Learning BasicsSupervised Learning

Vezi și

RetrievalRed TeamingRecommendation SystemRobustnessRecallSafety FilterRAG (Retrieval-Augmented Generation)Scaling Law
PreviousReinforcement LearningNextRetrieval
Răsfoiți întregul glosar AIExplorați toate ghidurile AI gratuite

Educație AI gratuită. Pentru toată lumea, peste tot.

Educația AI păstrată gratuit. O organizație nonprofit 501(c)(3) care învață publicul cum funcționează de fapt AI - și cum să o folosească bine.

Începeți să învățați gratuitSusține misiunea
Puțină claritate. În căsuța dvs. de e-mail.

Fără spam. Dezabonați-vă cu un singur clic.Politica de confidențialitate

Învață

  • Cursuri
  • Toate ghidurile
  • Ce este IA
  • ChatGPT și LLM
  • Prompt Engineering
  • IA generativă
  • Imagini cu IA
  • Etica IA
  • Viitorul IA
  • Glosar
  • Quizuri
  • Certificare

Resurse

  • Știri
  • Blog
  • Newsletter
  • Director de instrumente IA
  • Comparații
  • Calculator de cost AI
  • Biblioteca promptă
  • Panoul de joburi AI
  • Statistici despre IA
  • Cercetare și seturi de date
  • Trimite un instrument

Organizație

  • Misiune
  • Standarde editoriale
  • Corectări
  • Devino sponsor
  • Donează
  • Centrul de ajutor
  • Ce este nou
  • Contact
  • Raportează o problemă

Juridic

  • Securitate
  • Politica de confidențialitate
  • Politica de cookie-uri
  • Termeni de utilizare
  • Transparență
  • Politica donatorilor
  • Toate paginile legale
  • Harta site-ului

Cont

  • Conectare
  • Creează cont
  • Trimite un instrument
  • Starea serviciilororganizație caritabilă publică 501(c)(3)Donațiile sunt deductibile fiscal în S.U.A. în măsura permisă de lege.
  • EIN41-3273048Numărul de identificare a angajatorului IRS.
  • AccesAcces deschisFără reclame și fără paywall pentru învățarea de bază.
  • Contact[email protected]Întrebări, corecții și presă.

© 2026 AI Understanding. Toate drepturile rezervate.

Standarde editorialeCorectăriFinanțare și transparențăContactează-ne