Ntụziaka nka

Nkwalite mmụta site na nzaghachi mmadụ

RLHF bụ usoro na-atụgharị ụdị asụsụ amịpụtara ka ọ bụrụ onye enyemaka na nkwanye ùgwù site n'ịzụ ya na mmasị mmadụ.

2 nkeji na-agụEmelitere ikpeazụ

Nchịkọta

It matters because it aligns model behavior with what people actually want, not just what is statistically likely.

Ime miri emi

Ụdị asụsụ a zụrụ azụ na-ebu amụma ederede ziri ezi, mana ihe ezi uche dị na ya abụghị otu ihe enyemaka, eziokwu, ma ọ bụ nchekwa. RLHF na-edozi nke a na nkebi. Nke mbụ, nlegharị anya nke ọma na-akuziri ihe nlereanya ịgbaso ntuziaka site n'iji azịza ihe atụ nke mmadụ dere. Na-esote, ụmụ mmadụ na-atụnyere ụzọ abụọ nke nzaghachi nlereanya na otu ngwa ngwa wee họrọ nke ka mma; ntụnyere ndị a na-azụ ụdị ụgwọ ọrụ dị iche iche nke na-enweta nzaghachi ọ bụla. N'ikpeazụ, a na-akwalite ụdị asụsụ site na mmụta nkwado iji wepụta nzaghachi nke ụdị ụgwọ ọrụ dị oke ọnụ. Ntaramahụhụ na-eme ka ọ ghara ịkpafu tere aka site na ụdị nke mbụ ka ọ na-aga nke ọma ma ghara iji ụdị ụgwọ ọrụ ahụ eme ihe. RLHF bụ isi n'ime ka ndị enyemaka ụdị ChatGPT nwere ike iji ya.

Nghọta nka nka

A na-azụkarị ụdị ụgwọ ọrụ na ụzọ abụọ mmasị nwere mfu ụdị Bradley-Terry, mụta inye azịza mmadụ masịrị ya akara dị elu. A na-emelite amụma ahụ na PPO (Proximal Policy Optimization), nke na-ebuli ụgwọ ọrụ ebe ntaramahụhụ KL-iche megide ụdị ntụnye aka na-egbochi ịkwalite oke na 'ịkwụ ụgwọ ụgwọ ọrụ'. N'ihi na PPO nwere ntụkwasị obi, ụzọ ọhụrụ dị ka DPO (Nkachamma Mmasị nkeonwe) na-amafe ụdị ụgwọ ọrụ doro anya yana mgbake nkwado, na-ebuli amụma ahụ ozugbo site na ụzọ abụọ mmasị.

Mmetụta atụmatụ

Ọnụ ego na mmefu ego

Mkpebi ihe owuwu ụlọ na-akwalite arụmọrụ yana ọnụ ahịa ọrụ ruo ọtụtụ afọ.

Mkpebi doro anya

Nkà mmụta nka na-enyere ndị otu egwuregwu aka ịhọrọ nchịkọta ziri ezi, ọ bụghị naanị nke kachasị ọhụrụ.

Quality akara

Nhọrọ injinia ka mma na-ebelata ihe omume ntụkwasị obi na mmepụta.

Ọdịnihu nke mmụta nkwado sitere na nzaghachi mmadụ

A na-emegharị RLHF yana akpaghị aka. DPO na ụzọ mmasị ozugbo na-edochi ọkpọkọ PPO dị arọ maka ọtụtụ otu, RLAIF na-ejikwa nzaghachi AI sitere na (dị ka ọ dị na AI Constitutional AI) iji belata ọnụ ahịa aha aha. Nchọpụta na-agbakọ mgbaba n'ịkwụ ụgwọ nkwụghachi ụgwọ, nhụsianya onye nkọwa, yana ihe isi ike nke ikpe azịza ogologo oge ma ọ bụ ọkachamara, yana usoro dị ka nlekọta usoro na arụmụka. Na-atụ anya itinye n'otu n'otu iji jikọta nzaghachi mmadụ na AI, nrịbama ụgwọ ọrụ bara ụba karịa otu mkpịsị aka elu, yana nyocha na-eto eto nke onye na-enye mmasị na ụkpụrụ ha na-etinye.

Mmejuputa n'ezie n'ụwa

Ịtụgharị onye enyemaka nkata ka ọ jụrụ arịrịọ ndị na-emerụ ahụ ma na-enye azịza na-enyere aka, ahaziri nke ọma karịa naanị ederede ziri ezi.

Ịnye nchịkọta ụzọ abụọ site na mmasị mmadụ ịzụ ihe nlereanya na-ede nchịkọta ndị mmadụ na-ahụ na ọ bara uru.

Mbelata nsipụta na-egbu egbu ma ọ bụ nke na-adịghị mma site na nzaghachi na-akwụghachi ụgwọ nke ndị na-ahụ maka mmadụ na-ekpebi na ọ bụ nkwanye ùgwù na nchekwa.

Iji DPO na dataset nke ọkacha mmasị vs. azịza jụrụ iji kwado ihe nlereanya mepere emepe na-enweghị ịgba ọsọ PPO zuru ezu.

Ihe ize ndụ & okporo ụzọ nche

Ịkwalite otu akara ngosi nwere ike zoo adịghị ike sistemụ sara mbara.

A na-eledakarị ihe akụrụngwa na ụgwọ ọrụ anya.

Ọdịiche nchekwa na nleba anya nwere ike itolite ka sistemu na-adịwanye mgbagwoju anya.

Map mmejuputa

1

Kọwaa latency, ịdịmma na ebumnuche ọnụ ahịa tupu mmejuputa ya.

2

Benchmark n'okpuru ibu dị adị na ọnọdụ data.

3

Nleba anya akụrụngwa maka mperi, ịkpafu na mmetụta onye ọrụ.

4

Kwadebe ụzọ nzaghachi azụghachi azụ na ihe omume tupu ịchachaa.

Nọgide na-eme nchọpụta

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reinforcement Learning From Human Feedback quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Malite ajụjụ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ajụjụ a na-ajụkarị

What is Reinforcement Learning From Human Feedback?

RLHF bụ usoro na-atụgharị ụdị asụsụ amịpụtara ka ọ bụrụ onye enyemaka na nkwanye ùgwù site n'ịzụ ya na mmasị mmadụ. Ọ dị mkpa n'ihi na ọ na-ejikọta omume nlereanya na ihe ndị mmadụ chọrọ n'ezie, ọ bụghị naanị ihe nwere ike ịbụ na ọnụ ọgụgụ.

Gịnị bụ isi ebumnuche nke RLHF maka ụdị asụsụ?

RLHF na-eduzi ihe nlere anya maka nzaghachi ụmụ mmadụ masịrị ya, na-eme ka ọ na-enye aka karịa, eziokwu, na nchekwa karịa naanị ihe ezi uche dị na ya.

Kedu ihe nlereanya ụgwọ ọrụ na RLHF na-amụta n'ezie ime?

A zụrụ ụdị ụgwọ ọrụ na ntụnyere mmasị mmadụ iji nweta akara nzaghachi, na-enye mgbama amụma na-ebuli megide.

Kedu ihe kpatara ntaramahụhụ KL-divergence megide ụdị mbụ ejiri n'oge nzọụkwụ RL?

Ntaramahụhụ KL na-edobe amụma kachasị mma n'akụkụ ihe nrụtụ aka, na-eche nche megide mbanye ụgwọ ọrụ na mfu nke ịsụ ụzọ.

Kedu ka esi achịkọta data mmasị maka ụdị ụgwọ ọrụ?

Ndị na-akọwa nkọwa na-ahọrọ nzaghachi kachasị mma na ntụnyere ụzọ abụọ, nke na-azụ ụdị ụgwọ ọrụ site na mfu ụdị Bradley-Terry.

Kedu uru DPO (Nkachamma Mmasị ozugbo) na-enye karịa pipeline RLHF kpochapụwo?

DPO na-enweta ebumnobi ya kpọmkwem site na mmasị, na-ezere ụdị ụgwọ ọrụ dị iche na usoro mmụta nkwado siri ike.