Urekebishaji wa Maelekezo
Urekebishaji wa maagizo ni hatua ya mafunzo ambayo hugeuza kitabiri-maandishi ghafi kuwa kielelezo ambacho hakika hufuata maagizo kama vile 'fanya muhtasari wa hili' au 'andika jibu la heshima.' Ni nini hufanya mfano wa msingi uhisi msaada na uelekevu.
Dive ya kina
Muundo wa lugha ya msingi umefunzwa tu kutabiri tokeni inayofuata kwenye maandishi ya wavuti, kwa hivyo ukiandika swali linaweza kuendelea na maswali zaidi badala ya kujibu. Urekebishaji wa maagizo hurekebisha hii. Ni aina ya urekebishaji mzuri unaosimamiwa: modeli hiyo inafunzwa kwa jozi nyingi za (maagizo, majibu bora) inayoshughulikia maelfu ya kazi - tafsiri, muhtasari, uainishaji, Maswali na Majibu, usimbaji, na zaidi. Kwa kuona muundo sawa wa kujibu-kisha-ufaafu mara kwa mara, modeli hujifunza tabia ya jumla ya 'fanya kile mtumiaji anauliza,' na hii inajumlisha maagizo ambayo haijawahi kuona katika mafunzo. Mbinu hii ilianzishwa mwaka wa 2021 na kazi kama vile FLAN, T0, na Maagizo ya Asili, na ilikuwa msingi wa OpenAI InstructGPT, ambayo iliboresha GPT-3 kwenye seti iliyoratibiwa ya maagizo. Ndio msingi wasaidizi wengi wa gumzo hujengwa juu yake.
Ufahamu wa Kiufundi
Kiutaratibu, upangaji wa maagizo ni ujifunzaji unaosimamiwa wa kawaida: punguza tofauti kati ya tokeni zilizotabiriwa za modeli na jibu la marejeleo, huku gradient zikisasisha uzani. Ni tofauti na RLHF (mafunzo ya kuimarisha kutoka kwa maoni ya binadamu), ambayo huja baada ya na kuboresha mapendeleo ya binadamu kwa kutumia modeli ya zawadi. Kichocheo cha kawaida huwekwa katika safu: mafunzo ya awali, kisha tune maelekezo (SFT) kufundisha kufuata kazi, kisha kwa hiari RLHF kuboresha sauti, usaidizi na usalama. Uanuwai wa data ni muhimu zaidi kuliko ujazo tu - ushughulikiaji mpana wa kazi huchochea ujanibishaji.
Athari za kimkakati
Kasi na kiwango
Mitiririko ya kazi ya lugha inaweza kusonga kwa kasi zaidi bila kuacha uthabiti.
Kufikia na kufikia
Inapanua ufikiaji katika lugha na mitindo ya mawasiliano.
Maamuzi ya wazi zaidi
Timu zinaweza kutumia muda mwingi kufanya uamuzi huku otomatiki ikishughulikia marudio.
Mustakabali wa Kuandaa Maelekezo
Uga unahama kutoka seti kubwa za data zilizoandikwa kwa mkono kuelekea data ya ubora wa juu, ambayo kwa kiasi fulani imeundwa - wakati mwingine maelfu ya mifano iliyochaguliwa kwa uangalifu - baada ya ugunduzi kwamba ubora wa data unaweza kushinda wingi. Tarajia upangaji wa maelekezo zaidi ya kikoa (matibabu, sheria, usimbaji), seti za maelekezo ya lugha nyingi na moduli nyingi, na mabomba ya kiotomatiki ambayo hutoa na kuchuja data ya maagizo. Urekebishaji wa maagizo utasalia kuwa daraja muhimu kati ya muundo mbichi uliofunzwa mapema na msaidizi inayoweza kutumika, ikijumuishwa na uboreshaji wa mapendeleo kwa upangaji.
Utekelezaji wa Ulimwengu Halisi
Kubadilisha muundo msingi wa mtindo wa GPT kuwa msaidizi wa gumzo ambao hujibu maswali badala ya kuyajibu
FLAN-T5, iliyosawazishwa katika kazi nyingi ili iweze kufuata maagizo ambayo haikufunzwa kwa uwazi.
InstructGPT, ambapo GPT-3 iliratibiwa kwa maagizo yaliyoratibiwa ili kutoa majibu muhimu zaidi.
Kujenga msaidizi wa kampuni ya ndani kwa kurekebisha vyema jozi za majibu-maelekezo zilizoandikwa na usaidizi na timu za kisheria
Hatari & Walinzi
Mambo ya ukweli yanaweza kuingiza ripoti kwa utulivu, mitiririko ya usaidizi, au matokeo ya utafiti.
Usikivu wa haraka unaweza kuunda matokeo yasiyolingana katika maombi sawa.
Data nyeti ya maandishi inaweza kufichuliwa ikiwa vidhibiti vya ufikiaji ni dhaifu.
Ramani ya Utekelezaji
Bainisha umbizo la towe, toni na viwango vya ubora kabla ya kusambaza.
Majibu ya msingi na vyanzo vinavyoaminika wakati wowote usahihi ni muhimu.
Weka ukaguzi wa ukaguzi wa kibinadamu kwa matokeo ya juu.
Fuatilia mifumo ya kushindwa na fundisha tena vidokezo au mtiririko wa kazi mara kwa mara.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Instruction Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Kurekebisha kiambishi awali
Maswali yanayoulizwa mara kwa mara
What is Instruction Tuning?
Urekebishaji wa maagizo ni hatua ya mafunzo ambayo hugeuza kitabiri-maandishi ghafi kuwa kielelezo ambacho hakika hufuata maagizo kama vile 'fanya muhtasari wa hili' au 'andika jibu la heshima.' Ni nini hufanya mfano wa msingi uhisi msaada na uelekevu.
Upangaji wa maagizo unatofautianaje na RLHF?
Urekebishaji wa maagizo ni ujifunzaji unaosimamiwa juu ya majibu lengwa. RLHF inakuja baadaye na kuboresha kielelezo dhidi ya mapendeleo ya mwanadamu yaliyojifunza.
Je, ni sifa gani ya data ya urekebishaji wa maagizo huchochea zaidi uwezo wa modeli wa kufuata maagizo mapya, yasiyoonekana?
Kushughulikia aina nyingi za kazi hufundisha tabia ya jumla ya kufuata maagizo, ambayo yanajumuisha maagizo ambayo hayajawahi kuonekana katika mafunzo.
Je, ni mpangilio upi wa kawaida wa hatua za mafunzo kwa msaidizi wa kisasa wa gumzo?
Miundo hufundishwa kwanza kwenye maandishi ghafi, kisha maagizo-hupangwa ili kufuata kazi, na mara nyingi huboreshwa kwa RLHF kwa sauti na usalama.