MWONGOZO wa Maombi

Mawakala wa Kutafakari na Kujisahihisha

Reflexion ni mbinu ambapo wakala wa AI huakisi kwa maandishi mapungufu yake mwenyewe na kulisha masomo hayo katika jaribio lake linalofuata.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It matters because it lets agents improve on a task without retraining the underlying model.

Dive ya kina

Reflexion, iliyoletwa katika karatasi ya 2023 na Shinn na wenzake, humpa wakala kitanzi: inajaribu kazi, inapokea ishara kuhusu jinsi ilifanya (matokeo ya mtihani, zawadi, au uhakiki), kisha huandika 'tafakari' fupi ya lugha ya asili inayoelezea nini kilienda vibaya na nini cha kujaribu ijayo. Uakisi huo huhifadhiwa kwenye kumbukumbu na hutanguliwa na dodoso la jaribio linalofuata. Muhimu, uzani wa mfano haubadilika kamwe; kujifunza hufanyika kabisa kwenye dirisha la muktadha kama maandishi. 'Ujifunzaji huu wa uimarishaji wa maneno' huruhusu mawakala kurudia matatizo ya usimbaji, urambazaji wa wavuti, na kazi za kufikiria. Kwenye kipimo cha usimbaji cha HumanEval, kujisahihisha kwa mtindo wa Reflexion kulisukuma viwango vya ufaulu vya juu zaidi kuliko majaribio ya risasi moja, kwa kumruhusu wakala kutatua makosa yake mwenyewe katika majaribio machache.

Ufahamu wa Kiufundi

Reflexion hutenganisha majukumu matatu: Mwigizaji anayezalisha vitendo, Mtathmini anayepata matokeo (majaribio ya vipimo, hundi ya mechi kamili, au jaji wa LLM), na mtindo wa Kujitafakari ambao hubadilisha alama hiyo kuwa somo la maandishi. Somo linatua katika akiba ya kumbukumbu ya matukio iliyotumiwa tena kwenye jaribio linalofuata. Kwa sababu maoni ni lugha badala ya gradient, hakuna mafunzo ya GPU yanayohitajika, lakini inategemea sana mawimbi ya kuaminika ya tathmini ili kuepuka kuimarisha uakisi unaojiamini lakini usio sahihi.

Athari za kimkakati

Tengeneza chaguzi

Muundo wa kiwango cha programu huamua kama AI inaboresha matokeo halisi.

Timu na mtiririko wa kazi

Ujumuishaji mzuri wa mtiririko wa kazi hutengeneza faida za tija ambazo watumiaji wanaweza kuamini.

Risk and safety

Kesi za utumiaji zilizopangwa vizuri hupunguza uchovu wa mabadiliko na hatari ya utekelezaji.

Mustakabali wa Mawakala wa Kutafakari na Kujisahihisha

Kujisahihisha kunakuwa safu chaguo-msingi katika mifumo ya wakala badala ya hila ya utafiti. Tarajia muunganisho mkali zaidi na vithibitishaji kiotomatiki, kama vile visanduku vya misimbo, vikagua rasmi, na urejeshaji ambao unathibitisha ukweli, kwa hivyo uakisi huwekwa katika mawimbi yenye lengo badala ya modeli kujikisia yenyewe. Changamoto zilizo wazi ni kuzuia misururu ambapo wakala 'hurekebisha' matokeo ya kazi bila kikomo, kuamua ni lini ataacha kujirudia, na kuzuia uakisi kuelekezewa katika upatanisho unaokubalika lakini ambao haujathibitishwa.

Utekelezaji wa Ulimwengu Halisi

Wakala wa usimbaji ambaye huendesha majaribio ya kitengo, husoma dai lisilofaulu, huandika dokezo kwenye hitilafu, na kuhariri msimbo wake kabla ya kutekeleza tena safu.

Msaidizi wa utafiti ambaye anapata dondoo la uwongo wakati ukaguzi wa kurejesha umeshindwa, kisha hurekebisha jibu ili kutumia vyanzo vilivyoidhinishwa pekee.

Wakala wa urambazaji wa wavuti (k.m., kwenye alama za AlfWorld au WebShop) anayerekodi 'Nilibofya kichujio kisicho sahihi' na kuepuka hatua hiyo mbaya ya kujaribu tena.

Kisuluhishi cha hesabu ambacho hukagua jibu lake la mwisho dhidi ya kikwazo, huona hitilafu ya ishara, na kurekebisha hatua husika.

Hatari & Walinzi

Kuweka kiotomatiki mchakato uliovunjika kunaweza kukuza shida zilizopo.

Timu zinaweza kufanya otomatiki kupita kiasi na kuondoa uamuzi unaohitajika wa kibinadamu.

Ubora unaweza kuyumba ikiwa matokeo hayatatathminiwa mara kwa mara.

Ramani ya Utekelezaji

1

Ramani ya mtiririko wa kazi wa sasa na utambue hatua ya msuguano wa juu zaidi.

2

Bainisha vituo vya ukaguzi vya binadamu kabla ya otomatiki kamili.

3

Fundisha watumiaji kuhusu maekelezo, njia za kupanda na viwango vya ubora.

4

Fuatilia matokeo ya kiwango cha kazi ili kuthibitisha thamani endelevu.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reflexion and Self-Correcting Agents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Kujitafakari katika Mizunguko ya Wakala

Maswali yanayoulizwa mara kwa mara

What is Reflexion and Self-Correcting Agents?

Reflexion ni mbinu ambapo wakala wa AI huakisi kwa maandishi mapungufu yake mwenyewe na kulisha masomo hayo katika jaribio lake linalofuata. Ni muhimu kwa sababu inawaruhusu mawakala kuboresha kazi bila kufundisha tena muundo wa msingi.

Ni nini sifa bainifu ya jinsi wakala wa Reflexion 'hujifunza'?

Reflexion wakati mwingine huitwa 'kujifunza kwa uimarishaji wa maneno' kwa sababu masomo huhifadhiwa kama maandishi ya lugha asili kwenye kumbukumbu, sio kusimba katika vigezo vya muundo.

Katika mfumo wa Reflexion, Mtathmini hufanya nini?

Mtathimini (jaribio la kitengo, hundi inayolingana kabisa, au mwamuzi wa LLM) hutoa ishara kwamba hatua ya Kujitafakari inageuka kuwa somo la maandishi.

Kwa nini ubora wa ishara ya tathmini ni muhimu sana katika Reflexion?

Ikiwa mtathmini hawezi kutegemewa, wakala anaweza kuandika tafakari za kujiamini kulingana na maoni mabaya, akielekeza majaribio ya siku zijazo katika mwelekeo usio sahihi.

Je, urekebishaji binafsi wa mtindo wa Reflexion uliboresha viwango vya ufaulu vya usimbaji katika kiwango gani?

HumanEval ni kigezo cha kuzalisha msimbo, na kuruhusu wakala kutatua majaribio mengi ilipandisha viwango vya ufaulu zaidi ya utendakazi wa risasi moja.

Ni hatari gani ya kweli iliyo wazi na mawakala wa kujisahihisha?

Bila sheria nzuri ya kusimamisha, wakala anaweza kuendelea kusahihisha majibu sahihi, kupoteza hesabu na wakati mwingine kudhalilisha matokeo mazuri.