Mawakala wa Kutafakari na Kujisahihisha
Reflexion ni mbinu ambapo wakala wa AI huakisi kwa maandishi mapungufu yake mwenyewe na kulisha masomo hayo katika jaribio lake linalofuata.
Muhtasari
It matters because it lets agents improve on a task without retraining the underlying model.
Dive ya kina
Reflexion, iliyoletwa katika karatasi ya 2023 na Shinn na wenzake, humpa wakala kitanzi: inajaribu kazi, inapokea ishara kuhusu jinsi ilifanya (matokeo ya mtihani, zawadi, au uhakiki), kisha huandika 'tafakari' fupi ya lugha ya asili inayoelezea nini kilienda vibaya na nini cha kujaribu ijayo. Uakisi huo huhifadhiwa kwenye kumbukumbu na hutanguliwa na dodoso la jaribio linalofuata. Muhimu, uzani wa mfano haubadilika kamwe; kujifunza hufanyika kabisa kwenye dirisha la muktadha kama maandishi. 'Ujifunzaji huu wa uimarishaji wa maneno' huruhusu mawakala kurudia matatizo ya usimbaji, urambazaji wa wavuti, na kazi za kufikiria. Kwenye kipimo cha usimbaji cha HumanEval, kujisahihisha kwa mtindo wa Reflexion kulisukuma viwango vya ufaulu vya juu zaidi kuliko majaribio ya risasi moja, kwa kumruhusu wakala kutatua makosa yake mwenyewe katika majaribio machache.
Ufahamu wa Kiufundi
Reflexion hutenganisha majukumu matatu: Mwigizaji anayezalisha vitendo, Mtathmini anayepata matokeo (majaribio ya vipimo, hundi ya mechi kamili, au jaji wa LLM), na mtindo wa Kujitafakari ambao hubadilisha alama hiyo kuwa somo la maandishi. Somo linatua katika akiba ya kumbukumbu ya matukio iliyotumiwa tena kwenye jaribio linalofuata. Kwa sababu maoni ni lugha badala ya gradient, hakuna mafunzo ya GPU yanayohitajika, lakini inategemea sana mawimbi ya kuaminika ya tathmini ili kuepuka kuimarisha uakisi unaojiamini lakini usio sahihi.
Athari za kimkakati
Tengeneza chaguzi
Muundo wa kiwango cha programu huamua kama AI inaboresha matokeo halisi.
Timu na mtiririko wa kazi
Ujumuishaji mzuri wa mtiririko wa kazi hutengeneza faida za tija ambazo watumiaji wanaweza kuamini.
Risk and safety
Kesi za utumiaji zilizopangwa vizuri hupunguza uchovu wa mabadiliko na hatari ya utekelezaji.
Mustakabali wa Mawakala wa Kutafakari na Kujisahihisha
Kujisahihisha kunakuwa safu chaguo-msingi katika mifumo ya wakala badala ya hila ya utafiti. Tarajia muunganisho mkali zaidi na vithibitishaji kiotomatiki, kama vile visanduku vya misimbo, vikagua rasmi, na urejeshaji ambao unathibitisha ukweli, kwa hivyo uakisi huwekwa katika mawimbi yenye lengo badala ya modeli kujikisia yenyewe. Changamoto zilizo wazi ni kuzuia misururu ambapo wakala 'hurekebisha' matokeo ya kazi bila kikomo, kuamua ni lini ataacha kujirudia, na kuzuia uakisi kuelekezewa katika upatanisho unaokubalika lakini ambao haujathibitishwa.
Utekelezaji wa Ulimwengu Halisi
Wakala wa usimbaji ambaye huendesha majaribio ya kitengo, husoma dai lisilofaulu, huandika dokezo kwenye hitilafu, na kuhariri msimbo wake kabla ya kutekeleza tena safu.
Msaidizi wa utafiti ambaye anapata dondoo la uwongo wakati ukaguzi wa kurejesha umeshindwa, kisha hurekebisha jibu ili kutumia vyanzo vilivyoidhinishwa pekee.
Wakala wa urambazaji wa wavuti (k.m., kwenye alama za AlfWorld au WebShop) anayerekodi 'Nilibofya kichujio kisicho sahihi' na kuepuka hatua hiyo mbaya ya kujaribu tena.
Kisuluhishi cha hesabu ambacho hukagua jibu lake la mwisho dhidi ya kikwazo, huona hitilafu ya ishara, na kurekebisha hatua husika.
Hatari & Walinzi
Kuweka kiotomatiki mchakato uliovunjika kunaweza kukuza shida zilizopo.
Timu zinaweza kufanya otomatiki kupita kiasi na kuondoa uamuzi unaohitajika wa kibinadamu.
Ubora unaweza kuyumba ikiwa matokeo hayatatathminiwa mara kwa mara.
Ramani ya Utekelezaji
Ramani ya mtiririko wa kazi wa sasa na utambue hatua ya msuguano wa juu zaidi.
Bainisha vituo vya ukaguzi vya binadamu kabla ya otomatiki kamili.
Fundisha watumiaji kuhusu maekelezo, njia za kupanda na viwango vya ubora.
Fuatilia matokeo ya kiwango cha kazi ili kuthibitisha thamani endelevu.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reflexion and Self-Correcting Agents quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Kujitafakari katika Mizunguko ya Wakala
Maswali yanayoulizwa mara kwa mara
What is Reflexion and Self-Correcting Agents?
Reflexion ni mbinu ambapo wakala wa AI huakisi kwa maandishi mapungufu yake mwenyewe na kulisha masomo hayo katika jaribio lake linalofuata. Ni muhimu kwa sababu inawaruhusu mawakala kuboresha kazi bila kufundisha tena muundo wa msingi.
Ni nini sifa bainifu ya jinsi wakala wa Reflexion 'hujifunza'?
Reflexion wakati mwingine huitwa 'kujifunza kwa uimarishaji wa maneno' kwa sababu masomo huhifadhiwa kama maandishi ya lugha asili kwenye kumbukumbu, sio kusimba katika vigezo vya muundo.
Katika mfumo wa Reflexion, Mtathmini hufanya nini?
Mtathimini (jaribio la kitengo, hundi inayolingana kabisa, au mwamuzi wa LLM) hutoa ishara kwamba hatua ya Kujitafakari inageuka kuwa somo la maandishi.
Kwa nini ubora wa ishara ya tathmini ni muhimu sana katika Reflexion?
Ikiwa mtathmini hawezi kutegemewa, wakala anaweza kuandika tafakari za kujiamini kulingana na maoni mabaya, akielekeza majaribio ya siku zijazo katika mwelekeo usio sahihi.
Je, urekebishaji binafsi wa mtindo wa Reflexion uliboresha viwango vya ufaulu vya usimbaji katika kiwango gani?
HumanEval ni kigezo cha kuzalisha msimbo, na kuruhusu wakala kutatua majaribio mengi ilipandisha viwango vya ufaulu zaidi ya utendakazi wa risasi moja.
Ni hatari gani ya kweli iliyo wazi na mawakala wa kujisahihisha?
Bila sheria nzuri ya kusimamisha, wakala anaweza kuendelea kusahihisha majibu sahihi, kupoteza hesabu na wakati mwingine kudhalilisha matokeo mazuri.