Rudi kwa Habari
UbunifuAI Understanding muhtasari

Karatasi inapendekeza ujifunzaji wa ngazi mbili za kuimarisha kwa mawakala wa mazungumzo

ToSCA inapendekeza mfumo wa mafunzo ya uimarishaji wa daraja ambao hutenganisha chaguo za kimkakati kutoka kwa uzalishaji wa majibu ya kiwango cha tokeni. Waandishi wanaripoti kuboreshwa kwa uteuzi wa mkakati na ubora wa majibu dhidi ya misingi kadhaa katika mazungumzo ya kila siku na ya kusaidia kihisia.

5 min readRead the primary source
Primary-source image accompanying Paper proposes two-level reinforcement learning for conversational agents
Hati ya chanzo msingiChanzo kimerekodiwa
Mchapishaji
arxiv.org
Kiungo cha chanzo
arxiv.orghttps://arxiv.org/abs/2608.21969
Aina ya chanzo
Hati ya msingi - tangazo rasmi, karatasi, faili, au ukurasa wa mtu wa kwanza tunasoma moja kwa moja.
MuktadhaElewa hili katika sekunde 60

Anzia hapa

Masharti muhimu

Mafunzo ya Kuimarisha
Mazoezi kwa kutumia ishara za zawadi ambapo wakala hujifunza vitendo vinavyoongeza faida ya muda mrefu.
Kokota
Rasilimali za usindikaji zinazohitajika ili kutoa mafunzo na kuendesha miundo, mara nyingi hupimwa kwa FLOPS au saa za GPU.
Seti ya data
Mkusanyiko wa mifano iliyoundwa au isiyo na muundo inayotumika kwa mafunzo, uthibitishaji au majaribio.
Jijaribu mwenyeweMaswali ya Mawakala wa AI

Nini kilitokea

Karatasi iliyowasilishwa kwa arXiv mnamo Agosti 22 inapendekeza ToSCA, mfumo wa mafunzo ya uimarishaji wa ngazi mbili kwa mawakala wa mazungumzo. Inaweka masharti ya uzalishaji wa majibu ya ishara kwa tokeni kwenye mkakati wa kimaandishi wa kiwango cha utamkaji, unaochanganya upangaji wa hali ya juu na uzalishaji wa lugha wa kiwango cha chini.

Chanzo ni rekodi ya arXiv ya "ToSCA: Kutumia Mafunzo ya Uimarishaji wa Hierarkia juu ya Vifupisho vya Muda na Kimkakati vya Mawakala wa Maongezi," na waandishi wanane. Inasema karatasi hiyo iliwasilishwa mnamo Agosti 22, 2026, na kukubaliwa kwa Matokeo ya EMNLP 2026. Mada ya moja kwa moja ya karatasi ni mafunzo na tathmini ya mawakala wa mazungumzo ya AI, badala ya majadiliano ya jumla ya ujifunzaji wa kuimarisha au mifano ya lugha. Kwa maneno mengine, rekodi inaelezea usanifu na utafiti wa wakala maalum, na uongozi unaunda wazo la kuandaa karatasi.

Mfumo uliopendekezwa unatumia viwango viwili vya muda. Katika kiwango cha juu, wakala huchagua mkakati wa maandishi wazi katika kiwango cha matamshi. Katika kiwango cha chini, wakala huamua tokeni ya majibu kwa tokeni huku akiweka kizazi hicho kwenye mkakati uliochaguliwa. Waandishi huunda muundo huu kama daraja kati ya mbinu za awali za uimarishaji-kujifunza ambazo hutumika tu kwenye ishara na mbinu zinazofanya kazi kwa matamshi kamili pekee. Kwa hivyo tofauti ni kati ya kuchagua mkakati uliokusudiwa wa matamshi na kutambua chaguo hilo kupitia ishara za kibinafsi za jibu.

Karatasi huonyesha kazi kama mchakato wa uamuzi wa ngazi mbili wa Markov. Kulingana na mukhtasari, watafiti hutumia mtandao wa kina wa Q, au DQN, kwa mkosoaji wa hali ya juu na uboreshaji wa sera ya karibu, au PPO, kwa mkosoaji wa kiwango cha chini cha mwigizaji. Chanzo kinaelezea mgawanyiko huu kuwa umechochewa na utohozi wa kinadharia na uzingatiaji wa ufanisi, lakini haitoi maelezo ya utohozi au utekelezaji katika nyenzo iliyotolewa.

Ili kushughulikia zawadi chache, waandishi wanatanguliza utaratibu wa zawadi ya uzito-mbili. Inachanganya alama ya kuridhika ya kiwango cha kutamka na motisha ya asili ya kiwango cha tokeni na adhabu ya K-L. Muhtasari huripoti majaribio kwenye mazungumzo ya kila siku na mazungumzo ya msaada wa kihisia, ambapo ToSCA ilifanya kazi vizuri kuliko seti ya msingi ambayo haijabainishwa katika uamuzi wa mkakati na ubora wa majibu. Chanzo pia kinasema utekelezaji unapatikana, ingawa rekodi iliyotolewa haijumuishi kiungo cha lengwa.

Maelezo ya chanzo: arxiv.org ↗

Kwa nini ni muhimu

Kazi inashughulikia changamoto kuu katika AI ya mazungumzo: kuunganisha malengo mapana ya mwingiliano na maneno ya mtu binafsi ambayo wakala hutoa. Ikithibitishwa zaidi ya majaribio yaliyoripotiwa, utengano huu unaweza kutoa njia iliyopangwa zaidi ya kuwafunza mawakala kwa mazungumzo ya hatua nyingi na kufanya chaguo zao za kimkakati kuwa rahisi kukagua.

Tofauti inayopendekezwa kati ya mkakati na maneno huonyesha tatizo la kiutendaji katika mifumo ya mazungumzo. Jibu linaweza kuwa la ufasaha wakati wa kufuata lengo lisilo sahihi la mwingiliano, au linaweza kuchagua lengo linalofaa lakini lielezee vibaya. Kwa kufanya mkakati kuwa hatua ya kati iliyo wazi, ToSCA inajaribu kutenganisha sehemu hizi mbili za kushindwa wakati wa mafunzo na tathmini.

Muundo huo unaweza kuwa muhimu kwa mifumo inayotarajiwa kuendeleza mazungumzo kwa zamu nyingi. Mkakati wa kiwango cha juu unaweza kuwakilisha lengo la mwingiliano, wakati uzalishaji wa kiwango cha tokeni hushughulikia chaguo za lugha za ndani zinazohitajika ili kuieleza. Chanzo hakitambui kuwa ToSCA hufanya kazi kwa mazungumzo marefu, lakini muundo wa daraja ni muhimu kwa juhudi za kufanya mawakala wa mazungumzo kuwa wa makusudi zaidi na chini ya kutegemea maamuzi ya baadaye ya pekee.

Muundo wa zawadi pia unaweza kuwa muhimu. Kujifunza kwa uimarishaji kwa ajili ya ukuzaji wa lugha kunaweza kupokea maoni tu baada ya jibu kamili, na kufanya iwe vigumu kutambua ni maamuzi gani yaliyosaidia au kuumiza matokeo. Utaratibu wa chembechembe mbili za karatasi hujaribu kutoa maoni katika viwango vya matamshi na tokeni. Muhtasari hauonyeshi ikiwa hii hutoa mafunzo thabiti zaidi, gharama ya chini, au tabia bora chini ya maongozi magumu au ya chuki.

Matokeo yaliyoripotiwa ni ya kutia moyo lakini yana mipaka. Yanahusu majaribio katika mazungumzo ya kila siku na ya kusaidia kihisia na yanawasilishwa na waandishi wa karatasi. Chanzo kilichotolewa hakitoi matokeo ya nambari, vipindi vya kuaminika, ukubwa wa seti ya data, itifaki ya tathmini ya binadamu au urudufishaji huru. Kwa hivyo inasaidia kuripoti mbinu na ulinganisho unaodaiwa na waandishi, lakini si hitimisho pana kwamba mafunzo ya uimarishaji wa tabaka kwa ujumla huboresha AI ya mazungumzo.

Interactive Mechanism

Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli

Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Ukaguzi wa Dhana ya Kuingiliana+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Nini cha kutazama baadaye

Matokeo yanasalia kuwa madai kutoka kwa karatasi moja na yanapaswa kujaribiwa kwa kujitegemea. Mambo muhimu yasiyojulikana ni pamoja na seti kamili za data, misingi, hatua za tathmini, ukubwa wa athari, gharama za hesabu, utendakazi katika lugha na vikoa, na kama faida zinaendelea katika mazungumzo ya ulimwengu halisi au mipangilio inayotii usalama.

Suala la kwanza la kutazama ni reproducibility. Chanzo kinasema kuwa utekelezaji unapatikana, lakini maandishi ya arXiv yaliyotolewa hayatambui hazina au kuelezea leseni yake, tegemezi, data ya mafunzo, au mahitaji ya maunzi. Watafiti wanaojitegemea wangehitaji maelezo hayo ili kubaini kama faida zilizoripotiwa zinaweza kutolewa tena na kama mbinu hiyo ni ya vitendo nje ya usanidi wa waandishi.

Muundo wa tathmini utakuwa muhimu. Majina ya mukhtasari wa mazungumzo ya kila siku na ya kuunga mkono hisia lakini hayatambui mkusanyiko wa data, lugha, idadi ya zamu, idadi ya washiriki au ufafanuzi wa "ubora wa majibu." Pia haisemi jinsi uamuzi wa mkakati ulivyopimwa au kama watathmini walijua ni mfumo gani ulitoa majibu. Mapungufu hayo yanaacha wazi uwezekano kwamba utendakazi unatofautiana kwa kiasi kikubwa kulingana na kazi, kikoa, au mbinu ya tathmini.

Usalama na kutegemewa vinastahili kuchunguzwa mahususi katika mipangilio ya usaidizi wa kihisia. Mkakati unaoboresha alama za kuridhika huenda usiboresha usahihi wa ukweli, kushughulikia majanga, ulinzi wa faragha, au upanuzi ufaao kwa usaidizi wa kibinadamu. Chanzo hakitoi madai ya usalama na hakiripoti majaribio yoyote ya maombi hatari, watumiaji walio katika mazingira magumu, mabadiliko ya usambazaji, au mapungufu yanayosababishwa na mkakati usio sahihi wa kiwango cha juu.

Kazi zaidi inapaswa kupima ikiwa safu ya mkakati iliyo wazi inaboresha usimamizi na utendakazi. Ushahidi muhimu utajumuisha uondoaji wa DQN, PPO, vipengele vya malipo, na adhabu ya K-L; kulinganisha na mifumo yenye nguvu ya kisasa; vipimo vya latency na ; na tathmini za mazungumzo marefu, ya lugha nyingi na ya ulimwengu halisi. Hadi uthibitisho kama huo upatikane, ToSCA inaeleweka vyema kama pendekezo la utafiti na mafanikio ya majaribio yaliyoripotiwa, si mafanikio ya uzalishaji yaliyoonyeshwa.

Miongozo & maswali yanayohusiana

Mawakala wa AIMifano ya AI ImefafanuliwaMafunzo ya AIPrompt EngineeringJaribu unachojua - jaribu maswali ya AI bila malipoTafuta istilahi ya AI katika faharasa yetuFuata kifuatiliaji cha toleo la muundo wa AI
Je, umepata hii kuwa muhimu?