Műszaki ÚTMUTATÓ

Önreflexió az ügynökhurkokban

Az önreflexió lehetővé teszi az AI-ügynök számára, hogy a feladat közben bírálja saját kimeneteit és tevékenységeit, majd a kritika alapján felülvizsgálja.

2 perc olvasásUtoljára frissítve

Áttekintés

It turns a one-shot guesser into a system that catches and fixes its own mistakes.

Mély merülés

Az ügynökhurokban a nyelvi modell műveleteket hajt végre (eszközök hívása, kód írása, válaszadás), megfigyeli az eredményeket, és eldönti, hogy mi legyen a következő lépés. Az önreflexió egy szándékos lépést ad hozzá, ahol a modell értékeli legutóbbi munkáját, mielőtt folytatná. Az olyan keretrendszerek, mint a Reflexion (2023), ezt konkretizálják: egy sikertelen próbálkozás után az ügynök ír egy rövid verbális kritikát ("Elfelejtettem kezelni az üres listás esetet"), és eltárolja a memóriájában, így a következő kísérlet feltétele ez a lecke. Az Self-Refine ugyanazt a modellt használja a visszajelzés generálására, majd a válasz iteratív újraírására. A tükröződés származhat a kimenet és a cél összehasonlításából, a hibaüzenetek ellenőrzéséből vagy a tesztek futtatásából. A kifizetődő a nagyobb megbízhatóság a többlépcsős feladatoknál, mint például a kódolás, a webes navigáció és a matematika, ahol az egyetlen lépés gyakran sikertelen, de a kritika és újrapróbálkozás ciklus sikeres.

Technikai betekintés

A reflexiót általában extra felszólításként hajtják végre: a modellt arra kérik, hogy kritikusként lépjen fel saját cselekedeteinek átirata felett, természetes nyelvű visszajelzést hozva létre, amelyet azután a következő kísérlethez hozzáfűznek a kontextushoz. A Reflexion ezeket a kritikákat egy epizodikus memóriapufferben tárolja a kísérletek során, nem pedig a súlyok finomhangolását, így a tanulás teljesen kontextusban történik. A jel visszaverődése lehet külső (teszt sikeres/sikertelen, szerszámhibák) vagy saját generált, és a külső jelek általában sokkal megbízhatóbbak.

Stratégiai hatás

Költség és költségvetés

Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.

Tisztább döntések

A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.

Minőségellenőrzés

A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.

Az önreflexió jövője az ügynökhurkokban

Arra számíthat, hogy a tükrözés egy beépített ügynökprimitív, nem pedig felszólító trükk lesz, mivel a modelleket arra tanítják, hogy tudják, mikor éri meg a tükrözés az extra tokeneket, és mikor égeti el a számítást. Az ellenőrző modellek és a végrehajtási visszajelzések egyre inkább megalapozzák az önkritikát, így az ügynökök nem hallucinálják, hogy a rossz válaszok helyesek. A kutatás a meghibásodási módot is megcélozza, ahol a modellek magabiztosan állítják a rossz munkát, a kalibrált, bizonyítékokon alapuló reflexió és a hurok tanult megállítási kritériumai felé törekszenek.

Valós megvalósítás

A kódoló ügynök hibás egységtesztet futtat, beolvassa a visszakövetést, ír egy tükrözést, amely megjegyzi az off-by-one hibát, és átírja a függvényt a következő ciklus iterációjában.

A rossz linkre kattintó webböngésző ügynök tükrözi azt az oldalt, amelyre eljutott, felismeri a céllal való eltérést, és visszalép, hogy egy másik linket próbáljon ki.

A kutatási asszisztens megszerkeszti a választ, bírálja azt a nem alátámasztott állítások miatt, és felülvizsgálja, hogy hivatkozásokat adjon hozzá, vagy fedezze a bizonytalan állításokat, mielőtt visszaküldi.

A matematikai megoldó ügynök ellenőrzi végső válaszát a probléma megszorításaihoz képest, észreveszi az egységeltérést, és a hibás eredmény benyújtása helyett átdolgozza a számítást.

Kockázatok és védőkorlátok

Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.

Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.

A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.

Végrehajtási ütemterv

1

Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.

2

Benchmark reális terhelési és adatviszonyok mellett.

3

Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.

4

A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-Reflection in Agent Loops quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Reflexiós és önkorrekciós szerek

Gyakran ismételt kérdések

What is Self-Reflection in Agent Loops?

Az önreflexió lehetővé teszi az AI-ügynök számára, hogy a feladat közben bírálja saját kimeneteit és tevékenységeit, majd a kritika alapján felülvizsgálja. Az egyszeri kitalálót olyan rendszerré változtatja, amely felfogja és kijavítja a saját hibáit.

Mit ad az önreflexió egy szabványos ügynökhurokhoz?

Az önreflexió beilleszt egy értékelési lépést, amelyben az ügynök bírálja legutóbbi tevékenységét vagy kimenetét, és ezt a kritikát használja a következő lépésének irányítására.

A Reflexion keretrendszerben hol tárolódnak a modell önkritikái?

A reflexió a verbális önkritikákat egy epizodikus memóriapufferben tartja, és a későbbi próbák során kontextusba táplálja őket, így a tanulás a kontextusban történik, nem pedig a súlyfrissítéseken keresztül.

Melyik visszacsatolási jel a legmegbízhatóbb a visszaverődéshez?

A földelt külső jelek, mint például a sikertelen tesztek vagy a futásidejű hibák konkrét, megbízható visszajelzést adnak, míg a tisztán öngenerált kritika téves lehet.

Mi az önreflexió ismert hibamódja?

Megalapozott visszacsatolás nélkül a modellek néha felülvizsgálják a hibás munkát, és tévesen arra a következtetésre jutnak, hogy az rendben van, ezért fontos a külső ellenőrzés.

Hogyan generál általában visszajelzést az Self-Refine megközelítés?

Az Self-Refine egyetlen modell visszajelzést ad a vázlatáról, majd ismétlődően felülvizsgálja a kimenetet a visszajelzés alapján.