PRZEWODNIK techniczny

Autorefleksja w pętlach agentów

Autorefleksja pozwala agentowi sztucznej inteligencji krytycznie ocenić własne wyniki i działania w połowie zadania, a następnie dokonać przeglądu w oparciu o tę krytykę.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It turns a one-shot guesser into a system that catches and fixes its own mistakes.

Głębokie nurkowanie

W pętli agenta model językowy podejmuje działania (wywoływanie narzędzi, pisanie kodu, odpowiadanie), obserwuje wyniki i decyduje, co robić dalej. Autorefleksja stanowi celowy krok, podczas którego model ocenia swoją ostatnią pracę przed kontynuowaniem. Ramy takie jak Reflexion (2023) ukonkretniają tę kwestię: po nieudanej próbie agent pisze krótką werbalną krytykę („Zapomniałem zająć się przypadkiem pustej listy”) i zapisuje ją w pamięci, więc następna próba jest uzależniona od tej lekcji. Self-Refine wykorzystuje ten sam model do generowania informacji zwrotnych, a następnie iteracyjnie przepisuje swoją odpowiedź. Refleksja może wynikać z porównania wyników z celem, sprawdzenia komunikatów o błędach lub uruchomienia testów. Korzyścią jest większa niezawodność w przypadku zadań wieloetapowych, takich jak kodowanie, nawigacja w Internecie i matematyka, gdzie pojedyncze przejście często kończy się niepowodzeniem, ale kończy się sukcesem w pętli krytyki i ponawiania prób.

Wgląd techniczny

Refleksja jest zwykle wdrażana jako dodatkowa zachęta: model proszony jest o wystąpienie w roli krytyka wobec transkrypcji własnych działań, co generuje informację zwrotną w języku naturalnym, która jest następnie dołączana do kontekstu przy następnej próbie. Refleksja przechowuje te uwagi krytyczne w buforze pamięci epizodycznej podczas prób, zamiast dostrajać wagi, więc uczenie się odbywa się całkowicie w kontekście. Odbicie sygnału sterującego może być zewnętrzne (test pozytywny/negatywny, błędy narzędzia) lub wygenerowane samodzielnie, a sygnały zewnętrzne są zwykle znacznie bardziej niezawodne.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość autorefleksji w pętlach agentów

Spodziewaj się, że odbicie stanie się wbudowanym prymitywnym agentem, a nie sztuczką podpowiadającą, dzięki modelom przeszkolonym tak, aby wiedzieć, kiedy odbicie jest warte dodatkowych tokenów, a kiedy po prostu spala obliczenia. Modele weryfikatorów i informacje zwrotne dotyczące wykonania będą w coraz większym stopniu opierać się na samokrytyce, dzięki czemu agenci przestaną mieć halucynacje, że błędne odpowiedzi są poprawne. Badania skupiają się także na trybie awarii, w którym modele z pewnością potwierdzają złą pracę, kierując się w stronę skalibrowanej, opartej na dowodach refleksji i wyuczonych kryteriów zatrzymywania pętli.

Implementacja w świecie rzeczywistym

Agent kodujący przeprowadza nieudany test jednostkowy, odczytuje ślad, zapisuje refleksję odnotowującą błąd o jeden i ponownie zapisuje funkcję w następnej iteracji pętli.

Agent przeglądający sieć, który kliknął niewłaściwy link, przegląda stronę, na którą trafił, rozpoznaje niezgodność z celem i wycofuje się, aby wypróbować inny link.

Asystent naukowy przygotowuje odpowiedź, krytykuje ją pod kątem nieuzasadnionych twierdzeń i poprawia, dodając cytaty lub zabezpieczając przed niepewnymi stwierdzeniami, zanim ją zwróci.

Osoba rozwiązująca zadania matematyczne sprawdza ostateczną odpowiedź pod kątem ograniczeń problemu, zauważa niezgodność jednostek i przerabia obliczenia, zamiast przesyłać błędny wynik.

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-Reflection in Agent Loops quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Środki refleksyjne i samokorygujące

Często zadawane pytania

What is Self-Reflection in Agent Loops?

Autorefleksja pozwala agentowi sztucznej inteligencji krytycznie ocenić własne wyniki i działania w połowie zadania, a następnie dokonać przeglądu w oparciu o tę krytykę. Zamienia jednokrotne zgadywanie w system, który wychwytuje i naprawia własne błędy.

Co autorefleksja dodaje do standardowej pętli agenta?

Autorefleksja wprowadza etap oceny, w którym agent krytykuje swoje ostatnie działania lub wyniki i wykorzystuje tę krytykę do kierowania swoim następnym ruchem.

Gdzie w strukturze refleksji przechowywana jest samokrytyka modelu?

Refleksja przechowuje werbalne samokrytyki w buforze pamięci epizodycznej i umieszcza je w kontekście w późniejszych próbach, więc uczenie się odbywa się w kontekście, a nie poprzez aktualizację wagi.

Który sygnał zwrotny dotyczący odbicia jest najbardziej niezawodny?

Ugruntowane sygnały zewnętrzne, takie jak nieudane testy lub błędy w czasie wykonywania, dają konkretną, godną zaufania informację zwrotną, podczas gdy wyłącznie krytyka generowana przez samego siebie może być błędna.

Jaki jest znany sposób niepowodzenia autorefleksji?

Bez uzasadnionej informacji zwrotnej modele czasami przeglądają wadliwą pracę i błędnie dochodzą do wniosku, że jest w porządku, dlatego ważna jest weryfikacja zewnętrzna.

W jaki sposób podejście Samodoskonalenia zazwyczaj generuje informację zwrotną?

Self-Refine ma pojedynczy model, który generuje opinie na temat swojej wersji roboczej, a następnie iteracyjnie weryfikuje wyniki, korzystając z tych informacji.