Teknik KILAVUZ

Etmen Döngülerinde Öz-Yansıma

Kendini yansıtma, bir yapay zeka aracısının görev ortasında kendi çıktılarını ve eylemlerini eleştirmesine ve ardından bu eleştiriye göre revize etmesine olanak tanır.

2 min readSon güncelleme

Genel Bakış

It turns a one-shot guesser into a system that catches and fixes its own mistakes.

Derin Dalış

Bir etmen döngüsünde, bir dil modeli eylemler gerçekleştirir (araçları çağırma, kod yazma, yanıtlama), sonuçları gözlemler ve daha sonra ne yapılacağına karar verir. Kendini yansıtma, modelin devam etmeden önce son çalışmasını değerlendirdiği kasıtlı bir adım ekler. Reflexion (2023) gibi çerçeveler bunu somutlaştırır: Başarısız bir girişimin ardından temsilci kısa bir sözlü eleştiri yazar ("Boş liste durumunu halletmeyi unuttum") ve bunu hafızasında saklar, böylece bir sonraki deneme bu derse göre koşullanır. Self-Refine, geri bildirim oluşturmak ve ardından cevabını yinelemeli olarak yeniden yazmak için aynı modeli kullanır. Yansıma, çıktının bir hedefle karşılaştırılması, hata mesajlarının kontrol edilmesi veya testlerin çalıştırılmasından kaynaklanabilir. Bunun getirisi, tek bir geçişin sıklıkla başarısız olduğu ancak eleştiri ve yeniden deneme döngüsünün başarılı olduğu kodlama, web gezintisi ve matematik gibi çok adımlı görevlerde daha yüksek güvenilirliktir.

Teknik Bilgi

Yansıtma genellikle ekstra bir ipucu olarak uygulanır: Modelden, kendi eylemlerinin transkripti üzerinde bir eleştirmen olarak hareket etmesi istenir, doğal dilde geri bildirim üretilir ve bu daha sonra bir sonraki girişim için bağlama eklenir. Reflexion, ağırlıkların ince ayarını yapmak yerine, bu eleştirileri denemeler boyunca epizodik bir bellek arabelleğinde saklar, böylece öğrenme tamamen bağlam içinde gerçekleşir. Sinyali yönlendiren yansıma harici olabilir (test başarılı/başarısız, takım hataları) veya kendiliğinden oluşturulmuş olabilir ve harici sinyaller çok daha güvenilir olma eğilimindedir.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Ajan Döngülerinde Öz-Düşünmenin Geleceği

Yansımanın ne zaman ekstra belirteçlere değeceğini ve ne zaman sadece bilgi işlemi yakacağını bilmek için eğitilmiş modellerle, yansımanın teşvik edici bir numara yerine yerleşik bir aracı ilkel haline gelmesini bekleyin. Doğrulayıcı modeller ve yürütme geri bildirimi, özeleştiriyi giderek daha fazla temellendirecek ve böylece ajanlar, yanlış yanıtların doğru olduğu halüsinasyonunu durduracak. Araştırma aynı zamanda modellerin kötü çalışmayı güvenle onayladığı, döngü için kalibre edilmiş, kanıta dayalı yansıma ve öğrenilmiş durdurma kriterlerini zorladığı başarısızlık modunu da hedefliyor.

Gerçek Dünya Uygulaması

Kodlama aracısı, arızalı bir birim testini çalıştırır, geri izlemeyi okur, birer birer hatayı belirten bir yansıma yazar ve bir sonraki döngü yinelemesinde işlevi yeniden yazar.

Yanlış bağlantıya tıklayan bir web tarama aracısı, ulaştığı sayfaya yansır, hedefiyle uyumsuzluğu fark eder ve farklı bir bağlantı denemek için geri adım atar.

Bir araştırma görevlisi bir yanıt taslağı hazırlar, desteklenmeyen iddialar nedeniyle eleştirir ve geri göndermeden önce alıntılar eklemek veya belirsiz ifadeleri engellemek için düzeltmeler yapar.

Bir matematik çözme temsilcisi, nihai cevabını problem kısıtlamalarına göre kontrol eder, birim uyumsuzluğunu fark eder ve hatalı sonucu göndermek yerine hesaplamayı yeniden düzenler.

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-Reflection in Agent Loops quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Yansıma ve Kendini Düzelten Ajanlar

Sık sorulan sorular

What is Self-Reflection in Agent Loops?

Kendini yansıtma, bir yapay zeka aracısının görev ortasında kendi çıktılarını ve eylemlerini eleştirmesine ve ardından bu eleştiriye göre revize etmesine olanak tanır. Tek seferlik bir tahminciyi, kendi hatalarını yakalayıp düzelten bir sisteme dönüştürür.

Kendini yansıtma standart bir aracı döngüsüne ne katar?

Kendini yansıtma, temsilcinin son eylemlerini veya çıktısını eleştirdiği ve bu eleştiriyi bir sonraki hamlesine rehberlik etmek için kullandığı bir değerlendirme adımı ekler.

Reflexion çerçevesinde modelin özeleştirileri nerede saklanıyor?

Reflexion, sözlü özeleştirileri epizodik bir hafıza tamponunda tutar ve bunları daha sonraki denemelerde bağlamla besler; böylece öğrenme, ağırlık güncellemeleri yerine bağlam içinde gerçekleşir.

Düşünme için hangi geri bildirim sinyali en güvenilir olma eğilimindedir?

Başarısız testler veya çalışma zamanı hataları gibi topraklanmış harici sinyaller somut, güvenilir geri bildirim sağlarken, tamamen kendi kendine üretilen eleştiri yanlış olabilir.

Kendini yansıtmanın bilinen bir başarısızlık modu nedir?

Temelli geri bildirim olmadan, modeller bazen hatalı çalışmayı inceler ve yanlış bir şekilde bunun iyi olduğu sonucuna varır; bu nedenle harici doğrulama önemlidir.

Kendini İyileştirme yaklaşımı tipik olarak nasıl geri bildirim üretir?

Self-Refine, taslağı hakkında geri bildirim üreten tek bir modele sahiptir ve ardından bu geri bildirimi kullanarak çıktıyı yinelemeli olarak revize eder.