Yansıma ve Kendini Düzelten Ajanlar
Düşünme, bir yapay zeka temsilcisinin kendi başarısızlıklarını yazılı olarak yansıttığı ve bu dersleri bir sonraki girişimine geri aktardığı bir tekniktir.
Genel Bakış
It matters because it lets agents improve on a task without retraining the underlying model.
Derin Dalış
Shinn ve meslektaşlarının 2023 tarihli bir makalesinde tanıtılan Reflexion, bir aracıya bir döngü veriyor: Bir göreve girişiyor, nasıl yaptığına dair bir sinyal alıyor (bir test sonucu, bir ödül veya bir eleştiri), ardından neyin yanlış gittiğini ve daha sonra ne deneneceğini açıklayan kısa bir doğal dil 'yansıtma' yazıyor. Bu yansıma bellekte saklanır ve bir sonraki denemenin isteminin başına eklenir. En önemlisi, modelin ağırlıkları asla değişmiyor; öğrenme tamamen bağlam penceresinde metin olarak gerçekleşir. Bu 'sözlü takviyeli öğrenme', temsilcilerin kodlama problemlerini, web'de gezinmeyi ve akıl yürütme görevlerini yinelemelerine olanak tanır. HumanEval kodlama kriterinde, Reflexion tarzı kendi kendini düzeltme, aracının birkaç denemede kendi hatalarını ayıklamasına izin vererek, geçiş oranlarını tek atışlı denemelerden önemli ölçüde daha yükseğe çıkardı.
Teknik Bilgi
Reflexion üç rolü ayırır: eylemleri üreten bir Aktör, sonucu puanlayan bir Değerlendirici (birim testleri, tam eşleşme kontrolü veya bir Yüksek Lisans jürisi) ve bu puanı metinsel bir derse dönüştüren bir Kendini Yansıtma modeli. Ders, bir sonraki denemede yeniden kullanılan epizodik bir hafıza arabelleğine yerleştirilir. Geri bildirim, geçişlerden ziyade dil olduğundan, herhangi bir GPU eğitimine gerek yoktur, ancak kendinden emin ancak yanlış düşüncelerin güçlendirilmesini önlemek için büyük ölçüde güvenilir bir değerlendirme sinyaline bağlıdır.
Stratejik Etki
Build choices
Uygulama düzeyinde tasarım, yapay zekanın gerçek sonuçları iyileştirip iyileştirmediğini belirler.
Ekip ve iş akışı
İyi iş akışı entegrasyonu, kullanıcıların güvenebileceği üretkenlik kazanımları sağlar.
Risk and safety
İyi kapsamlı kullanım örnekleri, değişiklik yorgunluğunu ve uygulama riskini azaltır.
Yansıma ve Kendi Kendini Düzelten Ajanların Geleceği
Kendi kendini düzeltme, aracı çerçevelerinde bir araştırma hilesi olmaktan ziyade varsayılan bir katman haline geliyor. Kod sanal alanları, resmi denetleyiciler ve gerçekleri doğrulayan erişim gibi otomatik doğrulayıcılarla daha sıkı entegrasyon bekleyebilirsiniz; böylece yansımalar, modelin kendisini ikinci kez tahmin etmesi yerine nesnel sinyallere dayandırılır. Açık zorluklar, bir aracının çalışma çıktısını sonsuz bir şekilde 'düzelttiği' döngülerden kaçınmak, yinelemeyi ne zaman durduracağına karar vermek ve yansımaların makul görünen ancak doğrulanmamış rasyonelleştirmelere sürüklenmesini önlemektir.
Gerçek Dünya Uygulaması
Birim testlerini çalıştıran, başarısız iddiayı okuyan, hata hakkında bir not yazan ve paketi yeniden çalıştırmadan önce kodunu düzenleyen bir kodlama aracısı.
Geri alma kontrolü başarısız olduğunda halüsinasyonlu bir alıntıyı yakalayan ve ardından yanıtı yalnızca doğrulanmış kaynakları kullanacak şekilde revize eden bir araştırma asistanı.
'Yanlış filtreye tıkladım' ifadesini kaydeden ve yeniden denemede bu yanlış adımı önleyen bir web navigasyon aracısı (örneğin, AlfWorld veya WebShop kıyaslamalarında).
Son cevabını bir kısıtlamaya göre kontrol eden, bir işaret hatasını fark eden ve ilgili adımı yeniden işleyen bir matematik problemi çözücü.
Riskler ve Korkuluklar
Bozuk bir süreci otomatikleştirmek mevcut sorunları büyütebilir.
Ekipler aşırı otomatikleşebilir ve gerekli insan muhakemesini ortadan kaldırabilir.
Çıktılar sürekli olarak değerlendirilmezse kalite düşebilir.
Uygulama Yol Haritası
Mevcut iş akışının haritasını çıkarın ve en yüksek sürtünmeli adımı belirleyin.
Tam otomasyondan önce insan kontrol noktalarını tanımlayın.
Kullanıcıları istemler, yükseltme yolları ve kalite standartları konusunda eğitin.
Sürdürülebilir değeri doğrulamak için görev düzeyindeki sonuçları izleyin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reflexion and Self-Correcting Agents quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Etmen Döngülerinde Öz-Yansıma
Sık sorulan sorular
What is Reflexion and Self-Correcting Agents?
Düşünme, bir yapay zeka temsilcisinin kendi başarısızlıklarını yazılı olarak yansıttığı ve bu dersleri bir sonraki girişimine geri aktardığı bir tekniktir. Bu önemlidir çünkü temsilcilerin temel modeli yeniden eğitmeden bir görevi geliştirmelerine olanak tanır.
Bir Reflexion aracısının nasıl 'öğrendiğinin' tanımlayıcı özelliği nedir?
Dersler, modelin parametrelerine kodlanmadan, bellekte doğal dil metni olarak saklandığı için yansıtmaya bazen 'sözel takviyeli öğrenme' adı verilir.
Refleks çerçevesinde Değerlendirici ne yapar?
Değerlendirici (bir birim testi, tam eşleşme kontrolü veya LLM hakemi), Kendini Düşünme adımının metinsel bir derse dönüştüğünün sinyalini üretir.
Reflexion'da değerlendirme sinyalinin kalitesi neden bu kadar önemli?
Değerlendirici güvenilmezse, temsilci kötü geri bildirimlere dayanarak kendinden emin düşünceler yazabilir ve gelecekteki girişimleri yanlış yöne yönlendirebilir.
Reflexion tarzı kendi kendini düzeltme hangi kritere göre kodlama geçiş oranlarını belirgin şekilde artırdı?
HumanEval bir kod oluşturma karşılaştırmasıdır ve aracının birden fazla denemede hata ayıklamasına izin verilmesi, geçiş oranlarını tek atış performansının çok üzerine çıkarır.
Hangisi kendi kendini düzelten ajanlarla ilgili gerçek bir açık risktir?
İyi bir durdurma kuralı olmadan, bir aracı doğru cevapları gözden geçirmeye devam edebilir, hesaplama israfına neden olabilir ve bazen iyi çıktıyı düşürebilir.