Ne oldu?
25 Ağustos'ta arXiv'ye gönderilen bir ön baskı, hiyerarşik LLM acenteleri için "kendi kendine yükselme" önermektedir: Bir temsilci, hala muhakeme yürütürken bir görevi çözme olasılığını tahmin eder ve beklenen fayda maliyeti haklı çıkardığında kontrolü daha güçlü bir modele verir. Makale bunu, yanıtın oluşturulmasından önceki yönlendirme ve yanıt tamamlandıktan sonraki doğrulamayla karşılaştırıyor.
Makale, hiyerarşik Yüksek Lisans temsilcilerindeki belirli bir sorunu inceliyor: yalnızca bir görevi hangi modelin yerine getirmesi gerektiğine değil, aynı zamanda daha zayıf bir modelin ne zaman durup daha güçlü bir modelden yardım istemesi gerektiğine karar vermek. Önerilen rejimi üretim sırasında çalışır. Bir temsilci, nihai başarı olasılığına ilişkin çevrimiçi bir tahmin oluşturur ve bu tahmin, maliyete duyarlı bir eşiğin altına düştüğünde, yanıtı tamamlamadan önce üst seviyeye iletebilir. Bu, kaynağın tanımladığı merkezi teknik katkıdır.
Yazarlar kararı Bayesian optimal durdurma problemi olarak formüle ettiler. Yeterlilik tahmini, yeterli istatistiklerin yalnızca ham çıktı entropisinden ziyade, etiketlenmiş yörüngelerden geldiği öğrenilmiş bir sonsaldır. Makale, kapalı formda miyop bir yükselme eşiği türetmektedir ve optimal politikayı karakterize etmek için dinamik programlamayı kullanmaktadır. Ham sinyale bir şekil varsayımı uygulamadan, politikanın zamanla değişen bir eşik politikası olduğuna dair bir kanıt rapor eder.
Kaynak birkaç teorik sonuç bildiriyor. Bu, kehanet inancının sinyalin Chernoff bilgi hızında üstel olarak ayrıldığını, pişmanlığın sonsal kalibrasyon tarafından yönetildiğini ve n etiketli kalibrasyon yörüngeleriyle eğitilmiş bir eklenti politikasının pişmanlığın 1/sqrt(n) oranında azaldığını söylüyor. Kontrollü bir simülasyon çalışmasının bu oran da dahil olmak üzere teorinin tahminlerini doğruladığı bildiriliyor. Makale ayrıca 257 MBPP kodlama görevinde Qwen2.5-Coder 1.5B'den 7B'ye kademesini kullanan gerçek model doğrulamasını da içeriyor. Bu doğrulama, önceden kayıtlı üç tahminden ikisini doğruladı: Yükseltme sınırı, eşit maliyetle geçici yönlendirmeden daha iyi performans gösterdi ve kümülatif yeterlilik inancı, nesil boyunca daha ayırt edici hale geldi. Kaynak, üçüncü tahminin kimliğini belirtmiyor veya bunun neden doğrulanmadığını özet olarak açıklamıyor.
Kaynak ayrıntıları: arxiv.org ↗
Neden önemli?
Yaklaşımın genelleştirilmesi halinde, etmen sistemlerine yetenek, gecikme ve model kullanım maliyetlerini dengelemek için daha zamanlı bir yol sunabilir. Kanıtlar henüz erken: Makalenin gerçek model testi, 257 MBPP görevinde Qwen2.5-Coder 1.5B'den 7B'ye kademesini kullandı ve önceden kaydedilmiş üç tahminden ikisini doğruladı.
Pratik sorun, bir yapay zeka aracısı içindeki kaynak tahsisidir. Her zaman daha güçlü bir model kullanan bir sistem, yeteneği geliştirebilir ancak daha fazla çıkarım kaynağı tüketebilir. Bitirene kadar daha zayıf bir modele bağlı kalan bir sistem, zaman kaybına neden olabilir veya önlenebilir bir arızaya neden olabilir. Kendi kendini yükseltme, kararı akıl yürütme sürecinin içine yerleştirmeye çalışır ve sisteme, kendi kanıtları devam etmenin muhtemelen işe yaramadığını gösterdiğinde durma fırsatı verir.
Makalenin kalibrasyona yaptığı vurgu önemlidir çünkü yükseltme, yeterlilik tahmininin kalitesine bağlıdır. Yetersiz kalibre edilmiş bir güven sinyali, bir aracının çok sık yükselmesine, maliyetin artmasına veya çok nadir olarak zayıf yanıtların geçmesine neden olabilir. Bildirilen pişmanlık garantisi, yükseltmeyi dil modellerinin evrensel olarak güvenilir bir özelliği olarak sunmak yerine performansı bu kalibrasyona bağlar.
Gerçek model doğrulamasındaki eşit maliyet karşılaştırması potansiyel olarak faydalıdır çünkü sınırsız ek model çağrılarına sahip sistemleri karşılaştırmak yerine somut bir dağıtım ödünleşimini hedefler. Ancak rapor edilen değerlendirme dardır. Bir model ailesini, kaynakta açıklandığı gibi bir küçük-orta kademeli konfigürasyonu ve 257 MBPP görevini kapsar. Özet, mutlak başarı oranlarını, kesin maliyet hesaplamasını, kazanımların boyutunu veya kodlama dışı görevlerden elde edilen kanıtları sağlamaz. Bu nedenle hiyerarşik aktörlerin genel olarak ne zaman yardım arayacaklarını bildikleri sonucunu değil, yönteme olan ilgiyi desteklemektedir.
Sonuç aynı zamanda etmen tasarımında dinamik hesaplamaya doğru daha geniş bir değişime de uyuyor: Sistemlerin her göreve ne kadar akıl yürütme, doğrulama veya model kapasitesi harcayacağına karar vermesi gerekebilir. Bu makale söz konusu kararın bir versiyonu için resmi bir çerçeveye katkıda bulunmaktadır. Kamusal değeri, çerçevenin güvenilir izlemeyle uygulanıp uygulanamayacağına ve eklenen kalibrasyon verilerinin, karar yükünün ve devretme karmaşıklığının daha iyi sonuçlarla haklı gösterilip gösterilmeyeceğine bağlı olacaktır.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Bundan sonra ne izlenecek?
Temel soru, öğrenilen yeterlilik tahmininin makalenin kontrollü ortamının ötesinde modeller, görevler ve ortamlar genelinde kalibre edilip edilmediğidir. Bağımsız çoğaltma, daha büyük ve daha çeşitli iş yüklerini, doğrulanmamış tahmini, yükseltme hatalarını ve üretim sırasında kontrolü aktarmanın pratik maliyetini test etmelidir.
Çoğaltma, post-hoc yönlendirmeye göre bildirilen avantajın MBPP dışında ve Qwen2.5-Coder 1.5B'den 7B'ye kademesinin ötesinde hayatta kalıp kalmadığını belirlemelidir. Yararlı testler görev zorluğunu, model çiftlerini, etki alanlarını ve göreli fiyatı veya yükseltme gecikmesini değiştirebilir. Kaynağın kendisi bu testleri rapor etmiyor, dolayısıyla bunların yokluğu başarısızlığın kanıtı olmaktan ziyade anlamlı bir bilinmeyendir.
Onaylanmamış ön kayıtlı tahmin özel ilgiyi hak ediyor. Özette, üç tahminden ikisinin doğrulandığı belirtiliyor ancak kalan tahminin adı veya sonucu açıklanmıyor. Okuyucular, neyin test edildiğini, tahminin neden başarısız olduğunu ve başarısızlığın teoride, sinyalde veya uygulamada bir sınırlamaya işaret edip etmediğini açıklayan tam makaleyi, yayınlanan kodu ve verileri veya takip çalışmalarını aramalıdır.
Gelecekteki değerlendirmeler yalnızca ortalama görev başarısını değil, yanlış kalibrasyonun zararlı biçimlerini de ölçmelidir. Bir aracı, kolay görevlerde gereksiz yere üst kademeye geçebilir, zor görevlerde üst kademeye ulaşamayabilir veya kontrolü daha güçlü modelin yardım etmesi için çok geç devredebilir. Kaynak bir pişmanlık çerçevesi oluşturuyor ancak soyut olarak bu operasyonel hata türlerini ölçmüyor veya yöntemin dağıtım değişimi altında nasıl davrandığını göstermiyor.
Belgede, çalışmayla ilişkili kod ve veriler listeleniyor; bu, bağımsız kontrolü mümkün kılabilir, ancak kaynak, bağlantıları sağlamıyor veya sürüm içeriğini açıklamıyor. Doğrulama, kalibrasyon prosedürünü, etiketli yörüngeleri, maliyet modelini, ön kaydı, simülasyon kurulumunu ve 257 görev doğrulaması etrafındaki istatistiksel belirsizliği incelemelidir. O zamana kadar desteklenen en güçlü sonuç, ön baskının, orta nesil artışa yönelik umut verici ancak sınırlı ampirik kanıtlarla resmi, test edilebilir bir yaklaşım sunduğudur.