Haberlere Geri Dön
YenilikAI Understanding brifing

LURE makalesi, görev verileri olmadan LLM muhakemesini eğitmek için takip-kaçınma kendi kendine oynamayı öneriyor

Yeni bir arXiv makalesi, bir dil modelinin görev zorluğunu ayarlarken diğerinin doğrulanabilir akıl yürütme zorluklarını çözdüğü sıfır verili kendi kendine oynama yöntemi olan LURE'u sunuyor. Yazarlar, dokuz uzatılmış kıyaslamada eğitimli temellere göre dağıtım dışı sıfır atış doğruluğunun daha güçlü olduğunu bildiriyor, ancak özet bunu yapmıyor…

5 min readRead the primary source
Primary-source image accompanying LURE paper proposes pursuit-evasion self-play to train LLM reasoning without task data
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.21871
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Büyük Dil Modeli (LLM)
Metin oluşturmak ve analiz etmek için çok büyük metin toplulukları üzerinde eğitilmiş bir dil modeli.
Kendi Kendine Oynama
Bir modelin kendi kopyalarıyla etkileşimler veya yarışmalar yoluyla veri üreterek geliştiği bir eğitim düzeni.
Takviyeli Öğrenme
Bir aracının uzun vadeli getiriyi en üst düzeye çıkaracak eylemleri öğrendiği ödül sinyalleriyle eğitim.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

Bir arXiv makalesi, insanların hazırladığı büyük görev koleksiyonlarına dayanmadan geniş dil modeli muhakemesini geliştirmeyi amaçlayan bir takviyeli öğrenme yaklaşımı olan LURE'u tanıtıyor. Eğitimi bir takip-kaçınma oyunu olarak çerçeveliyor: Bir kaçan, görevleri bir zorluk ölçeğine göre yerleştirirken, planlayıcı-yürütücü bir takipçi, bunları doğrulanabilir etkileşim yoluyla çözmeye çalışır.

22 Ağustos 2026'da arXiv'ye gönderilen makale, LURE'u geniş dil modeli akıl yürütmede sıfır verili kendi kendine oynatma yöntemi olarak tanımlıyor. Yazarlar, doğrulanabilir ödüllere sahip geleneksel takviyeli öğrenmenin, genellikle insan tarafından seçilen geniş görev koleksiyonlarına erişim gerektirdiğini söylüyor. Belirtilen amaçları, tamamen hazırlanmış bir görev havuzuna güvenmek yerine, modellerin eğitim sırasında görevler oluşturmasını veya konumlandırmasını sağlayarak bu bağımlılığı ortadan kaldırmaktır. Kaynak bunu makalenin araştırma problemi ve önerisi olarak ortaya koyuyor; LURE'un konuşlandırılmış bir sistem veya üretime hazır bir eğitim yöntemi olduğunu kanıtlamaz.

LURE eğitim sürecini iki role ayırır. Bir yüksek lisans kaçanı, görevleri ortamın zorluk eksenine yerleştirirken, planlayıcı-yürütücü takipçisi, bu görevleri, sonuçları doğrulanabilecek etkileşimler yoluyla çözmeye çalışır. Makale, kaçakçının, çözümleyicinin onu kullanıma sunma işleminin tam yarısında yakaladığında en yüksek sınır yakalama ödülünü aldığını söylüyor. Yazarların çerçevelemesinde, bu ödül, "zor yakalanabilir" görev yerleştirmeyi, manuel olarak seçilen bir reddetme eşiği tarafından zorlanmak yerine öğrenilen bir şeye dönüştürüyor. Özet, kesin ortamları, görev formatlarını veya doğrulayıcı uygulamalarını açıklamamaktadır.

Yöntem aynı zamanda çözme modelinin eğitim kredisini alma biçimini de değiştirir. LURE, yalnızca seyrek bir terminal ödülüne güvenmek yerine, makalenin yakalama bağlantılı yoğun süreç kredisi dediği şeyi kullanıyor. Özette, monoton doğrulayıcı ilerlemesinin, görev belirleme ve görev çözme rolleri arasındaki ortak evrimi stabilize etmeyi amaçlayan yuvarlak bağlantılı bir KL kısıtlaması altında, terminal yakalamayla birlikte grup normalleştirildiği belirtiliyor. Yazarlar, birleştirilmiş ve uzman ayarları karşılaştırarak, üç doğrulanabilir muhakeme ortamında ve üç omurga ailesinde testler rapor etmektedir. Kaynak, omurga adlarını, eğitim bütçelerini, ablasyonları veya tam temel yapılandırmaları belirtmiyor.

Kaynak ayrıntıları: arxiv.org ↗

Neden önemli?

Bildirilen sonuçlar geçerli olursa, LURE araştırmacılara kapsamlı etiketli veri kümeleri oluşturmadan, yararlı muhakeme zorlukları oluşturmanın ve seçmenin bir yolunu sunabilir. Yaklaşımı aynı zamanda iki kalıcı eğitim sorununu aynı anda hedef alıyor: zor ama öğrenilebilir görevlerin seçilmesi ve yalnızca nihai yanıtlar yerine ara adımlara puan verilmesi.

Teklifin pratik önemi, insan yapımı muhakeme egzersizlerine bağımlılığı azaltma girişimidir. Büyük, yüksek kaliteli görev koleksiyonları oluşturmak pahalıdır ve sabit koleksiyonlar, eğitim zorluklarını uygun bir seviyede tutmayı zorlaştırabilir. LURE'un kaçınan-takip eden kurulumu, çözücü geliştikçe zorluğu ayarlamak üzere tasarlanmıştır. Bu mekanizma güvenilir bir şekilde çalışırsa, kendi kendine oyun eğitimini daha uyarlanabilir hale getirebilir ve bazı doğrulanabilir muhakeme alanları için gereken manuel görev iyileştirme miktarını potansiyel olarak azaltabilir. Bu, bağımsız olarak belirlenmiş bir sonuç değil, tasarımın potansiyel bir sonucudur.

Makale ayrıca çok adımlı muhakeme eğitiminde merkezi bir konu olan kredi atamasını da ele alıyor. Çözücü, faydalı ve faydasız kararlar içeren bir diziden sonra doğru nihai sonuca ulaşabilirken, nihai ödül tek başına hangi adımların önemli olduğu hakkında çok az bilgi verir. LURE, ara doğrulama sürecini son yakalama olayına bağlayarak, doğrulanan sonucun önemini göz ardı etmeden daha yoğun bir öğrenme sinyali sağlamayı amaçlamaktadır. Özet, bu kombinasyonun yazarların deneylerindeki gelişmiş temellerden daha iyi performans gösterdiğini bildiriyor, ancak iyileşmenin esas olarak uyarlanabilir görev seçiminden, daha yoğun krediden, KL stabilizasyon teriminden veya bunların etkileşiminden kaynaklanıp kaynaklanmadığını göstermiyor.

Bildirilen en güçlü sonuç, birleştirilmiş modelin, üç görev ailesini kapsayan dokuz uzatılmış kıyaslamada tüm eğitimli taban çizgilerinden daha yüksek toplam dağıtım dışı sıfır atış doğruluğu elde etmesidir. Bu iddia, eğer tekrarlanabilirse, yöntemin yalnızca eğitim sırasında kullanılan ortamları optimize etmek yerine aktarımı geliştirebileceğini öne sürüyor. Yine de "daha güçlü toplama" pratik önemi belirlemek için yeterli değildir: özette puanlar, güven aralıkları, karşılaştırma başına sonuçlar, daha büyük veya daha fazla bilgi işlem yoğunluklu sistemlerle karşılaştırmalar veya uzamış görevlerin nasıl seçildiği hakkında bilgi verilmez. Bu nedenle çalışma, sıfır veriyle kendi kendine oynamanın genel amaçlı muhakeme eğitimini çözdüğünün kanıtı olarak değil, daha fazla inceleme gerektiren bir araştırma sonucu olarak en iyi şekilde anlaşılır.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Makale dokuz sayfalık bir arXiv ön baskısıdır ve kaynak yalnızca bir özet sağlar. Bildirilen kazanımların sayısal boyutu, hesaplama maliyeti, görev yapısı, model boyutları, kıyaslama bileşimi, tekrarlanabilirlik ve yöntemin test edilen üç ortam ve üç görev ailesinin ötesine geçip geçmediği hakkında önemli sorular devam etmektedir.

İlk doğrulama adımı, makalenin tamamı ve deneysel tablolarıdır. Okuyucular, üç omurga ailesinin kimliklerini ve boyutlarını, üç ortamın tam tanımlarını, eğitim görevlerinin sayısını ve türünü, temel yöntemleri ve kullanılan hesaplamayı araştırmalıdır. Bu ayrıntılar, LURE'un kazanımlarının genel olarak faydalı bir eğitim tarifini mi yoksa belirli bir kıyaslama tasarımına sıkı sıkıya bağlı bir sonucu mu yansıttığını belirleyecek. Kaynak alıntı, makalenin beş tablo ve beş şekil içerdiğini doğruluyor ancak bunların içeriğini vermiyor.

Tekrarlanabilirlik başka bir açık konudur. Sağlanan kaynak kodun, görev oluşturucuların, doğrulayıcı uygulamaların, kontrol noktalarının veya eğitim verilerinin mevcut olup olmadığını söylemiyor. Yöntem, birlikte gelişen bir kaçakçıya ve takipçiye bağlı olduğundan, ödül ölçeklendirmesi, yaygınlaştırma örneklemesi, normalleştirme veya stabilizasyondaki küçük seçimler sonuçları etkileyebilir. Farklı model aileleri ve doğrulanabilir ortamlar arasındaki bağımsız kopyalamalar, bildirilen davranışın sağlam mı yoksa yazarların uygulamasına mı bağlı olduğunu belirlemeye yardımcı olacaktır.

Son olarak, yöntemin kapsamının makalede belirtilen dokuz kriterin ve üç görev ailesinin ötesinde test edilmesi gerekiyor. Doğrulanabilir ortamlar faydalıdır çünkü nesnel geri bildirim sağlarlar, ancak gerçek dünyadaki muhakeme görevlerinin çoğunda otomatik doğrulama yoktur veya belirsiz başarı kriterleri vardır. LURE'un bu ortamlarda yararlı zorluk müfredatı oluşturup oluşturamayacağı, hala ne kadar insan gözetiminin gerekli olacağı ve kaçakçının gerçekten değerli zorluklar üretmek yerine bir doğrulayıcıdaki zayıflıklardan yararlanmayı öğrenip öğrenemeyeceği bilinmiyor. Özette ayrıca yöntemin eğitim maliyeti, gecikme süresi, hata modları ve daha uzun veya daha az yapılandırılmış görevlerdeki performansı da bilinmiyor.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıYapay Zeka EğitimiTransformatörlerYapay Zeka AracılarıBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?