Haberlere Geri Dön
YenilikAI Understanding brifing

Paper, Evrim Stratejilerinin Yüksek Lisans Cevap Kümelerini Çeşitli Tutma Konusunda RL'yi Geçtiğini Savunuyor

Yeni bir arXiv ön baskısı, evrim stratejilerine sahip eğitim sonrası LLM'lerin (ağırlıkları doğrudan bozan popülasyon tabanlı, gradyan içermeyen bir yöntem) pass@k ve çözüm kapsamındaki takviyeli öğrenmeyi geride bıraktığını savunuyor. Özette daha iyi matematik kıyaslama sonuçlarından bahsediliyor ancak model, kıyaslama veya sayı belirtilmemiş.

7 min readRead the primary source
Source-page capture accompanying Paper Argues Evolution Strategies Beat RL at Keeping LLM Answer Sets Diverse
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.12679
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Büyük Dil Modeli (LLM)
Metin oluşturmak ve analiz etmek için çok büyük metin toplulukları üzerinde eğitilmiş bir dil modeli.
Yapay Zeka (AI)
Örüntü tanıma, akıl yürütme, dil veya karar verme gerektiren görevleri yerine getiren sistemlerin geniş alanı.
Takviyeli Öğrenme
Bir aracının uzun vadeli getiriyi en üst düzeye çıkaracak eylemleri öğrendiği ödül sinyalleriyle eğitim.
Kendinizi test edinYapay Zeka Eğitim Sınavı

Ne oldu?

Yedi araştırmacı arXiv'de eğitim sonrası takviyeli öğrenmenin bir dil modelinin cevaplarının çeşitliliğini çökerttiğini ve evrim stratejilerinin (rastgele pertürbasyonlar yoluyla doğrudan ağırlık alanında optimizasyon) bu çeşitliliği koruduğunu ve pass@k'yi artırdığını savunan bir ön baskı yayınladı. Makale 13 Ağustos 2026'da sunuldu ve hakem incelemesinden geçmedi. Kamuya açık özette hiçbir kıyaslama adı, model boyutu veya ölçülen rakam yer almıyor.

"En İyi Tahminin Ötesinde: Evrim Stratejileriyle Yüksek Lisans Çözüm Kapsamını İyileştirme" başlıklı bir ön baskı, 13 Ağustos 2026'da arXiv'e sunuldu ve yapay zeka (cs.AI) altında, sinirsel ve evrimsel hesaplamada ikincil bir listeyle (cs.NE) kataloglandı. Yedi yazara atfedilmiştir: Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen ve Xin Qiu. arXiv kaydı kurumsal bağlantıları listelemez ve bu rapor, çalışmayı herhangi bir kuruluşa atfetmez.

Makalenin çerçevesi, dil modellerinin matematik ve fen bilimleri gibi keşif ortamlarında tipik olarak nasıl kullanıldığıyla başlar: bir problem sunulur ve modelin tek cevabı önerilen çözüm olarak alınır. Yazarlar, bu "en iyi tahmin" modunun masada değer bıraktığını, çünkü ek test süresi hesaplamasının bir yerine birçok aday çözüm üretmek için harcanabileceğini savunuyorlar. Bu rejim genellikle, k örneklenmiş denemeden en az birinin doğru olması durumunda sorunu çözülmüş olarak sayan bir ölçüm olan pass@k ile ölçülür.

Temel iddia, mevcut uygulamada bir yan etkinin teşhisidir. Yazarlar, bir modelin takviyeli öğrenimle sonradan eğitilmesinin, modelin çıktı dağılımını yüksek ödüllü çıktılar etrafında daralttığını ve bu daralmanın çözüm kapsamının çökmesine neden olduğunu yazıyor. Başka bir deyişle, RL, farklı yanıtlar kümesini küçültürken ilk yanıtı daha iyi hale getirebilir; bu da özellikle yazarların önemsediği pass@k rejimini cezalandırır.

Alternatif olarak makale, evrim stratejileri önermektedir: bir ödül sinyalini geri yaymak yerine, model parametrelerine rastgele pertürbasyonlar uygulayarak ve sonuçlara göre seçim yaparak doğrudan ağırlık alanında optimizasyon yapan, popülasyona dayalı, gradyan içermeyen bir eğitim sonrası yöntem. Özet, ES'nin sürekli olarak RL'den daha yüksek pass@k elde ettiğini, daha geniş çözüm kapsamıyla daha geniş bir çıktı dağılımı ürettiğini ve bu kapsamın da standart matematik kıyaslamalarında daha iyi sonuçlara dönüştüğünü belirtiyor.

Özetin sağlamadığı şey kanıtların çoğudur. Herhangi bir model ailesi veya parametre sayısı, belirli bir kıyaslama, k değeri, temel RL algoritması ve sayısal sonuç belirtilmez; sunulan tek tanımlamalar "sürekli olarak daha yüksek" ve "daha iyi sonuçlar" kelimeleridir. Gönderim 449 KB boyutundadır ve tam metin PDF ve deneysel HTML olarak mevcuttur; dolayısıyla bu ayrıntılar makalede yer alabilir; burada değerlendirilen kayıtta yoklar. Bu, hakem incelemesi belirtisi olmayan, görünür kod veya veri bağlantısı olmayan ve bağımsız çoğaltma içermeyen birinci versiyon bir ön baskıdır.

Kaynak ayrıntıları: arxiv.org

Neden önemli?

Bir adayın cevabının kontrol edilebildiği alanlarda (kanıtlar, kodlar, bilimsel hipotezler) faydalı tavan, modelin ilk tahmininin doğru olup olmadığı değil, bir dizi denemede doğru cevabın herhangi bir yerde görünüp görünmediğidir. Eğer RL eğitimi sonrası bu havuz sistematik olarak küçültülürse, endüstrinin hakim hizalama tarifi, keşif ve aracılı aramanın bağlı olduğu özelliği tam olarak ortadan kaldırıyor olabilir.

Makalenin çizdiği, bir modelin en iyi tek yanıtı ile birçok örnekte üretebileceklerinin genişliği arasındaki ayrım akademik değildir. Yüksek değerli yapay zeka çalışmalarının giderek artan bir payı, oluştur-sonra-doğrula döngüsünde çalışır: birçok aday program önerin ve test paketini çalıştırın, birçok kanıt adımı önerin ve bunları mekanik olarak kontrol edin, birçok hipotez önerin ve bunları tarayın. Tüm bu ayarlarda, bir doğrulayıcı hangi adayın doğru olduğuna karar verir; dolayısıyla bağlayıcı kısıtlama, doğru bir adayın oluşturulup oluşturulmadığıdır. Kapsama tavandır ve ilk denemedeki doğruluk bunun yalnızca bir puan altındadır.

Bu, tanıyı, baskın eğitim sonrası tarif için potansiyel olarak sonuç haline getiriyor. Ödül sinyallerinden pekiştirmeli öğrenme, mevcut sınır modellerinin çoğunun ön eğitimden sonra nasıl şekillendirildiğidir ve çıktı dağılımının keskinleştirilmesi, alıştırmanın amacına yakındır. Bu keskinleştirme güvenilir bir şekilde kapsama maliyetine neden oluyorsa, standart boru hattı k=1'de ölçülen kıyaslama puanları için optimizasyon yaparken, modellerin giderek daha fazla dağıtıldığı rejimde performansı sessizce düşürüyor olabilir. RL'nin model çeşitliliğini daralttığı endişesi daha önce araştırma literatüründe dile getirilmişti; Burada iddia edilen katkı yeni bir teşhisten ziyade somut bir alternatiftir.

Önerilen çarenin kendi iyi bilinen ödünleşimleri vardır. Evrim stratejileri gradyanları tamamen önler, bu da RL ince ayarının istikrarsızlığının bir kısmını ortadan kaldırır, ancak tarihsel olarak bunun bedelini örnek verimliliğiyle öderler: rastgele ağırlık bozulmalarından yararlı bir güncelleme yönünü tahmin etmek tipik olarak bir popülasyon boyunca çok sayıda ileri geçiş gerektirir; bu da iyi paralelleşir ancak bilgi işlem tüketir. Bu aritmetiğin modern dil modelleri ölçeğinde çalışıp çalışmadığı tam olarak okuyucunun yanıtlanmasını isteyeceği sorudur ve özette maliyete hiç değinilmemektedir.

Kamuoyu ve uygulayıcılar için bugün değişen hiçbir şey yok. Bu bir ürün, model sürümü veya güvenlik bulgusu değil, eğitim metodolojisine ilişkin bir araştırma iddiasıdır. Pratik önemi, taahhüt etmek yerine keşfetmeye ayarlanmış modeller aracılığıyla veya kapsam için ilk yanıt doğruluğunu takas eden düğmeleri açığa çıkaran sağlayıcılar aracılığıyla dolaylı olarak gelecektir. Kaynakta, konuşlandırılan herhangi bir sistemin bu yöntemi kullandığına dair hiçbir kanıt yok ve hiçbir satıcının bu yöntemi benimsediği tanımlanmadı.

Ayrıca, bir ön baskı özetinden çıkarılabilecek sonuçların sınırlarını da belirtmekte fayda var. ES'nin pass@k'de RL'yi yendiği iddiası, bağımsız olarak kanıtlanmış bir gerçek değil, yazarların kendi deneylerine ilişkin raporudur. Optimizasyon yöntemleri arasındaki karşılaştırmalar, ayarlama çabasına, hesaplama bütçesine ve temel seçimine son derece duyarlıdır ve bir model ölçeği veya bir kıyaslama ailesi için geçerli olan bir sonuç çoğu zaman genellemez.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Training Quiz

Which question best defines a clear goal for using AI Training?

Bundan sonra ne izlenecek?

Yük taşıma ayrıntıları özette değil tam PDF'de yer almaktadır: hangi modeller eğitildi, hangi kıyaslamalar kullanıldı, hangi k değerleri ve en önemlisi ES ile RL'nin eşleşen hesaplamada karşılaştırılıp karşılaştırılmadığı. Ayrıca kodun yayınlanıp yayınlanmadığı, sonucun matematik dışında üretilip üretilmediği ve herhangi bir sınır laboratuvarının yöntemi benimseyip benimsemediği de izlemeye değer.

Kontrol edilecek ilk şey, makalenin tamamının deneysel kurulumu ve özellikle ES ve RL çalıştırmalarının hesaplama açısından eşleşip eşleşmediğidir. RL temel çizgisinden önemli ölçüde daha fazla eğitim hesaplaması tüketen gradyan içermeyen bir yöntem, yazarların önerdiği mekanizmayla ilgisi olmayan nedenlerden dolayı daha iyi görünebilir. Okuyucular eğitilen model boyutlarına, karşılaştırma olarak kullanılan RL algoritmasına, nesil başına pertürbasyon sayısına ve pass@k'nin ölçüldüğü k değerlerine bakmalıdır; kapsama eğrileri sıklıkla kesişir ve büyük k'da kazanan bir yöntem, k=1'de kaybedebilir.

İkincisi, kapsamı izleyin. Özetin alt kazanımlara ilişkin somut iddiası, ucuz otomatik doğrulama ve yoğun ön optimizasyona sahip bir alan olan "standart matematik kıyaslamaları" ile sınırlıdır. Kapsam avantajının kod oluşturmaya mı, bilimsel hipotez oluşturmaya mı yoksa doğrulamanın daha gürültülü olduğu ve doğruluğun ikili olmadığı açık uçlu aracı görevlere mi aktarıldığı, mevcut materyal tarafından belirlenmemiştir.

Üçüncüsü, yapıtları ve kopyaları izleyin. ArXiv listesi, ilişkili kod veya veri yayınını göstermiyor. Yayınlanan bir uygulama veya yazarlarla bağlantısı olmayan bir grup tarafından çoğaltılması, bunu bir iddiadan sonuca taşıyacaktır. Bunun yokluğunda, uygun duruş güven yerine ilgidir ve herhangi bir benimseme sinyali kendi rakamlarıyla birlikte gelmelidir.

Dördüncüsü, doğrulama sorusu, herhangi bir kapsama kazancının değerinin ne kadar olduğunu sınırlar. Daha yüksek pass@k yalnızca bir şey birçok aday arasından doğru adayı tanımlayabildiğinde yararlı çıktıya dönüşür. Matematikte ve yazılımda dama vardır; çoğu ticari uygulamada bunu yapmazlar ve daha geniş bir havuzdan doğru cevabı seçmek başlı başına çözülmemiş bir sorun haline gelir. ES tarafından eğitilmiş modelleri seçim mekanizmalarıyla eşleştiren takip çalışması, bir sonraki doğal adım olacaktır.

Son olarak yayın parçasını izleyin. Makale, belirtilen yer veya inceleme durumu olmayan bir v1 ön baskısıdır. Revizyonlar, bir konferans sunumu veya RL eğitim sonrası çeşitliliği üzerinde çalışan diğer araştırmacıların kamuya açık eleştirilerinin tümü, merkezi iddianın ne kadar ciddiye alınması gerektiğini netleştirecektir.

İlgili kılavuzlar ve testler

Yapay Zeka EğitimiYapay Zeka Modellerinin AçıklamasıYapay Zekanın GeleceğiChatGPT ve LLM'lerBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakın
Bunu yararlı buldunuz mu?