Ne oldu?
Yedi araştırmacı arXiv'de eğitim sonrası takviyeli öğrenmenin bir dil modelinin cevaplarının çeşitliliğini çökerttiğini ve evrim stratejilerinin (rastgele pertürbasyonlar yoluyla doğrudan ağırlık alanında optimizasyon) bu çeşitliliği koruduğunu ve pass@k'yi artırdığını savunan bir ön baskı yayınladı. Makale 13 Ağustos 2026'da sunuldu ve hakem incelemesinden geçmedi. Kamuya açık özette hiçbir kıyaslama adı, model boyutu veya ölçülen rakam yer almıyor.
"En İyi Tahminin Ötesinde: Evrim Stratejileriyle Yüksek Lisans Çözüm Kapsamını İyileştirme" başlıklı bir ön baskı, 13 Ağustos 2026'da arXiv'e sunuldu ve yapay zeka (cs.AI) altında, sinirsel ve evrimsel hesaplamada ikincil bir listeyle (cs.NE) kataloglandı. Yedi yazara atfedilmiştir: Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen ve Xin Qiu. arXiv kaydı kurumsal bağlantıları listelemez ve bu rapor, çalışmayı herhangi bir kuruluşa atfetmez.
Makalenin çerçevesi, dil modellerinin matematik ve fen bilimleri gibi keşif ortamlarında tipik olarak nasıl kullanıldığıyla başlar: bir problem sunulur ve modelin tek cevabı önerilen çözüm olarak alınır. Yazarlar, bu "en iyi tahmin" modunun masada değer bıraktığını, çünkü ek test süresi hesaplamasının bir yerine birçok aday çözüm üretmek için harcanabileceğini savunuyorlar. Bu rejim genellikle, k örneklenmiş denemeden en az birinin doğru olması durumunda sorunu çözülmüş olarak sayan bir ölçüm olan pass@k ile ölçülür.
Temel iddia, mevcut uygulamada bir yan etkinin teşhisidir. Yazarlar, bir modelin takviyeli öğrenimle sonradan eğitilmesinin, modelin çıktı dağılımını yüksek ödüllü çıktılar etrafında daralttığını ve bu daralmanın çözüm kapsamının çökmesine neden olduğunu yazıyor. Başka bir deyişle, RL, farklı yanıtlar kümesini küçültürken ilk yanıtı daha iyi hale getirebilir; bu da özellikle yazarların önemsediği pass@k rejimini cezalandırır.
Alternatif olarak makale, evrim stratejileri önermektedir: bir ödül sinyalini geri yaymak yerine, model parametrelerine rastgele pertürbasyonlar uygulayarak ve sonuçlara göre seçim yaparak doğrudan ağırlık alanında optimizasyon yapan, popülasyona dayalı, gradyan içermeyen bir eğitim sonrası yöntem. Özet, ES'nin sürekli olarak RL'den daha yüksek pass@k elde ettiğini, daha geniş çözüm kapsamıyla daha geniş bir çıktı dağılımı ürettiğini ve bu kapsamın da standart matematik kıyaslamalarında daha iyi sonuçlara dönüştüğünü belirtiyor.
Özetin sağlamadığı şey kanıtların çoğudur. Herhangi bir model ailesi veya parametre sayısı, belirli bir kıyaslama, k değeri, temel RL algoritması ve sayısal sonuç belirtilmez; sunulan tek tanımlamalar "sürekli olarak daha yüksek" ve "daha iyi sonuçlar" kelimeleridir. Gönderim 449 KB boyutundadır ve tam metin PDF ve deneysel HTML olarak mevcuttur; dolayısıyla bu ayrıntılar makalede yer alabilir; burada değerlendirilen kayıtta yoklar. Bu, hakem incelemesi belirtisi olmayan, görünür kod veya veri bağlantısı olmayan ve bağımsız çoğaltma içermeyen birinci versiyon bir ön baskıdır.
Kaynak ayrıntıları: arxiv.org ↗
Neden önemli?
Bir adayın cevabının kontrol edilebildiği alanlarda (kanıtlar, kodlar, bilimsel hipotezler) faydalı tavan, modelin ilk tahmininin doğru olup olmadığı değil, bir dizi denemede doğru cevabın herhangi bir yerde görünüp görünmediğidir. Eğer RL eğitimi sonrası bu havuz sistematik olarak küçültülürse, endüstrinin hakim hizalama tarifi, keşif ve aracılı aramanın bağlı olduğu özelliği tam olarak ortadan kaldırıyor olabilir.
Makalenin çizdiği, bir modelin en iyi tek yanıtı ile birçok örnekte üretebileceklerinin genişliği arasındaki ayrım akademik değildir. Yüksek değerli yapay zeka çalışmalarının giderek artan bir payı, oluştur-sonra-doğrula döngüsünde çalışır: birçok aday program önerin ve test paketini çalıştırın, birçok kanıt adımı önerin ve bunları mekanik olarak kontrol edin, birçok hipotez önerin ve bunları tarayın. Tüm bu ayarlarda, bir doğrulayıcı hangi adayın doğru olduğuna karar verir; dolayısıyla bağlayıcı kısıtlama, doğru bir adayın oluşturulup oluşturulmadığıdır. Kapsama tavandır ve ilk denemedeki doğruluk bunun yalnızca bir puan altındadır.
Bu, tanıyı, baskın eğitim sonrası tarif için potansiyel olarak sonuç haline getiriyor. Ödül sinyallerinden pekiştirmeli öğrenme, mevcut sınır modellerinin çoğunun ön eğitimden sonra nasıl şekillendirildiğidir ve çıktı dağılımının keskinleştirilmesi, alıştırmanın amacına yakındır. Bu keskinleştirme güvenilir bir şekilde kapsama maliyetine neden oluyorsa, standart boru hattı k=1'de ölçülen kıyaslama puanları için optimizasyon yaparken, modellerin giderek daha fazla dağıtıldığı rejimde performansı sessizce düşürüyor olabilir. RL'nin model çeşitliliğini daralttığı endişesi daha önce araştırma literatüründe dile getirilmişti; Burada iddia edilen katkı yeni bir teşhisten ziyade somut bir alternatiftir.
Önerilen çarenin kendi iyi bilinen ödünleşimleri vardır. Evrim stratejileri gradyanları tamamen önler, bu da RL ince ayarının istikrarsızlığının bir kısmını ortadan kaldırır, ancak tarihsel olarak bunun bedelini örnek verimliliğiyle öderler: rastgele ağırlık bozulmalarından yararlı bir güncelleme yönünü tahmin etmek tipik olarak bir popülasyon boyunca çok sayıda ileri geçiş gerektirir; bu da iyi paralelleşir ancak bilgi işlem tüketir. Bu aritmetiğin modern dil modelleri ölçeğinde çalışıp çalışmadığı tam olarak okuyucunun yanıtlanmasını isteyeceği sorudur ve özette maliyete hiç değinilmemektedir.
Kamuoyu ve uygulayıcılar için bugün değişen hiçbir şey yok. Bu bir ürün, model sürümü veya güvenlik bulgusu değil, eğitim metodolojisine ilişkin bir araştırma iddiasıdır. Pratik önemi, taahhüt etmek yerine keşfetmeye ayarlanmış modeller aracılığıyla veya kapsam için ilk yanıt doğruluğunu takas eden düğmeleri açığa çıkaran sağlayıcılar aracılığıyla dolaylı olarak gelecektir. Kaynakta, konuşlandırılan herhangi bir sistemin bu yöntemi kullandığına dair hiçbir kanıt yok ve hiçbir satıcının bu yöntemi benimsediği tanımlanmadı.
Ayrıca, bir ön baskı özetinden çıkarılabilecek sonuçların sınırlarını da belirtmekte fayda var. ES'nin pass@k'de RL'yi yendiği iddiası, bağımsız olarak kanıtlanmış bir gerçek değil, yazarların kendi deneylerine ilişkin raporudur. Optimizasyon yöntemleri arasındaki karşılaştırmalar, ayarlama çabasına, hesaplama bütçesine ve temel seçimine son derece duyarlıdır ve bir model ölçeği veya bir kıyaslama ailesi için geçerli olan bir sonuç çoğu zaman genellemez.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
Which question best defines a clear goal for using AI Training?
Bundan sonra ne izlenecek?
Yük taşıma ayrıntıları özette değil tam PDF'de yer almaktadır: hangi modeller eğitildi, hangi kıyaslamalar kullanıldı, hangi k değerleri ve en önemlisi ES ile RL'nin eşleşen hesaplamada karşılaştırılıp karşılaştırılmadığı. Ayrıca kodun yayınlanıp yayınlanmadığı, sonucun matematik dışında üretilip üretilmediği ve herhangi bir sınır laboratuvarının yöntemi benimseyip benimsemediği de izlemeye değer.
Kontrol edilecek ilk şey, makalenin tamamının deneysel kurulumu ve özellikle ES ve RL çalıştırmalarının hesaplama açısından eşleşip eşleşmediğidir. RL temel çizgisinden önemli ölçüde daha fazla eğitim hesaplaması tüketen gradyan içermeyen bir yöntem, yazarların önerdiği mekanizmayla ilgisi olmayan nedenlerden dolayı daha iyi görünebilir. Okuyucular eğitilen model boyutlarına, karşılaştırma olarak kullanılan RL algoritmasına, nesil başına pertürbasyon sayısına ve pass@k'nin ölçüldüğü k değerlerine bakmalıdır; kapsama eğrileri sıklıkla kesişir ve büyük k'da kazanan bir yöntem, k=1'de kaybedebilir.
İkincisi, kapsamı izleyin. Özetin alt kazanımlara ilişkin somut iddiası, ucuz otomatik doğrulama ve yoğun ön optimizasyona sahip bir alan olan "standart matematik kıyaslamaları" ile sınırlıdır. Kapsam avantajının kod oluşturmaya mı, bilimsel hipotez oluşturmaya mı yoksa doğrulamanın daha gürültülü olduğu ve doğruluğun ikili olmadığı açık uçlu aracı görevlere mi aktarıldığı, mevcut materyal tarafından belirlenmemiştir.
Üçüncüsü, yapıtları ve kopyaları izleyin. ArXiv listesi, ilişkili kod veya veri yayınını göstermiyor. Yayınlanan bir uygulama veya yazarlarla bağlantısı olmayan bir grup tarafından çoğaltılması, bunu bir iddiadan sonuca taşıyacaktır. Bunun yokluğunda, uygun duruş güven yerine ilgidir ve herhangi bir benimseme sinyali kendi rakamlarıyla birlikte gelmelidir.
Dördüncüsü, doğrulama sorusu, herhangi bir kapsama kazancının değerinin ne kadar olduğunu sınırlar. Daha yüksek pass@k yalnızca bir şey birçok aday arasından doğru adayı tanımlayabildiğinde yararlı çıktıya dönüşür. Matematikte ve yazılımda dama vardır; çoğu ticari uygulamada bunu yapmazlar ve daha geniş bir havuzdan doğru cevabı seçmek başlı başına çözülmemiş bir sorun haline gelir. ES tarafından eğitilmiş modelleri seçim mekanizmalarıyla eşleştiren takip çalışması, bir sonraki doğal adım olacaktır.
Son olarak yayın parçasını izleyin. Makale, belirtilen yer veya inceleme durumu olmayan bir v1 ön baskısıdır. Revizyonlar, bir konferans sunumu veya RL eğitim sonrası çeşitliliği üzerinde çalışan diğer araştırmacıların kamuya açık eleştirilerinin tümü, merkezi iddianın ne kadar ciddiye alınması gerektiğini netleştirecektir.