Haberlere Geri Dön
YenilikAI Understanding brifing

Yapay Zeka Destekli Matematik Çalışması Uzun Süredir Devam Eden Sabitin Sınırlarını Sıkılaştırıyor

Bir vaka çalışması, bir yapay zeka araştırma sisteminin Grothendieck sabitinin sınırlarını iyileştirmeye yardımcı olduğunu bildirirken yazarlar, insan araştırmacıların temel pivotu seçtiğini ve bağımsız olarak yalnızca teorem düzeyindeki sonucu doğruladığını vurguluyor.

6 min readRead the primary source
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
Long-horizon AI mathematics case study on arXiv
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.11195
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

API (Uygulama Programlama Arayüzü)
Bir yazılım sisteminin başka bir sisteme istek göndermesi ve bu sistemden yanıt alması için yapılandırılmış bir yol.
Bellek (Ajan Belleği)
Bir AI aracısının sürekliliği artırmak için adımlar veya oturumlar boyunca kullandığı kayıtlı bağlam.
Karşılaştırma
Model performansını ölçmek ve karşılaştırmak için kullanılan standartlaştırılmış bir test veya veri kümesi.
Kendinizi test edinYapay Zeka Aracıları Sınavı

Ne oldu?

Yeni bir arXiv vaka çalışması, bir yapay zeka araştırma sisteminin matematikçilerin, 1953'e kadar uzanan açık bir problem olan Grothendieck sabitinin bilinen sınırlarını iyileştirmesine nasıl yardımcı olduğunu anlatıyor. Makalede hem matematiksel sonuç hem de sistemin nerede iyi çalıştığı, insanların onu nereye yönlendirmesi gerektiği ve hangi iddiaların insan tarafından doğrulanmak yerine makine tarafından doğrulandığı konusunda ayrıntılı bir kayıt sunuluyor.

Grothendieck sabiti, zor bir kombinatoryal optimizasyon problemi ile daha kolay takip edilebilir yarı kesin bir gevşeme arasındaki boşluğu ölçer. Yazarlar alt sınırı 6pi/11, yaklaşık 1,7135 ve üst sınırı yaklaşık 1,7818 olan yeni bir aralık rapor ediyorlar. Eşlik eden matematik makalesi kanıtları sağlar. Alt sınır sonucu dikkate değerdir çünkü kesin bir örnek oluşturmaz; bunun yerine ilgili yuvarlama şemaları boyunca geçerli olan bir engel türetir.

Araştırma sistemi, bir akıl yürütme modelini bir kodlama aracısıyla birleştirdi. Makalede, çalışmanın muhakeme için GPT-5.5-Pro ​​ve daha sonra GPT-5.6-Sol, yürütme için Opus ve daha sonra Fable 5 ile Claude Code ve sayısal aramalar için dört GPU düğümü kullanıldığı belirtiliyor. Oturumlar, dosyalar, transkriptler, deney günlükleri ve iddiaları kesintisiz bir bağlama dayanmak yerine kanıtlanmış, sayısal olarak desteklenen, varsayımsal veya buluşsal olarak kaydeden bir özet aracılığıyla süreklilik taşıyordu.

Çalışma, 16 Haziran'dan 24 Temmuz'a kadar yaklaşık 240 araştırma oturumunu kapsadı; 2.091 akıl yürütme modeli çağrısı ve tahmini 5.400 ABD Doları API maliyetinde tahmini 152 milyon token. Çalışmayı yaklaşık 40 tarihli insan direktifi yönlendirdi. Üst sınır araması durağanlaştığında, operatörler tekrarlanan arızaların genel bir engele işaret edebileceğini fark ettiler ve sistemi alt sınır argümanına yönlendirdiler. Makale, araştırma yönündeki değişikliğin özerk bir karar değil, insan müdahalesi olduğunu açıklıyor.

Sistem, merkezi bir yeniden çerçeve ve 6pi/11 alt sınırı için tam bir kanıt üretti; yazarlar daha sonra bunu revize etti ve bağımsız olarak doğruladı. Aynı zamanda dahili kontrol protokolünü geçen daha güçlü sayısal üst ve alt adaylar üretti ancak yazarlar bu sertifikaları bağımsız olarak doğrulamadı ve bunları teorem olarak belirtmedi. Bu nedenle makale, doğrulanmış matematiksel sonucu sistemin daha spekülatif veya makine tarafından test edilmiş çıktılarından ayırıyor.

Kaynak ayrıntıları: Long-horizon AI mathematics case study on arXiv ↗

Neden önemli?

Çalışma, tek bir kıyaslama görevi yerine bir araştırma programı genelinde kullanılan yapay zeka hakkında alışılmadık derecede somut kanıtlar sunuyor. En önemli bulgusu bir işbölümüydü: Sistem teknik uygulama konusunda güçlüydü; insan araştırmacılar ise gündem belirleme, karar verme ve nihai doğrulamadan sorumlu olmaya devam ediyordu.

Uzun vadeli araştırmalar bir yapay zeka sistemi için zordur çünkü başarısız yaklaşımlar biriktikçe amaç değişebilir. Yararlı bir işbirlikçinin denenmiş olanı saklaması, çıkmaz bir noktayı çözülmemiş bir fikirden ayırması ve yeni bir sorunun ne zaman başka bir yerel optimizasyondan daha değerli olduğuna karar vermesi gerekir. Yazarların dosya tabanlı hafızası ve talep etiketleri, akıcı bir yanıtın ilerlemenin yerine geçmesine izin vermek yerine, araştırma durumunu görünür ve denetlenebilir kılma girişimidir.

Alt sınır keşfi, bir etmen matematiği yürütebildiğinde bile insan muhakemesinin neden hala önemli olduğunu gösteriyor. Operatörler birçok inşaat girişiminin aynı şekilde başarısız olduğunu fark ettiler ve kavramsal temeli sağladılar: Tekrarlanan engelin kendisini kanıtlayın. Sistem daha sonra argümanın resmileştirilmesine ve onaylanmasına yardımcı oldu. Bu dizi, bağımsız bir makine matematikçisinden ziyade denetimli araştırmaya daha yakındır ve kanıtın neyi desteklediğini açıklarken bu ayrım önemlidir.

Bağımsız doğrulama, sonucun çıkış kapısıdır. Vaka çalışması, alt sınırın yazarlar tarafından kontrol edildiğini ve tüm kanıtların tamamlayıcı bir makalede yer aldığını söylüyor. Koşu sırasında üretilen her sayının doğru olduğu söylenemez. Teorem düzeyindeki iddiaları, makine tarafından test edilen adayları ve hipotezleri ayrı tutmak, okuyuculara, yapay zeka sisteminin iç güvenini matematiksel kanıt olarak kabul etmeden katkıyı değerlendirme yolu sunar.

Araştırma kuruluşları için uygulamalı ders işlevseldir. Bir yapay zeka sistemi literatürü tarayabilir, kod yazabilir, deneyler yapabilir, başarısız girişimleri koruyabilir ve dönüşümler önerebilir, ancak çevreleyen iş akışının kaynağına, tekrarlanabilir hesaplamalara, açık insan kontrol noktalarına ve ekibin neden yön değiştirdiğini yeniden yapılandırmanın bir yoluna ihtiyacı vardır. Bildirilen maliyet ve bilgi işlem aynı zamanda uzun ufuk yeteneğinin yalnızca bir model zekası sorunu olmadığını da açıkça ortaya koyuyor; iskeleye, zamana ve sürekli gözetime bağlıdır.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Bundan sonra ne izlenecek?

Bir sonraki soru, bu işbirliği modelinin tek bir problem ve ekibin ötesinde genelleşip genelleşmeyeceği ve bağımsız araştırmacıların, her bir insan ve yapay zeka katkısının maliyetini ve güvenilirliğini ölçerken doğrulanmış sonucu yeniden üretip üretemeyeceğidir.

Çoğaltma, diğer matematiksel alanları, problem türlerini ve araştırma sistemlerini farklı bellek ve araç tasarımlarıyla test etmelidir. Grothendieck sorunu halihazırda insan yapımı önemli bir çerçeve, birikmiş notlar, sertifikasyon makineleri ve aday talimatlarıyla birlikte ortaya çıktı. Bu önceki yapı çalışmaya yardımcı oldu; bu nedenle gelecekteki çalışmalar, araştırma durumunun ne kadarının önceden sağlandığını ve sistemin sorunun kendisini tanımlaması gerektiğinde sonuçların nasıl değiştiğini rapor etmelidir.

Araştırmacılar ayrıca ileriye dönük ölçümler kullanarak teknik uygulamayı araştırma kararıyla karşılaştırmalıdır. Yararlı ölçümler, seçilen yönlerin kalitesini, başarısız bir yolu terk etme süresini, desteklenmeyen iddiaların oranını, insan müdahalelerinin sayısını ve bağımsız kontrolden sağ çıkan çıktıların oranını içerebilir. Gösterişli bir vaka çalışması ne olduğunu gösterebilir, ancak bir yapay zeka işbirlikçisinin başka bir inceleme katmanı eklemek yerine süreci iyileştirip iyileştirmediğini tahmin etmek için kontrollü karşılaştırmalara ihtiyaç vardır.

Makine doğrulaması ile insan doğrulaması arasındaki sınır, sürekli ilgiyi hak ediyor. Aralık aritmetiği, kanıt yardımcıları, testler ve çekişmeli denetimler birçok hatayı yakalayabilir, ancak bir sertifika yine de yanlış hedefi kodlayabilir veya hiçbir zaman sorgulanmamış varsayımlara bağlı olabilir. Takip çalışması, tüm yapıtları yayınlamalı, doğrulanmamış en güçlü sınırları yeniden çalıştırmalı ve başarısız veya geri çekilen sonuçları, başarılı sonuçlar kadar görünür hale getirmelidir.

Son olarak, lisanslama ve mahremiyetin izin verdiği ölçüde model versiyonları, istemler, yönlendirme direktifleri, kod, hesaplama ve transkriptler korunmalıdır. Mevcut makale kısmen bu koşulları rapor etmesi ve kırılgan araştırma-devlet temsili ve sınırlı yargılama özerkliği dahil olmak üzere sistemin zayıflıklarını tanımlaması nedeniyle değerlidir. Diğer ekipler modeli yeniden üretinceye kadar bu, yapay zeka destekli matematiksel ilerlemenin güçlü bir kanıtıdır, yapay zeka sistemlerinin bağımsız olarak açık uçlu araştırmalar yürütebileceğinin kanıtı değildir.

İlgili kılavuzlar ve testler

Yapay Zeka AracılarıYapay Zeka Modellerinin AçıklamasıYapay Zeka EğitimiYüksek Lisans DeğerlendirmeleriBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?