Haberlere Geri Dön
YenilikAI Understanding brifing

Epoch AI, Apéry tarzı matematik karşılaştırma probleminin insan artı yapay zeka işbirliğiyle çözüldüğünü gösteriyor

Epoch AI, FrontierMath testinin "Doğrusal Yinelemeler Yoluyla Apéry Tarzı Mantıksızlık Kanıtları" sorununun artık çözülmüş olarak listelendiğini, ancak yalnızca modelin aktif insan yönlendirmesini yansıtan yeni bir "insan + yapay zeka" etiketi altında listelendiğini duyurdu.

4 min readRead the linked source
Source-provided image accompanying Epoch AI marks Apéry‑style math benchmark problem solved with human‑plus‑AI collaboration
Kaynak referansıKaynak kaydedildi
Yayıncı
startupfortune.com
Kaynak bağlantısı
startupfortune.comhttps://startupfortune.com/an-ai-math-benchmark-problem-on-apry-style-proofs-just-got-marked-solved/
Kaynak türü
Bağlantılı kaynak — birincil kaynak durumu belirlenmedi.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Karşılaştırma
Model performansını ölçmek ve karşılaştırmak için kullanılan standartlaştırılmış bir test veya veri kümesi.
Yapay Zeka Güvenliği
Yapay zeka sistemlerinde zararlı davranışları, arızaları ve kötüye kullanım risklerini azaltmaya odaklanan bir alan.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

Epoch AI'nın FrontierMath kıyaslaması artık Apéry tarzı irrasyonelliğe dayanıklı sorunu çözülmüş olarak listeliyor ve klasik ζ(3) yerine ζ(5)'in irrasyonelliğini kanıtlayan insan-yapay zeka ortaklığına itibar ediliyor. Çözüm, Yalın biçimlendirmeyle ön baskı olarak yayınlandı, ancak şirket, kanıtın, başlangıçta gerekli olan karşılaştırmalı değerlendirmenin Apéry tarzı formatına uymadığını belirtiyor. Bu nüansı yakalamak için Epoch AI, 16 Eylül'de bir kişinin bir modeli otonom olarak başarılı olamayacak yinelenen adımlarla yönlendirdiği durumlar için bir "insan + yapay zeka" etiketini tanıttı.

Epoch AI'nin ezberlemeye ve kalıp eşleştirmeye direnmek için tasarlanan FrontierMath platformu, artık 49 açık problemi kaydediyor ve dokuzu çözülmüş olarak işaretleniyor; dördü tamamen özerk ve beşi yeni oluşturulan "insan + yapay zeka" kategorisi altında. Apéry tarzı problem, ortak bir çabanın ζ(5)'in irrasyonelliğine dair bir kanıt üretmesinin ardından ikinci gruba katılıyor. Çözüm, Yalın biçimlendirmeyi içeren bir ön baskıda belgelendi, ancak yazarlar kanıtın, başlangıçta aranan kriterin Apéry tarzı doğrusal yineleme yapısıyla eşleşmediğini kabul ediyor.

Şirketin 16 Eylül'deki politika değişikliği, bir insanın bir modeli yinelemeli olarak yönlendirdiği senaryoları yakalamak için "insan + yapay zeka" etiketini uygulamaya koydu; bu rehberlik olmasaydı muhtemelen başarılı olamayacak bir süreçti. Epoch AI'nin kendi sayfası, uyumsuzluğa rağmen sorunu çözülmüş olarak listeliyor ve yapay zekanın bağımsız yeteneklerinin yanlış yorumlanmasını önlemek için etiketin önemini vurguluyor.

Duyuru, GPT‑6 Astra'nın Tier 4'e neredeyse doygunluğa ulaşması (%97,6 doğrulukla rapor edilmiştir) ve onaya dayalı komite seçimi sorununun "insan + yapay zeka" çözümü gibi diğer güncel FrontierMath kilometre taşlarının ardından geldi. Bu daha büyük ilerlemeler, karşılaştırmalı değerlendirmenin hem otonom hem de destekli yapay zeka muhakemesini izlemedeki rolünün altını çiziyor.

Kaynak ayrıntıları: startupfortune.com ↗

Neden önemli?

Duyuru, kıyaslama tasarımcılarının gerçek otonom akıl yürütmeyi destekli model kullanımından ayırmak için nasıl uyum sağladıklarını gösteriyor; bu, matematikte gerçek yapay zeka ilerlemesini değerlendirmek için önemli bir ayrımdır. Epoch AI, ayrı bir etiket oluşturarak yapay zeka yeteneklerinin abartılmasını önler ve araştırmacılara, modellerin hâlâ insan yönlendirmesine ihtiyaç duyduğu noktalara dair daha net bir resim sunar. Bu şeffaflık, yatırımcıların, akademik meslektaşların ve rakiplerin yapay zeka muhakeme sistemlerinin olgunluğunu nasıl değerlendirdiğini etkiler ve kısayol stratejilerini cezalandırmayı amaçlayan gelecekteki kıyaslama tasarımlarını şekillendirebilir.

Otonom performansı destekli performanstan ayırmak, yapay zekanın insan girişi olmadan orijinal matematiksel akıl yürütme becerisi hakkında gerçekçi beklentiler oluşturmak için çok önemlidir. Yapay zeka başarılarının abartılması, finansmanın yanlış tahsis edilmesine, zamanından önce devreye alınmasına ve yapay zeka güvenliği ve güvenilirliğine ilişkin yanlış değerlendirmelere dayalı politika kararlarına yol açabilir.

Yeni etiketleme şeması, model yeteneklerini değerlendiren araştırmacılar için daha ayrıntılı bir ölçüm sağlıyor ve insan uyarıları olmadan gerçekten akıl yürütebilen sistemlerin geliştirilmesini teşvik ediyor. Aynı zamanda diğer kıyaslama yaratıcılarının da benzer ayrımları benimsemeleri için bir şablon sunarak yapay zeka ilerlemesinin raporlanmasına yönelik sektör çapında standartları teşvik ediyor.

Yatırımcılar ve kurumsal stratejistler için bu açıklama, karmaşık sorunları bağımsız olarak çözebilen modeller ile hâlâ ağırlıklı olarak uzman rehberliğine dayanan modeller arasında ayrım yapılmasına yardımcı oluyor ve daha fazla araştırma ve ürün geliştirme için kaynakların nereye tahsis edileceğine ilişkin kararları etkiliyor.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Gelecekteki FrontierMath güncellemeleri, "insan + yapay zeka" kategorisinin genişleyip genişlemeyeceğini ve kalan kaç açık sorunun bu etiket altında çözülmemiş durumdan çözülmüş duruma geçeceğini ortaya çıkaracak. Gözlemciler aynı zamanda diğer yapay zeka laboratuvarlarının kıyaslama sonuçlarını nasıl raporladığını (benzer etiketlemeyi benimseyip benimsemediklerini veya otonom atılımlar iddia edip etmediklerini) ve topluluğun "otonom" ve "yardımlı" yapay zeka performansı için standartlaştırılmış tanımları benimseyip benimsemediğini izlemeli.

Daha işbirlikçi çözümler ortaya çıktıkça ek FrontierMath sorunlarının "insan + yapay zeka" etiketi altında yeniden sınıflandırılıp sınıflandırılmayacağı.

Rakip yapay zeka laboratuvarları karşılaştırılabilir etiketlemeyle kendi kıyaslama sonuçlarını yayınlamaya başlarsa, bu durum potansiyel olarak yardımlı ve otonom çözümlerin raporlanması için fiili bir endüstri standardına yol açabilir.

Bu etiketlemenin, döngüdeki insan yaklaşımlarını vurgulayan şirketlere karşı otonom matematiksel akıl yürütmeye odaklanan şirketler için gelecekteki finansman turları üzerindeki etkisi.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıYapay Zeka EtiğiYapay Zekanın GeleceğiBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?