Haberlere Geri Dön
YenilikAI Understanding brifing

PhysElite makalesi, önde gelen multimodal LLM'nin Olimpiyat düzeyindeki fizik problemlerinin %33,7'sini çözdüğünü bildiriyor

11.586 adet iki dilli, diyagrama dayalı fizik probleminden oluşan yeni bir kıyaslama, test edilen 18 çok modlu dil modelinin en güçlüsünün yalnızca %33,7 oranında yanıt doğruluğuna ulaştığını bildirmektedir.

5 min readRead the primary source
Primary-source image accompanying PhysElite paper reports that leading multimodal LLM solved 33.7% of Olympiad-level physics problems
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.25097
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Büyük Dil Modeli (LLM)
Metin oluşturmak ve analiz etmek için çok büyük metin toplulukları üzerinde eğitilmiş bir dil modeli.
Karşılaştırma
Model performansını ölçmek ve karşılaştırmak için kullanılan standartlaştırılmış bir test veya veri kümesi.
Veri kümesi
Eğitim, doğrulama veya test için kullanılan yapılandırılmış veya yapılandırılmamış örneklerden oluşan bir koleksiyon.
Kendinizi test edinYapay Zeka Modelleri Açıklaması Testi

Ne oldu?

Araştırmacılar, Olimpiyat düzeyindeki fizik problemlerinde büyük dil modellerini test etmek için tasarlanmış iki dilli, çok modlu bir kıyaslama olan PhysElite'ı tanıttı. Veri seti 11.586 problemi, görsel diyagramları, Çince-İngilizce çözüm türetmelerini ve nihai cevapları içermektedir. Makale raporları, 18 açık kaynak ve kapalı kaynak çok modlu dil modelinin değerlendirilmesinden kaynaklanmaktadır ve en güçlü model %33,7 yanıt doğruluğuna ulaşmaktadır.

Makale, PhysElite'ı, çok modlu büyük dil modelleriyle Olimpiyat düzeyindeki fizik muhakemesi için bir referans noktası olarak sunuyor. 25 Ağustos 2026'da arXiv'ye sunuldu. Yazarlar, mevcut fizik kıyaslamalarının, yeterince yüksek zorluktaki problemleri içermemesi ve görsel bilgileri, fizik bilgi alanlarını ve adım adım çözüm süreçlerini kapsamlı bir şekilde kapsamaması nedeniyle sınırlı olduğunu savunuyorlar.

Makalenin özetine göre PhysElite, hem Çince hem de İngilizce olarak 11.586 Olimpiyat düzeyinde problem içeriyor. Her problem görsel bir diyagramla, adımlara ayrılmış iki dilli bir türetmeyle ve son bir cevapla eşleştirilir. Kaynak, veri kümesinin yayınlandığını söylüyor ancak sağlanan metin hedef bağlantıyı içermiyor veya lisansını, biçimini veya erişim gereksinimlerini tanımlamıyor.

Yazarlar, hem açık kaynak hem de kapalı kaynak sistemler dahil olmak üzere 18 çok modlu dil modelini değerlendirdiler. En güçlü model %33,7 cevap doğruluğuna ulaştı. Araştırmacılar ayrıca modellerin bir akıl yürütme zincirinde nerede başarısız olduğunu belirlemek için adım düzeyinde süreç değerlendirmesi gerçekleştirdiler. Kaynak, modellerin adlarını, problem başına deneme sayısını, puanlama kurallarını veya problem türüne göre ayrıntılı sonuçları sağlamıyor.

Kaynak ayrıntıları: arxiv.org ↗

Neden önemli?

Sonuç, mevcut fizik veya genel akıl yürütme testlerindeki güçlü performansın zor, diyagrama bağlı, çok adımlı fizik problemleri için güvenilir çözümlere dönüşmeyebileceğini göstermektedir. PhysElite, hem nihai yanıtları hem de modelin muhakeme sürecinin bireysel aşamalarını değerlendirerek bu zayıflıkları daha görünür hale getirmeyi amaçlamaktadır.

Karşılaştırma, yapay zeka muhakeme sistemlerinin sıklıkla nasıl değerlendirildiği konusundaki pratik zayıflığı ele alıyor. Bir model, akıcı açıklamalar üretebilir veya daha kısa sorularda iyi performans gösterebilir ancak bir diyagramı yorumlaması, ilgili fiziksel ilkeleri seçmesi, bağlantılı birkaç çıkarım yapması ve kesin bir cevaba ulaşması gerektiğinde hala başarısız olabilir. PhysElite, fiziği yalnızca metinden oluşan soru yanıtları olarak ele almak yerine, bu birleşik zorluk etrafında tasarlanmıştır.

Bildirilen %33,7'lik sonuç sonuç niteliğindedir çünkü test edilen sistemlerin bu özel yüksek zorluktaki görevde gösterdiği performansa net bir sınır getirmektedir. Çok modlu dil modellerinin Olimpiyat fiziğini çözmede yetersiz olduğunu göstermez ve her modelin aynı düzeyde performans gösterdiğini ortaya koymaz. Makaleye göre bu, değerlendirilen en güçlü sistemin bile çoğu kıyaslama problemini doğru şekilde çözemediğini gösteriyor.

Adım düzeyindeki değerlendirme, araştırmacılar ve kullanıcılar için tek bir nihai puandan daha yararlı olabilir. Başarısızlıklar çoğunlukla diyagramları yorumlarken, denklemleri seçerken, hesaplamaları yaparken veya ara sonuçları bağlarken meydana gelirse, geliştiriciler bu zayıflıkları daha kesin bir şekilde hedefleyebilir. Sağlanan kaynak hangi aşamaların en fazla hatayı ürettiğini belirtmiyor, bu nedenle kıyaslamanın teşhis değeri henüz ayrıntılı olarak değerlendirilemiyor.

Bulgular, kamuoyuna, genel amaçlı yapay zeka sistemlerini uzman fizik muhakemesinin güvenilir alternatifleri olarak görmeye karşı bir uyarı sunuyor. Makul ancak yanlış çok adımlı çözüm sunan bir sistemi, uzman olmayan birinin kontrol etmesi zor olabilir. Karşılaştırmalı değerlendirmenin iki dilli ve görsel tasarımı, İngilizce metin veya kısa son cevap formatlarına odaklanan değerlendirmelerin gizlediği sınırlamaların ortaya çıkarılmasına da yardımcı olabilir.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Bundan sonra ne izlenecek?

Ana sorular, veri kümesinin ve değerlendirme kodunun bağımsız çoğaltma için yeterince erişilebilir olup olmadığı, performansın fizik konuları ve görsel formatlar arasında nasıl değiştiği ve gelecekteki modellerin ezberlenmiş çözümlere dayanmadan karşılaştırmalı değerlendirmede gelişip gelişmediğidir. Kaynak, test edilen modelleri tanımlamamakta veya değerlendirme dökümünü sağlamamaktadır; dolayısıyla rapor edilen %33,7'lik oran, belirli sistemleri sıralamak için kullanılmamalıdır.

Bağımsız çoğaltma acil testtir. Araştırmacıların, karşılaştırmanın belirsizliklerden, tekrarlanan öğelerden veya sonuçları etkileyebilecek diğer faktörlerden arınmış olup olmadığını belirlemek için yayımlanan sorunları, diyagramları, çözümleri ve puanlama prosedürlerini incelemeleri gerekecektir. Kaynak, bir veri kümesinin yayınlandığını doğruluyor ancak erişilebilirliğini veya tekrarlanabilirliğini değerlendirmek için yeterli bilgi sağlamıyor.

Gelecekteki kapsam, %33,7'lik rakamın fizik konularına, zorluk seviyelerine, diyagram türlerine, dillere ve cevap formatlarına göre nasıl dağıldığını göstermelidir. Modellerin aynı istemleri alıp almadığını, hesap makinesi gibi araçlara izin verilip verilmediğini ve kısmi kredinin nasıl ele alındığını bilmek de önemlidir. Bu ayrıntıların hiçbiri sağlanan kaynakta görünmüyor.

Daha sonraki değerlendirmeler zaman içindeki model versiyonlarını karşılaştırırsa ve hem nihai yanıtın doğruluğunu hem de adım düzeyindeki güvenilirliği rapor ederse, kıyaslama daha bilgilendirici hale gelebilir. Araştırmacılar ayrıca modellerin belirsizliği tanıyıp tanıyamadığını, yanlış ara adımları tanımlayıp tanımlayamadığını veya bir diyagram belirsiz olduğunda açıklama isteyip istemediğini de incelemelidir. Makalenin özeti bu davranışları bildirmiyor.

Bilinmeyen en önemli şey PhysElite'ın gerçek fizik çalışmasını ne kadar temsil ettiğidir. Olimpiyat problemleri kasıtlı olarak zordur ve sınıf içi alıştırmaları, laboratuvar analizlerini, mühendislik tasarımlarını veya araştırma uygulamalarını yansıtmayabilir. Kaynak, kıyaslamanın kapsamını ve bildirilen sonucu belirler, ancak PhysElite performansının diğer ayarlardaki performansı nasıl tahmin ettiğini belirlemez.

Birlikte ele alındığında mevcut açıklama, sonucun sınırlı bir yorumunu desteklemektedir. %33,7'lik rakam, bu kıyaslamada test edilen 18 çok modlu dil modelinin rapor edilen cevap-doğruluk değerlendirmesine aittir. Veri kümesinin iki dilli problemleri, görsel diyagramları, türevleri ve nihai cevaplarının yanı sıra ayrı adım düzeyindeki süreç değerlendirmesiyle birlikte okunmalıdır. Sağlanan kaynak model adlarını, puanlama kurallarını, deneme sayılarını, konu dökümlerini veya değerlendirme kodunu içermediğinden, okuyucular karşılaştırmayı yeniden oluşturmak veya görevin hangi bölümlerinin sonuca yol açtığını belirlemek için özeti tek başına kullanamaz. Dolayısıyla bu eksik ayrıntılar, PhysElite hakkında sonraki raporların anlaşılması açısından merkezi öneme sahiptir.

İlgili kılavuzlar ve testler

Yapay Zeka Modellerinin AçıklamasıTransformatörlerYapay Zeka EğitimiYapay Zeka EtiğiBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınAI modeli sürüm izleyicisini takip edin
Bunu yararlı buldunuz mu?