Ne oldu?
Araştırmacılar, Olimpiyat düzeyindeki fizik problemlerinde büyük dil modellerini test etmek için tasarlanmış iki dilli, çok modlu bir kıyaslama olan PhysElite'ı tanıttı. Veri seti 11.586 problemi, görsel diyagramları, Çince-İngilizce çözüm türetmelerini ve nihai cevapları içermektedir. Makale raporları, 18 açık kaynak ve kapalı kaynak çok modlu dil modelinin değerlendirilmesinden kaynaklanmaktadır ve en güçlü model %33,7 yanıt doğruluğuna ulaşmaktadır.
Makale, PhysElite'ı, çok modlu büyük dil modelleriyle Olimpiyat düzeyindeki fizik muhakemesi için bir referans noktası olarak sunuyor. 25 Ağustos 2026'da arXiv'ye sunuldu. Yazarlar, mevcut fizik kıyaslamalarının, yeterince yüksek zorluktaki problemleri içermemesi ve görsel bilgileri, fizik bilgi alanlarını ve adım adım çözüm süreçlerini kapsamlı bir şekilde kapsamaması nedeniyle sınırlı olduğunu savunuyorlar.
Makalenin özetine göre PhysElite, hem Çince hem de İngilizce olarak 11.586 Olimpiyat düzeyinde problem içeriyor. Her problem görsel bir diyagramla, adımlara ayrılmış iki dilli bir türetmeyle ve son bir cevapla eşleştirilir. Kaynak, veri kümesinin yayınlandığını söylüyor ancak sağlanan metin hedef bağlantıyı içermiyor veya lisansını, biçimini veya erişim gereksinimlerini tanımlamıyor.
Yazarlar, hem açık kaynak hem de kapalı kaynak sistemler dahil olmak üzere 18 çok modlu dil modelini değerlendirdiler. En güçlü model %33,7 cevap doğruluğuna ulaştı. Araştırmacılar ayrıca modellerin bir akıl yürütme zincirinde nerede başarısız olduğunu belirlemek için adım düzeyinde süreç değerlendirmesi gerçekleştirdiler. Kaynak, modellerin adlarını, problem başına deneme sayısını, puanlama kurallarını veya problem türüne göre ayrıntılı sonuçları sağlamıyor.
Kaynak ayrıntıları: arxiv.org ↗
Neden önemli?
Sonuç, mevcut fizik veya genel akıl yürütme testlerindeki güçlü performansın zor, diyagrama bağlı, çok adımlı fizik problemleri için güvenilir çözümlere dönüşmeyebileceğini göstermektedir. PhysElite, hem nihai yanıtları hem de modelin muhakeme sürecinin bireysel aşamalarını değerlendirerek bu zayıflıkları daha görünür hale getirmeyi amaçlamaktadır.
Karşılaştırma, yapay zeka muhakeme sistemlerinin sıklıkla nasıl değerlendirildiği konusundaki pratik zayıflığı ele alıyor. Bir model, akıcı açıklamalar üretebilir veya daha kısa sorularda iyi performans gösterebilir ancak bir diyagramı yorumlaması, ilgili fiziksel ilkeleri seçmesi, bağlantılı birkaç çıkarım yapması ve kesin bir cevaba ulaşması gerektiğinde hala başarısız olabilir. PhysElite, fiziği yalnızca metinden oluşan soru yanıtları olarak ele almak yerine, bu birleşik zorluk etrafında tasarlanmıştır.
Bildirilen %33,7'lik sonuç sonuç niteliğindedir çünkü test edilen sistemlerin bu özel yüksek zorluktaki görevde gösterdiği performansa net bir sınır getirmektedir. Çok modlu dil modellerinin Olimpiyat fiziğini çözmede yetersiz olduğunu göstermez ve her modelin aynı düzeyde performans gösterdiğini ortaya koymaz. Makaleye göre bu, değerlendirilen en güçlü sistemin bile çoğu kıyaslama problemini doğru şekilde çözemediğini gösteriyor.
Adım düzeyindeki değerlendirme, araştırmacılar ve kullanıcılar için tek bir nihai puandan daha yararlı olabilir. Başarısızlıklar çoğunlukla diyagramları yorumlarken, denklemleri seçerken, hesaplamaları yaparken veya ara sonuçları bağlarken meydana gelirse, geliştiriciler bu zayıflıkları daha kesin bir şekilde hedefleyebilir. Sağlanan kaynak hangi aşamaların en fazla hatayı ürettiğini belirtmiyor, bu nedenle kıyaslamanın teşhis değeri henüz ayrıntılı olarak değerlendirilemiyor.
Bulgular, kamuoyuna, genel amaçlı yapay zeka sistemlerini uzman fizik muhakemesinin güvenilir alternatifleri olarak görmeye karşı bir uyarı sunuyor. Makul ancak yanlış çok adımlı çözüm sunan bir sistemi, uzman olmayan birinin kontrol etmesi zor olabilir. Karşılaştırmalı değerlendirmenin iki dilli ve görsel tasarımı, İngilizce metin veya kısa son cevap formatlarına odaklanan değerlendirmelerin gizlediği sınırlamaların ortaya çıkarılmasına da yardımcı olabilir.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
Which component of an AI application is the machine-learning model itself?
Bundan sonra ne izlenecek?
Ana sorular, veri kümesinin ve değerlendirme kodunun bağımsız çoğaltma için yeterince erişilebilir olup olmadığı, performansın fizik konuları ve görsel formatlar arasında nasıl değiştiği ve gelecekteki modellerin ezberlenmiş çözümlere dayanmadan karşılaştırmalı değerlendirmede gelişip gelişmediğidir. Kaynak, test edilen modelleri tanımlamamakta veya değerlendirme dökümünü sağlamamaktadır; dolayısıyla rapor edilen %33,7'lik oran, belirli sistemleri sıralamak için kullanılmamalıdır.
Bağımsız çoğaltma acil testtir. Araştırmacıların, karşılaştırmanın belirsizliklerden, tekrarlanan öğelerden veya sonuçları etkileyebilecek diğer faktörlerden arınmış olup olmadığını belirlemek için yayımlanan sorunları, diyagramları, çözümleri ve puanlama prosedürlerini incelemeleri gerekecektir. Kaynak, bir veri kümesinin yayınlandığını doğruluyor ancak erişilebilirliğini veya tekrarlanabilirliğini değerlendirmek için yeterli bilgi sağlamıyor.
Gelecekteki kapsam, %33,7'lik rakamın fizik konularına, zorluk seviyelerine, diyagram türlerine, dillere ve cevap formatlarına göre nasıl dağıldığını göstermelidir. Modellerin aynı istemleri alıp almadığını, hesap makinesi gibi araçlara izin verilip verilmediğini ve kısmi kredinin nasıl ele alındığını bilmek de önemlidir. Bu ayrıntıların hiçbiri sağlanan kaynakta görünmüyor.
Daha sonraki değerlendirmeler zaman içindeki model versiyonlarını karşılaştırırsa ve hem nihai yanıtın doğruluğunu hem de adım düzeyindeki güvenilirliği rapor ederse, kıyaslama daha bilgilendirici hale gelebilir. Araştırmacılar ayrıca modellerin belirsizliği tanıyıp tanıyamadığını, yanlış ara adımları tanımlayıp tanımlayamadığını veya bir diyagram belirsiz olduğunda açıklama isteyip istemediğini de incelemelidir. Makalenin özeti bu davranışları bildirmiyor.
Bilinmeyen en önemli şey PhysElite'ın gerçek fizik çalışmasını ne kadar temsil ettiğidir. Olimpiyat problemleri kasıtlı olarak zordur ve sınıf içi alıştırmaları, laboratuvar analizlerini, mühendislik tasarımlarını veya araştırma uygulamalarını yansıtmayabilir. Kaynak, kıyaslamanın kapsamını ve bildirilen sonucu belirler, ancak PhysElite performansının diğer ayarlardaki performansı nasıl tahmin ettiğini belirlemez.
Birlikte ele alındığında mevcut açıklama, sonucun sınırlı bir yorumunu desteklemektedir. %33,7'lik rakam, bu kıyaslamada test edilen 18 çok modlu dil modelinin rapor edilen cevap-doğruluk değerlendirmesine aittir. Veri kümesinin iki dilli problemleri, görsel diyagramları, türevleri ve nihai cevaplarının yanı sıra ayrı adım düzeyindeki süreç değerlendirmesiyle birlikte okunmalıdır. Sağlanan kaynak model adlarını, puanlama kurallarını, deneme sayılarını, konu dökümlerini veya değerlendirme kodunu içermediğinden, okuyucular karşılaştırmayı yeniden oluşturmak veya görevin hangi bölümlerinin sonuca yol açtığını belirlemek için özeti tek başına kullanamaz. Dolayısıyla bu eksik ayrıntılar, PhysElite hakkında sonraki raporların anlaşılması açısından merkezi öneme sahiptir.