Înapoi la Știri
InovațieAI Understanding briefing

Lucrarea PhysElite raportează că liderul LLM multimodal a rezolvat 33,7% din problemele de fizică la nivel de olimpiade.

Un nou etalon de 11.586 de probleme de fizică bilingve, bazate pe diagrame, raportează că cel mai puternic dintre cele 18 modele de limbaj multimodal testate a obținut doar 33,7% acuratețe a răspunsurilor.

5 min readRead the primary source
Primary-source image accompanying PhysElite paper reports that leading multimodal LLM solved 33.7% of Olympiad-level physics problems
Document sursă primarăSursa înregistrată
Editor
arxiv.org
Link sursă
arxiv.orghttps://arxiv.org/abs/2608.25097
Tip sursă
Document principal — un anunț oficial, hârtie, depunere sau pagină primară pe care o citim direct.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

Model de limbă mare (LLM)
Un model de limbaj instruit pe corpuri de text masive pentru a genera și analiza text.
Benchmark
Un test standardizat sau un set de date utilizat pentru a măsura și compara performanța modelului.
Setul de date
O colecție de exemple structurate sau nestructurate utilizate pentru instruire, validare sau testare.
Testează-teTest explicativ pentru modelele AI

Ce sa întâmplat

Cercetătorii au introdus PhysElite, un multimodal bilingv conceput pentru a testa modele mari de limbaj pe probleme de fizică la nivel de olimpiade. Setul de date conține 11.586 de probleme, diagrame vizuale, derivări de soluții chineză-engleză și răspunsuri finale. Lucrarea raportează rezultatele evaluărilor a 18 modele de limbaj multimodal open-source și closed-source, cel mai puternic model atingând o acuratețe a răspunsurilor de 33,7%.

Lucrarea prezintă PhysElite ca un punct de referință pentru raționamentul fizic la nivel de olimpiade prin modele multimodale de limbaj mari. A fost trimis la arXiv pe 25 august 2026. Autorii susțin că reperele fizice existente sunt limitate deoarece nu conțin suficiente probleme de mare dificultate și nu acoperă în mod cuprinzător informațiile vizuale, domeniile de cunoaștere a fizicii și procesele de rezolvare pas cu pas.

Conform rezumatului lucrării, PhysElite conține 11.586 de probleme de nivel olimpic atât în ​​chineză, cât și în engleză. Fiecare problemă este asociată cu o diagramă vizuală, o derivare bilingvă împărțită în pași și un răspuns final. Sursa spune că setul de date a fost lansat, deși textul furnizat nu include linkul de destinație și nu descrie cerințele de licență, format sau acces.

Autorii au evaluat 18 modele de limbaj multimodal, inclusiv sisteme open-source și closed-source. Cel mai puternic model a atins o precizie de răspuns de 33,7%. Cercetătorii au efectuat, de asemenea, o evaluare a procesului la nivel de etapă pentru a identifica unde modelele au eșuat într-un lanț de raționament. Sursa nu furnizează numele modelelor, numărul de încercări per problemă, regulile de punctare sau rezultatele detaliate după tipul de problemă.

Detalii sursa: arxiv.org ↗

De ce contează

Rezultatul sugerează că performanța puternică la testele existente de fizică sau de raționament general s-ar putea să nu se traducă în soluții fiabile pentru probleme de fizică dificile, dependente de diagramă, cu mai mulți pași. PhysElite are scopul de a face aceste puncte slabe mai vizibile prin evaluarea atât a răspunsurilor finale, cât și a etapelor individuale ale procesului de raționament al unui model.

-ul abordează o slăbiciune practică în modul în care sistemele de raționament AI sunt adesea evaluate. Un model poate produce explicații fluente sau poate funcționa bine la întrebări mai scurte, în timp ce eșuează atunci când trebuie să interpreteze o diagramă, să selecteze principii fizice relevante, să efectueze mai multe deducții legate și să ajungă la un răspuns exact. PhysElite este conceput în jurul acelei provocări combinate, mai degrabă decât să trateze fizica ca răspunsuri la întrebări doar text.

Rezultatul raportat de 33,7% este consecință, deoarece pune o limită clară a ceea ce au demonstrat sistemele testate pentru această sarcină deosebit de dificilă. Nu arată că modelele de limbaj multimodal sunt incapabile să rezolve fizica olimpiadei și nu stabilește că fiecare model are performanțe la același nivel. Acesta arată, conform lucrării, că nici cel mai puternic sistem evaluat nu a rezolvat corect majoritatea problemelor de referință.

Evaluarea la nivel de etapă ar putea fi mai utilă decât un singur scor final pentru cercetători și utilizatori. Dacă eșecurile apar în principal în timpul interpretării diagramelor, selectării ecuațiilor, efectuării calculelor sau conectării rezultatelor intermediare, dezvoltatorii pot fi capabili să vizeze aceste puncte slabe mai precis. Sursa furnizată nu precizează care etape au produs cele mai multe erori, astfel încât valoarea de diagnosticare a -ului nu poate fi încă evaluată în detaliu.

Pentru public, descoperirile oferă o atenție împotriva tratării sistemelor AI de uz general ca înlocuitori de încredere pentru raționamentul expert în fizică. Un sistem care oferă o soluție în mai mulți pași plauzibilă, dar incorectă, poate fi dificil de verificat pentru un neexpert. Designul bilingv și vizual al -ului poate ajuta, de asemenea, să dezvăluie limitările care sunt ascunse de evaluările axate pe text în limba engleză sau pe formate scurte de răspuns final.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificare interactivă a conceptului+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Ce să urmărești în continuare

Principalele întrebări sunt dacă setul de date și codul de evaluare sunt suficient de accesibile pentru replicarea independentă, modul în care performanța variază în funcție de subiectele de fizică și formatele vizuale și dacă modelele viitoare se îmbunătățesc pe fără a se baza pe soluții memorate. Sursa nu identifică modelele testate și nici nu furnizează defalcarea evaluării, astfel încât 33,7% raportate nu ar trebui folosite pentru a clasifica anumite sisteme.

Replicarea independentă este testul imediat. Cercetătorii vor trebui să inspecteze problemele lansate, diagramele, soluțiile și procedurile de notare pentru a determina dacă -ul nu conține ambiguități, elemente duplicate sau alți factori care ar putea afecta rezultatele. Sursa confirmă o lansare a unui set de date, dar nu oferă suficiente informații pentru a evalua accesibilitatea sau reproductibilitatea acestuia.

Acoperirea viitoare ar trebui să arate modul în care cifra de 33,7% se defalcă pe subiecte de fizică, niveluri de dificultate, tipuri de diagrame, limbi și formate de răspuns. De asemenea, este important să știți dacă modelele primesc aceleași solicitări, dacă instrumente precum calculatoarele sunt permise și cum este gestionat creditul parțial. Niciunul dintre aceste detalii nu apare în sursa furnizată.

-ul poate deveni mai informativ dacă evaluările ulterioare compară versiunile modelului în timp și raportează atât acuratețea răspunsului final, cât și fiabilitatea la nivel de pas. Cercetătorii ar trebui să examineze, de asemenea, dacă modelele pot recunoaște incertitudinea, pot identifica pași intermediari incorecți sau pot solicita clarificări atunci când o diagramă este ambiguă. Rezumatul lucrării nu raportează aceste comportamente.

Cea mai importantă necunoscută este cât de reprezentativă este PhysElite pentru activitatea fizică reală. Problemele la olimpiade sunt dificile în mod intenționat și pot să nu reflecte exerciții în clasă, analize de laborator, proiectare inginerească sau practica de cercetare. Sursa stabilește domeniul de aplicare al -ului și rezultatul raportat, dar nu stabilește modul în care performanța pe PhysElite prezice performanța în acele alte setări.

Luate împreună, descrierea disponibilă susține o interpretare limitată a rezultatului. Cifra de 33,7% aparține evaluării raportate a acurateței răspunsurilor a celor 18 modele de limbaj multimodal testate pe acest . Ar trebui citit împreună cu problemele bilingve ale setului de date, diagramele vizuale, derivările și răspunsurile finale, precum și evaluarea separată a procesului la nivel de etapă. Deoarece sursa furnizată nu include nume de model, reguli de punctare, număr de încercări, defalcări ale subiectelor sau codul de evaluare, cititorii nu pot folosi singur rezumatul pentru a reconstrui comparația sau pentru a determina care părți ale sarcinii au determinat rezultatul. Aceste detalii lipsă sunt, prin urmare, esențiale pentru înțelegerea rapoartelor ulterioare despre PhysElite.

Ghiduri și chestionare conexe

Modelele AI explicateTransformatoareAntrenament AIEtica IATestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a lansării modelului AI
Ai găsit asta util?