Tilbake til Nyheter
InnovasjonAI Understanding orientering

OmniPhys benchmark tester multimodal AI på fysikkresonnement og diagramgenerering

En artikkel som ble akseptert til Findings of EMNLP 2026 introduserer OmniPhys, en målestokk med 15 246 fysikkspørsmål og 19 850 bilder hentet fra kinesiske utdanningskorpora. Den evaluerer multimodale AI-systemer på både fysikkresonnement og generering av strukturerte fysikkdiagrammer.

5 min readRead the primary source
Primary-source image accompanying OmniPhys benchmark tests multimodal AI on physics reasoning and diagram generation
PrimærkildedokumentKilde registrert
Utgiver
arxiv.org
Kilde lenke
arxiv.orghttps://arxiv.org/abs/2608.25398
Kildetype
Primærdokument – en offisiell kunngjøring, papir, arkivering eller førstepartsside vi leser direkte.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

Benchmark
En standardisert test eller datasett som brukes til å måle og sammenligne modellytelse.
Merknad
Etiketter eller metadata som er lagt til mennesker, brukes til å trene eller evaluere maskinlæringsmodeller.
Robusthet
En modells evne til å opprettholde ytelsen under støy, skift eller motstridende innganger.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

Forskere introduserte OmniPhys, en multimodal designet for å evaluere hvordan AI-systemer forstår og genererer fysikkinnhold. Referansemålet spenner over ungdomsskolen gjennom problemer på universitetsnivå og kombinerer tekst, bilder, detaljerte merknader og strukturerte diagramgenereringsoppgaver.

En artikkel sendt til arXiv 26. august 2026 beskriver OmniPhys som en enhetlig målestokk for multimodal fysikkforståelse, resonnement og generering. arXiv-posten sier at papiret ble akseptert til Findings of EMNLP 2026. Det sentrale emnet er evaluering av multimodale store språkmodeller, snarere enn fysikkundervisning alene: Forfatterne designet ressursen for å teste om AI-systemer kan tolke visuelle og tekstlige fysikkproblemer og produsere relevante strukturerte utdata.

Referansen inneholder 15 246 spørsmål og 19 850 bilder hentet fra kinesiske utdanningskorpora. Avisen sier at spørsmålene spenner fra ungdomsskole til universitetsnivå, og gir ressursen et bredere vanskelighetsspekter enn en test fokusert på en enkelt aldersgruppe eller et smalt emne. Kilden identifiserer ikke de spesifikke lærebøkene, institusjonene, fagene eller den geografiske distribusjonen som er representert i disse korpuene, så omfanget av det underliggende utdanningsmaterialet er fortsatt en viktig begrensning.

OmniPhys inkluderer detaljerte merknader ment å støtte finkornet analyse av resonneringsprosesser og kunnskapsbruk. Den evaluerer også multimodale utganger i stedet for å begrense vurderingen til svar valgt fra faste alternativer eller skriftlige svar. Spesielt sier forfatterne at den måler om modeller kan generere strukturerte fysikkdiagrammer, som de beskriver som en grunnleggende del av autentisk fysikkproblemløsning. Kilden gir ikke eksempler på diagrammene, merknadsskjemaet, poengprosedyren eller antallet og identiteten til modellene brukt i de rapporterte evalueringene.

Forfatterne sier at deres omfattende evalueringer avslører kritiske hull i dagens multimodale store språkmodeller, spesielt i komplekse resonnementer og visuell generering. Kilden gir ingen poengsummer, rangeringer, modellnavn, feilrater, statistisk usikkerhet eller sammenligning med menneskelig ytelse. Den sier at kode og data er tilgjengelige, men arXiv-siden spesifiserer ikke lisensen, tilgangsprosessen eller om hver komponent i benchmarken er åpent nedlastbar.

Kildedetaljer: arxiv.org ↗

Hvorfor det betyr noe

Referansemålet adresserer et gap identifisert av forfatterne: eksisterende evalueringer tester ikke multimodal AI på fysikk eller vurderer om systemer kan produsere diagrammene som er en del av ekte fysikkproblemløsning. En delt evalueringsressurs kan gjøre svakheter i vitenskapelig resonnement og visuell generering lettere å måle.

Fysikkproblemer krever ofte et system for å kombinere skriftlige instruksjoner med diagrammer, romlige forhold, ligninger og fysiske konsepter. En som kun tester det endelige tekstsvaret kan gå glipp av om en modell tolket den visuelle informasjonen riktig eller kom frem til svaret gjennom en pålitelig resonnementkjede. OmniPhys er designet for å eksponere disse dimensjonene ved å pare multimodale spørsmål med merknader og ved å undersøke genererte diagrammer så vel som konvensjonelle svar.

Diagramgenereringskomponenten er spesielt viktig fordi diagrammer inneholder informasjon som er vanskelig å uttrykke økonomisk i prosa. En modell kan si en plausibel konklusjon mens den plasserer krefter, stråler, kretsløp, vektorer eller andre forhold feil i en visuell representasjon. Artikkelen argumenterer for at generering av strukturerte diagrammer er en del av autentisk fysikkproblemløsning, så å evaluere det kan gi lærere og forskere et mer praktisk bilde av modellevne enn nøyaktighet alene.

Offentlig utgitt kode og data kan gi modellutviklere et felles mål for å teste forbedringer i multimodal resonnement. Forskere kan bruke merknadene til å studere hvor systemer svikter: om problemet er manglende fysikkkunnskap, svak visuell tolkning, dårlig koordinering mellom språk og bilder eller manglende evne til å gjengi et strukturert diagram. Denne forskjellen er viktig for å avgjøre om bedre resultater krever nye treningsdata, endringer i modellarkitektur, forbedrede resonnementsmetoder eller mer nøye evaluering.

Benchmarkens potensial bør fortsatt behandles som en forskningspåstand i stedet for et etablert mål på generell vitenskapelig intelligens. Kilden er forfatternes papir og rapporterer ikke uavhengig replikering, distribusjonsresultater, klasseromseffekter eller bevis på at OmniPhys forutsier ytelse utenfor datasettet. Bruken av kinesiske pedagogiske korpus kan gi verdifull dekning samtidig som den skaper spørsmål om språk, læreplan, notasjon, kulturell kontekst og overføring til fysikkmateriale fra andre regioner.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

Det viktigste neste trinnet er uavhengig testing av nåværende og fremtidige multimodale modeller på OmniPhys. Viktige ukjente inkluderer benchmarkens lisensiering og tilgangsdetaljer, hvilke systemer som ble evaluert og hvordan de presterte, hvor representativt kinesisk utdanningsmateriell er for andre læreplaner, og om gevinster på OmniPhys overføres til ekte vitenskapelig arbeid.

Den mest umiddelbare utviklingen å se er utgivelsen og bruken av OmniPhys av forskere utenfor forfattergruppen. Uavhengige evalueringer bør avklare hvilke multimodale modeller som lykkes eller mislykkes, om de rapporterte gapene er store og konsistente, og om ulike skåringsmetoder gir de samme konklusjonene. Fordi kilden ikke gir noen numeriske resultater, kan leserne ennå ikke fastslå hvor mye bedre eller dårligere dagens systemer presterer på referansen eller hvilke oppgaver som er vanskeligst.

Forskere må også undersøke hvordan referanseskårene genererte diagrammer. Kilden sier at oppgaven involverer strukturerte fysikkdiagrammer, men forklarer ikke om evaluering er basert på eksakt struktur, geometriske forhold, semantisk korrekthet, visuell likhet eller menneskelig vurdering. Disse valgene kan endre rangeringen vesentlig. En modell kan produsere et diagram som ser annerledes ut enn en referanse samtidig som den bevarer de relevante fysiske relasjonene, eller matcher overflateutseendet mens den koder for et feil konsept.

Datasettets dekning og tilgangsvilkår er ytterligere spørsmål. Kilden identifiserer ikke balansen mellom utdanningsnivåer, fysikkemner, språk, bildetyper eller spørsmålsformater. Den oppgir heller ikke om kildematerialet inkluderer opphavsrettsbeskyttet innhold, hvordan diagrammer ble samlet inn eller hva brukere kan gjøre med de frigitte dataene. Disse detaljene vil påvirke reproduserbarheten og bestemme hvor bredt referansen kan tas i bruk.

Til slutt bør fremtidige studier teste om ytelse på OmniPhys tilsvarer nyttig atferd i ekte utdannings- eller vitenskapelige omgivelser. Dette inkluderer å kontrollere robustheten til ukjente diagrammer, annen notasjon, oversatte spørsmål, tvetydige bilder og problemer som ikke ligner referansematerialets kildemateriale. Artikkelen presenterer OmniPhys som en grunnleggende ressurs for multimodal intelligens i fysikk og vitenskapelige domener, men kilden fastslår ikke at suksess på den forbedrer undervisning, læring, forskning eller andre praktiske resultater.

Relaterte guider og quizer

AI-modeller forklartTransformatorerAI treningChatGPT og LLM-erTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?