Tillbaka till Nyheter
InnovationAI Understanding genomgång

Granskning av ett OpenAI AI-genererat bevis hittar ett omvänt tillstånd och publicerar en reparation

Två forskare säger att ett lemmabevis i kapitel 6 i OpenAIs matematikdokument har ett polaritetsfel: ett test i termer av genomsnittlig framgång där nästa steg kräver ett stort villkorligt misslyckande. De ger ett motexempel och ett korrigerat bevis, och varnar för att detta inte är verifiering av kapitlets huvudsats.

7 min readRead the primary source
Source-page capture accompanying Audit of an OpenAI AI-Generated Proof Finds a Reversed Condition, and Publishes a Repair
Primärt källdokumentKälla inspelad
Förläggare
arxiv.org
Källlänk
arxiv.orghttps://arxiv.org/abs/2608.14673
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

Artificiell intelligens (AI)
Det breda fältet för att bygga system som utför uppgifter som kräver mönsterigenkänning, resonemang, språk eller beslutsfattande.
Algoritm
En definierad uppsättning regler eller steg som en dator följer för att lösa ett problem eller slutföra en uppgift.
Citat
Referenser till källpassager eller dokument som ingår i en modells svar för att stödja dess påståenden.
Testa dig självAI Models Explained Quiz

Vad hände

En åtta sidor lång anteckning som postades till arXiv den 3 augusti 2026 rapporterar att det tryckta beviset på ett girigt konditioneringslemma i kapitel 6 i OpenAIs tio framsteg i matematik och teoretisk datavetenskap vänder ett tillstånd mellan komplementära händelser. Författarna säger att lemmas påstående är korrekt, ger ett motexempel till den tryckta proceduren och ger ett korrigerat bevis som de beskriver som en lokal reparation.

En kort anteckning postad till arXiv den 3 augusti 2026 av Mikołaj Sienicki och Krzysztof Sienicki rapporterar ett fel i det tryckta beviset på ett lemma i kapitel 6 i ett OpenAI dokument med titeln Ten Advances in Mathematics and Theoretical Computer Science. arXiv-listan (2608.14673) är arkiverad under Artificiell intelligens och korslistad till Quantum Physics, och dess metadata beskriver en åttasidig uppsats med fem referenser. Enligt anteckningen gör kapitlet anspråk på en exponentiell parallellupprepningssats som täcker alla ändliga två-spelare, envars intrasslade spel - ungefär ett uttalande om att chansen att slå ett sådant spel faller exponentiellt när många kopior spelas samtidigt av spelare som delar kvantentanglement.

Det omtvistade steget är vad noten kallar ett kvantitativt girigt konditionslemma, som används tidigt i kapitlets argumentation. Dess uppgift är att välja en liten uppsättning koordinater, D, så att efter att spelarna vinner varje koordinat i D, vinner man en slumpmässigt vald återstående koordinat med en genomsnittlig sannolikhet på minst 1−δ. Författarna bestrider inte det påståendet; de säger att det är korrekt. Deras invändning är mot argumentet tryckt under det. Som skrivet uttrycks procedurens fortsättningstest i termer av genomsnittlig framgång, medan nästa steg kräver att det finns en specifik koordinat med en stor sannolikhet för villkorad misslyckande. Anteckningen säger att implikationen är falsk.

För att stödja påståendet ger författarna ett explicit motexempel och säger att även enkla exempel kan lämna den tryckta proceduren utan något giltigt nästa steg - det vill säga att slingan som skriven kan stanna i stället för att producera den koordinat den behöver. De identifierar sedan vad de anser vara det avsedda fortsättningstillståndet, uttryckt i termer av misslyckande snarare än framgång, och tillhandahåller ett fullständigt korrigerat bevis. De karakteriserar reparationen som lokal: lemmas uttalande är oförändrat, och så är parametrarna som resten av kapitlet hämtar från det, så nedströmssteg som citerar lemmat borde inte behöva skrivas om.

Noteringen är ovanligt tydlig om vad den inte fastställer. Författarna skriver att deras korrigering inte bör läsas som en oberoende verifiering av huvudsatsen för parallellupprepning; de fixade ett tidigt lemma, inte kapitlet. Flera saker är okända från själva källan. Den anger inte vilken modell som producerade kapitlet, beskriver hur texten skapades eller hur mycket mänsklig redigering den fick före publiceringen. Den rapporterar inte någon maskinkontrollerad formalisering av vare sig det felaktiga eller det korrigerade beviset, innehåller inget svar från OpenAI, och - som ett arXiv-förtryck - har den ingen indikation på peer review. Påståendet att det tryckta korrekturet är trasigt och att reparationen är giltig är i detta skede författarnas påstående, öppet för samma granskning som de tillämpade.

Källinformation: arxiv.org

Varför det spelar roll

Det rapporterade misslyckandet är inte ett hallucinerat citat eller ett påhittat nummer utan en enda omvänd ojämlikhet begravd i ett annars rimligt argument - den typ av defekt som överlever en skumning och bara fångas av rad för rad läsning. Det är en konkret datapunkt i en olöst fråga: hur AI-producerad matematik ska kontrolleras innan man litar på den.

De flesta offentliga diskussioner om AI-fel i tekniskt skrivande handlar om uppenbara misslyckanden: påhittade citat, påhittade siffror, aritmetik som faller isär vid inspektion. Defekten som beskrivs här är en annan art. Ett villkor som anges under en händelse skrevs över dess komplement - framgång där misslyckande behövdes. Den omgivande prosan läses korrekt, lemmat som bevisas är sant, och parametrarna står i linje. Den kombinationen är det som gör det svårt: argumentet är rimligt på alla nivåer utom den som avgör om det fungerar. Granskare som kontrollerar uttalandet, konstanterna och den övergripande formen kan klara det och fortfarande missa pausen.

Det har en praktisk konsekvens för alla som använder modeller för att utforma härledningar, argument för korrekthet av algoritmer eller protokollanalyser. Att bekräfta att ett resultat är sant är inte detsamma som att bekräfta att det tillhandahållna beviset bekräftar det. I det här fallet råkade båda sakerna vara åtskiljbara: anspråket överlevde, resonemanget inte. I andra fall kan samma klass av slip stödja en slutsats som helt enkelt är felaktig, utan någon extern kontroll för att fånga den. Den fungerande granskningsenheten för AI-producerad matematik verkar vara det individuella slutsatssteget, inte teoremet, och det är dyrt mänskligt arbete.

Avsnittet pekar också på formell verifiering som ett diskriminerande verktyg. En polaritetsomkastning mellan komplementära händelser är exakt den typ av defekt som en korrekturassistent fångar upp mekaniskt, eftersom typen av föremål som produceras inte skulle matcha den typ som krävs i nästa steg. Detta kapitel, som beskrivits, var prosamatematik, kontrollerade hur prosamatematik alltid har kontrollerats - av läsare. Eftersom AI-system producerar fler kandidatbevis än experter kan läsa, ökar klyftan mellan vad som kan genereras och vad som kan granskas, och maskinkontroll är den självklara kandidaten för att stänga den.

Viss försiktighet är motiverad med hur långt man ska läsa detta. Det är ett lemma i ett kapitel i ett dokument, rapporterat av två författare i en åttasidig anteckning. Det ger ingen felfrekvens, ingen jämförelse med mänskligt skrivna bevis av liknande längd, och inga bevis om huruvida den här typen av misstag är sällsynta eller vanliga i AI-genererad matematik. Människoförfattade tidningar innehåller också fel som kan repareras, och litteraturen har en lång tradition av just denna genre av korrigerande noteringar. Vad som är nytt är ämnet: den felaktiga texten kom från ett system, publicerat av ett företag med ett stort intresse för hur dess matematiska produktion bedöms.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konceptkontroll+10 Points
AI Models Explained Quiz

In AI, what are a model's "parameters"?

Vad du ska titta på härnäst

Huruvida OpenAI erkänner eller korrigerar kapitlet, om andra kapitel drar liknande granskningar och om någon självständigt verifierar huvudsatsen för parallellupprepning som det korrigerade lemma matas in i. Också värt att titta på är om maskinkontrollerad formalisering blir en norm för AI-genererade bevis.

Det första du bör titta på är om OpenAI svarar — med ett fel, ett reviderat kapitel eller en väsentlig oenighet. En synlig korrigering skulle tyda på att dokumentet underhålls som en teknisk artefakt snarare än en demonstration; tystnad skulle låta läsarna stämma av den publicerade texten mot en anteckning från tredje part. Huruvida korrigeringen, om den görs, matchar den som föreslås här är en separat fråga värd att spåra, eftersom en annan reparation kanske inte bevarar parametrarna som kapitlet senare förlitar sig på.

För det andra, om andra kapitel i samma dokument får jämförbar granskning. En enda revision är en anekdot; en uppsättning oberoende granskningar av de tio påstådda framstegen skulle börja karakterisera hur tillförlitlig insamlingen är och var fellägena samlas. Barriären är att denna typ av granskning kräver domänexperter som är villiga att lägga seriös tid på någon annans produktion, med liten konventionell akademisk belöning för att göra det.

För det tredje, om någon självständigt verifierar huvudsatsen för parallellupprepning som det korrigerade lemma stöder. Författarna var tydliga att de inte gjorde det. Tills det händer är bevisläget att ett tidigt steg nu har ett bevis som författarna anser är sunda, och det större påståendet förblir okontrollerat offentligt. En maskinkontrollerad formalisering av kapitlet – eller till och med bara av lemmat – skulle kraftigt förändra hur stor vikt resultatet kan bära.

För det fjärde, huruvida det bildas normer kring att avslöja och granska AI-genererad matematik: märkning av vilka argument som modellproducerats, ange vilken mänsklig eller automatiserad kontroll som tillämpades och behandla overifierade bevis som utkast snarare än resultat. Journaler och preprint-servrar har gått långsamt i liknande frågor. Den här anteckningen är också ett förtryck och har inte själv granskats, så dess egen mottagning – om specialister på kvantparallellupprepning bekräftar motexemplet och accepterar reparationen – är en del av vad som ska följas.

Relaterade guider och frågesporter

AI-modeller förklarasChatGPT och LLM:erAI:s framtidTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlista
Hittade du detta användbart?