Zpět na Novinky
InovaceInstruktáž AI Understanding

Audit OpenAI AI-generovaného důkazu nalezne obrácený stav a zveřejní opravu

Dva výzkumníci tvrdí, že důkaz lemmatu v kapitole 6 matematického dokumentu OpenAI má chybu polarity: test z hlediska průměrného úspěchu, kde další krok vyžaduje velké podmíněné selhání. Uvádějí protipříklad a opravený důkaz a varují, že se nejedná o ověření hlavní věty kapitoly.

7 min readRead the primary source
Source-page capture accompanying Audit of an OpenAI AI-Generated Proof Finds a Reversed Condition, and Publishes a Repair
Primární zdrojový dokumentZdroj zaznamenán
Vydavatel
arxiv.org
Odkaz na zdroj
arxiv.orghttps://arxiv.org/abs/2608.14673
Typ zdroje
Primární dokument — oficiální oznámení, papír, podání nebo stránka první strany, kterou čteme přímo.
KontextPochopte to za 60 sekund

Začněte zde

Klíčové pojmy

umělá inteligence (AI)
Široká oblast budování systémů, které provádějí úkoly vyžadující rozpoznávání vzorů, uvažování, jazyk nebo rozhodování.
Algoritmus
Definovaná sada pravidel nebo kroků, kterými se počítač řídí, aby vyřešil problém nebo dokončil úkol.
Citace
Odkazy na zdrojové pasáže nebo dokumenty zahrnuté v odpovědi modelu na podporu jeho tvrzení.
Otestujte seKvíz s vysvětlením modelů umělé inteligence

Co se stalo

Osmistránková poznámka zveřejněná na arXiv 3. srpna 2026 uvádí, že tištěný důkaz chamtivého podmiňovacího lemmatu v kapitole 6 Deset pokroků v matematice a teoretické informatice OpenAI obrací stav mezi komplementárními událostmi. Autoři tvrdí, že tvrzení lemmatu je správné, dodávají protipříklad k tištěnému postupu a dávají opravený důkaz, který popisují jako místní opravu.

Krátká poznámka zaslaná do arXiv 3. srpna 2026 Mikołajem Sienickim a Krzysztofem Sienickim uvádí chybu v tištěném důkazu lemmatu v kapitole 6 dokumentu OpenAI s názvem Deset pokroků v matematice a teoretické informatice. Seznam arXiv (2608.14673) je uložen pod umělou inteligencí a křížově zařazen do Quantum Physics a jeho metadata popisují osmistránkový dokument s pěti odkazy. Podle poznámky tato kapitola prohlašuje teorém o exponenciálním paralelním opakování, který pokrývá všechny konečné zapletené hry pro dva hráče v jednom kole – zhruba prohlášení, že šance porazit takovou hru exponenciálně klesá, když hráči, kteří sdílejí kvantové zapletení, hrají mnoho kopií najednou.

Sporným krokem je to, co poznámka nazývá kvantitativní chamtivé podmiňovací lemma, použité na začátku argumentace kapitoly. Jeho úkolem je vybrat malou množinu souřadnic, D, tak, že po podmínění hráčům, kteří vyhrají každou souřadnici v D, vyhraje náhodně vybraná zbývající souřadnice s průměrnou pravděpodobností alespoň 1−δ. Autoři toto tvrzení nezpochybňují; říkají, že je to správné. Jejich námitka je proti argumentu vytištěnému pod ním. Jak bylo napsáno, pokračovací test procedury je vyjádřen průměrnou úspěšností, zatímco další krok vyžaduje existenci specifické souřadnice nesoucí velkou podmíněnou pravděpodobnost selhání. Poznámka říká, že implikace je nepravdivá.

Na podporu tohoto tvrzení autoři uvádějí explicitní protipříklad a říkají, že i jednoduché příklady mohou opustit tištěnou proceduru bez dalšího platného pohybu – to znamená, že napsaná smyčka se může spíše zastavit, než vytvořit souřadnice, které potřebuje. Poté identifikují, co považují za zamýšlenou podmínku pokračování, vyjádřenou spíše neúspěchem než úspěchem, a poskytnou kompletní opravený důkaz. Opravu charakterizují jako lokální: prohlášení lemmatu se nemění, stejně jako parametry, které z něj zbytek kapitoly čerpá, takže následné kroky, které citují lemma, by neměly vyžadovat přepisování.

Poznámka je neobvykle explicitní o tom, co nestanoví. Autoři píší, že jejich korekce by neměla být chápána jako nezávislé ověření hlavního teorému paralelního opakování; opravili jedno rané lemma, nikoli kapitolu. Ze samotného zdroje není známo několik věcí. Neuvádí, který model vytvořil kapitolu, nepopisuje, jak byl text generován, ani neříká, kolik lidských úprav obdržel před publikací. Nehlásí žádnou strojově kontrolovanou formalizaci chybného nebo opraveného nátisku, neobsahuje žádnou odpověď od OpenAI a – jako předtisk arXiv – nenese žádnou známku vzájemného hodnocení. Tvrzení, že tištěný nátisk je rozbitý a oprava platná, je v této fázi tvrzením autorů, které podléhá stejné kontrole, jakou použili.

Podrobnosti o zdroji: arxiv.org

Proč na tom záleží

Hlášená chyba není halucinovaná citace nebo vymyšlené číslo, ale jedna obrácená nerovnost pohřbená v jinak věrohodném argumentu – druh defektu, který přežije skim a je zachycen pouze čtením řádek po řádku. Jde o konkrétní datový bod v nevyřešené otázce: jak by se měla matematika vytvořená umělou inteligencí kontrolovat, než se na ni bude spoléhat.

Většina veřejných diskusí o chybách umělé inteligence v technickém psaní se soustředí na zjevná selhání: vymyšlené citace, vymyšlená čísla, aritmetika, která se při kontrole rozpadne. Zde popsaná vada je jiný druh. Podmínka uvedená nad jednou událostí byla napsána přes její doplněk — úspěch tam, kde bylo potřeba selhání. Okolní próza se čte správně, dokazované lemma je pravdivé a parametry jsou v souladu. Právě tato kombinace to ztěžuje: argument je přijatelný na všech úrovních kromě té, která rozhoduje o tom, zda funguje. Recenzenti, kteří zkontrolují prohlášení, konstanty a celkový tvar, to mohou projít a stejně promeškají zlom.

To má praktický důsledek pro každého, kdo používá modely k navrhování odvození, argumentů správnosti algoritmu nebo analýz protokolů. Potvrzení, že výsledek je pravdivý, není totéž jako potvrzení, že dodaný důkaz to potvrzuje. V tomto případě byly obě věci oddělitelné: pohledávka přežila, zdůvodnění nikoli. V jiných případech by stejná třída skluzu mohla podporovat závěr, který je prostě špatný, bez vnější kontroly, která by jej zachytila. Funkční kontrolní jednotka pro matematiku vytvořenou AI se zdá být individuálním inferenčním krokem, nikoli teorémem, a to je drahá lidská práce.

Epizoda také poukazuje na formální ověření jako diskriminační nástroj. Přepólování mezi komplementárními událostmi je přesně ten druh defektu, který zkušební asistent zachytí mechanicky, protože typ vyrobeného předmětu by neodpovídal typu požadovanému v dalším kroku. Tato kapitola, jak bylo popsáno, byla prozaická matematika, prověřená způsobem, jakým byla matematika prózy vždy kontrolována – čtenáři. Vzhledem k tomu, že systémy umělé inteligence produkují více důkazů kandidátů, než dokážou odborníci přečíst, propast mezi tím, co lze generovat a co lze auditovat, se rozšiřuje a strojová kontrola je zřejmým kandidátem na její uzavření.

Určitá opatrnost je na místě ohledně toho, jak daleko toto číst. Jde o jedno lemma v jedné kapitole jednoho dokumentu, o kterém referují dva autoři v osmistránkové poznámce. Neposkytuje žádnou chybovost, žádné srovnání s důkazy napsanými lidmi v podobné délce a žádný důkaz o tom, zda je tento druh chyby vzácný nebo běžný v matematice generované AI. Papíry vytvořené lidmi také obsahují opravitelné chyby a literatura má dlouhou tradici přesně tohoto žánru opravných poznámek. Nové je téma: chybný text pochází ze systému, který zveřejnila společnost se silným zájmem o to, jak je posuzován její matematický výstup.

Interactive Mechanism

Interaktivní mechanismus: Jak to vlastně funguje

Interaktivně prozkoumejte základní technologii tohoto vývoje.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktivní kontrola konceptu+10 Points
AI Models Explained Quiz

What is the best response when AI Models Explained makes a mistake in production?

Na co se dále dívat

Zda OpenAI uznává nebo opravuje kapitolu, zda jiné kapitoly provádějí podobné audity a zda někdo nezávisle ověřuje hlavní teorém paralelního opakování, do kterého opravené lemma vstupuje. Také stojí za to sledovat, zda se strojově kontrolovaná formalizace stává normou pro důkazy generované AI.

První věc, kterou je třeba sledovat, je, zda OpenAI odpoví – chybou, revidovanou kapitolou nebo podstatným nesouhlasem. Viditelná oprava by naznačovala, že dokument je udržován spíše jako technický artefakt než jako demonstrace; mlčení by umožnilo čtenářům uvést do souladu publikovaný text s poznámkou třetí strany. Zda oprava, pokud bude provedena, odpovídá té, která je zde navržena, je samostatná otázka, kterou stojí za to sledovat, protože jiná oprava nemusí zachovat parametry, o které se později opírá kapitola.

Zadruhé, zda jiné kapitoly téhož dokumentu provádějí srovnatelnou kontrolu. Jediný audit je anekdota; sada nezávislých auditů napříč deseti proklamovanými zálohami by začala charakterizovat, jak spolehlivá je kolekce a kde se shlukují režimy selhání. Překážkou je, že tento druh revize vyžaduje odborníky na doménu, kteří jsou ochotni věnovat hodně času výstupům někoho jiného, ​​s malou konvenční akademickou odměnou za to.

Za třetí, zda někdo nezávisle ověřuje hlavní větu o paralelním opakování, kterou opravené lemma podporuje. Autoři jasně řekli, že ne. Dokud se tak nestane, stav důkazů je takový, že jeden raný krok má nyní důkaz, o kterém jeho autoři věří, že je správný, a větší tvrzení zůstává veřejně nekontrolováno. Strojově kontrolovaná formalizace kapitoly – nebo dokonce samotného lemmatu – by ostře změnila, jakou váhu výsledek unese.

Za čtvrté, zda se normy vytvářejí kolem zveřejňování a auditování matematiky generované umělou inteligencí: označování, které argumenty byly vytvořeny modelem, uvádění toho, jaká lidská nebo automatizovaná kontrola byla použita, a nakládání s neověřenými důkazy jako s koncepty spíše než s výsledky. Časopisy a předtiskové servery se v podobných otázkách pohybovaly pomalu. Tato poznámka je také předtisk a sama o sobě nebyla recenzována, takže její vlastní příjem – ať už odborníci na kvantové paralelní opakování potvrdí protipříklad a přijmou opravu – je součástí toho, co je třeba následovat.

Související průvodci a kvízy

Vysvětlení modelů AIChatGPT a LLMBudoucnost AIOtestujte si, co víte – vyzkoušejte bezplatný kvíz AIVyhledejte si termín AI v našem slovníku
Považujete to za užitečné?