Назад до новин
ІнноваціяAI Understanding брифінг

Аудит доказу, створеного штучним інтелектом OpenAI, знаходить зворотний стан і публікує ремонт

Два дослідники кажуть, що доказ леми в розділі 6 математичного документа OpenAI містить помилку полярності: тест з точки зору середнього успіху, де наступний крок потребує великої умовної невдачі. Вони наводять контрприклад і виправлений доказ і застерігають, що це не перевірка основної теореми розділу.

7 min readRead the primary source
Source-page capture accompanying Audit of an OpenAI AI-Generated Proof Finds a Reversed Condition, and Publishes a Repair
Першоджерельний документДжерело записано
Видавець
arxiv.org
Посилання на джерело
arxiv.orghttps://arxiv.org/abs/2608.14673
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Штучний інтелект (AI)
Широке поле побудови систем, які виконують завдання, що вимагають розпізнавання шаблонів, аргументації, мови або прийняття рішень.
Алгоритм
Визначений набір правил або кроків, яких дотримується комп’ютер для вирішення проблеми або виконання завдання.
Цитування
Посилання на вихідні уривки або документи, включені у відповідь моделі для підтвердження своїх тверджень.
Перевір себеВікторина «Пояснення моделей ШІ».

Що сталося

Замітка на восьми сторінках, опублікована в arXiv 3 серпня 2026 року, повідомляє, що друкований доказ леми про жадібне обумовлення в Розділі 6 Десяти досягнень математики та теоретичної інформатики OpenAI змінює умову між додатковими подіями. Автори кажуть, що твердження леми є правильним, надають контрприклад до друкованої процедури та надають виправлений доказ, який вони описують як локальне відновлення.

Коротка замітка, опублікована в arXiv 3 серпня 2026 року Миколаєм Сініцьким і Кшиштофом Сініцьким, повідомляє про помилку в друкованому доказі леми в Розділі 6 документа OpenAI під назвою «Десять досягнень у математиці та теоретичній інформатиці». Список arXiv (2608.14673) поданий у розділ «Штучний інтелект» і перехресний список у «Квантовій фізиці», а його метадані описують восьмисторінкову статтю з п’ятьма посиланнями. Згідно з приміткою, у розділі стверджується теорема про експоненційне паралельне повторення, яка охоплює всі обмежені заплутані ігри для двох гравців, що складаються з одного раунду — грубо кажучи, твердження про те, що шанс перемогти таку гру експоненціально падає, коли багато копій грають одночасно гравці, які поділяють квантову заплутаність.

Спірний крок — це те, що в примітці називається лемою кількісного жадібного обумовлення, яка використовується на початку аргументації розділу. Його робота полягає у виборі невеликого набору координат, D, таким чином, що після того, як гравці виграють кожну координату в D, випадково вибрана координата, що залишилася, буде виграна із середньою ймовірністю принаймні 1−δ. Автори не заперечують це твердження; кажуть, що правильно. Вони заперечують проти аргументу, надрукованого під ним. Як написано, перевірка продовження процедури виражається в термінах середнього успіху, тоді як наступний крок вимагає існування певної координати, що несе велику умовну ймовірність відмови. У примітці сказано, що наслідки невірні.

Щоб підтвердити це твердження, автори наводять явний контрприклад і кажуть, що навіть прості приклади можуть залишити надруковану процедуру без дійсного наступного кроку — тобто цикл у написаному вигляді може зупинитися, а не створити потрібну йому координату. Потім вони визначають те, що вони вважають запланованою умовою продовження, вираженою в термінах невдачі, а не успіху, і надають повне виправлене підтвердження. Вони характеризують виправлення як локальне: твердження леми не змінюється, як і параметри, які витягує з нього решта розділу, тому наступні кроки, які посилаються на лему, не потребують переписування.

Замітка надзвичайно чітко говорить про те, чого вона не встановлює. Автори пишуть, що їх виправлення не слід розглядати як незалежну перевірку основної теореми про паралельне повторення; вони виправили одну ранню лему, а не розділ. Деякі речі невідомі з самого джерела. У ньому не вказується, яка модель створила розділ, не описується, як був згенерований текст, і не вказується, скільки людського редагування він отримав перед публікацією. У ньому не повідомляється про будь-яку перевірену машиною формалізацію дефектного чи виправленого доказу, не містить жодної відповіді від OpenAI і — як препринт arXiv — не містить ознак експертної перевірки. Твердження про те, що друкована пробна копія зламано, а ремонт дійсний, на даному етапі є твердженням авторів, яке відкрите для такого самого ретельного розгляду, як і вони.

Деталі джерела: arxiv.org

Чому це важливо

Повідомлення про збій — це не галюцинація чи вигадане число, а одна перевернута нерівність, похована в інакше правдоподібному аргументі — вид дефекту, який виживає під час перегляду й виявляється лише під час читання рядок за рядком. Це конкретна точка даних у невирішеному питанні: як слід перевіряти створену ШІ математику, перш ніж на неї покладатися.

Більшість публічних обговорень помилок штучного інтелекту в технічному написанні зосереджується на очевидних помилках: сфабрикованих цитатах, вигаданих числах, арифметиці, яка розвалюється під час перевірки. Дефект, описаний тут, є іншого виду. Умова, викладена над однією подією, була написана над її доповненням — успіх там, де необхідна невдача. Навколишня проза читається правильно, лема, що доводиться, вірна, і всі параметри збігаються. Ця комбінація ускладнює завдання: аргумент правдоподібний на всіх рівнях, крім того, який вирішує, чи працює він. Рецензенти, які перевіряють твердження, константи та загальну форму, можуть пропустити його та все одно пропустити перерву.

Це має практичні наслідки для тих, хто використовує моделі для розробки похідних, аргументів правильності алгоритмів або аналізу протоколів. Підтвердження істинності результату не означає підтвердження того, що наданий доказ підтверджує це. У цьому випадку обидві речі виявилися роздільними: позов зберігся, а аргументація – ні. В інших випадках той самий клас помилок може підтримувати висновок, який є просто неправильним, без зовнішньої перевірки, щоб це вловити. Працездатний блок огляду математики, створеної штучним інтелектом, виглядає як окремий крок висновку, а не теорема, і це дорога людська робота.

Цей епізод також вказує на формальну перевірку як дискримінаційний інструмент. Зміна полярності між комплементарними подіями — це саме той тип дефекту, який помічник перевірки вловлює механічно, оскільки тип створеного об’єкта не збігатиметься з типом, необхідним для наступного кроку. Цей розділ, як описано, був прозовою математикою, перевіреною так, як прозова математика завжди перевірялася — читачами. Оскільки системи штучного інтелекту створюють більше доказів-кандидатів, ніж можуть прочитати експерти, розрив між тим, що можна згенерувати, і тим, що можна перевірити, збільшується, і машинна перевірка є очевидним кандидатом для його усунення.

Варто бути обережним щодо того, як далеко це читати. Це одна лема в одному розділі одного документа, викладена двома авторами у примітці на восьми сторінках. Він не надає частоти помилок, порівняння з доказами, написаними людиною, однакової довжини, і жодних доказів того, чи подібні помилки є рідкісними чи поширеними в математиці, створеній ШІ. Документи, написані людьми, також містять помилки, які можна виправити, і в літературі є давня традиція саме такого жанру виправлення. Новим є предмет: помилковий текст надійшов із системи, опублікованої компанією, яка сильно зацікавлена ​​в тому, як оцінюється її математичний результат.

Interactive Mechanism

Interactive Mechanism: How It Actually Works

Explore the underlying technology behind this development interactively.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interactive Concept Check+10 Points
AI Models Explained Quiz

What is the best response when AI Models Explained makes a mistake in production?

Що дивитися далі

Чи OpenAI визнає або виправляє розділ, чи інші розділи проводять подібні перевірки та чи хтось незалежно перевіряє основну теорему про паралельне повторення, до якої входить виправлена ​​лема. Також варто стежити за тим, чи стане перевірена машиною формалізація нормою для доказів, згенерованих ШІ.

Перше, на що слід звернути увагу, це чи відповість OpenAI — помилкою, переглянутою главою чи суттєвою незгодою. Видиме виправлення свідчить про те, що документ зберігається як технічний артефакт, а не як демонстрація; мовчання змусить читачів узгодити опублікований текст із приміткою третьої сторони. Чи збігається виправлення, якщо воно зроблене, із запропонованим тут, це окреме питання, яке варто відстежити, оскільки інший ремонт може не зберегти параметри, на які покладається пізніше розділ.

По-друге, чи інші розділи в тому самому документі вимагають порівнянної перевірки. Одна ревізія – анекдот; набір незалежних аудитів по десяти заявленим досягненням почав би характеризувати, наскільки надійним є збір і де згруповані режими відмов. Перешкода полягає в тому, що для такого рецензування потрібні експерти в галузі, готові витрачати серйозний час на чужий результат, маючи невелику звичайну академічну винагороду за це.

По-третє, чи хтось незалежно перевіряє основну теорему про паралельне повторення, підтверджену виправленою лемою. Автори чітко заявили, що ні. Поки цього не станеться, стан доказів полягає в тому, що один ранній крок тепер має докази, які, на думку авторів, є обґрунтованими, а більш широке твердження залишається неперевіреним у публіці. Перевірена машиною формалізація розділу — або навіть лише леми — різко змінила б те, яку вагу може мати результат.

По-четверте, чи формуються норми навколо розкриття та перевірки математики, створеної штучним інтелектом: позначаючи, які аргументи були створені моделлю, вказуючи, яка перевірка була застосована людиною чи автоматизованою, і розглядати неперевірені докази як чернетки, а не як результати. Журнали та сервери препринтів повільно просувалися у подібних питаннях. Ця примітка також є препринтом і сама по собі не була рецензована, тому її власний прийом — чи спеціалісти з квантового паралельного повторення підтверджують контрприклад і приймають виправлення — є частиною того, чого слід дотримуватися.

Пов’язані посібники та вікторини

Пояснення моделей AIChatGPT і LLMМайбутнє ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосарії
Знайшли це корисним?