Що сталося
Замітка на восьми сторінках, опублікована в arXiv 3 серпня 2026 року, повідомляє, що друкований доказ леми про жадібне обумовлення в Розділі 6 Десяти досягнень математики та теоретичної інформатики OpenAI змінює умову між додатковими подіями. Автори кажуть, що твердження леми є правильним, надають контрприклад до друкованої процедури та надають виправлений доказ, який вони описують як локальне відновлення.
Коротка замітка, опублікована в arXiv 3 серпня 2026 року Миколаєм Сініцьким і Кшиштофом Сініцьким, повідомляє про помилку в друкованому доказі леми в Розділі 6 документа OpenAI під назвою «Десять досягнень у математиці та теоретичній інформатиці». Список arXiv (2608.14673) поданий у розділ «Штучний інтелект» і перехресний список у «Квантовій фізиці», а його метадані описують восьмисторінкову статтю з п’ятьма посиланнями. Згідно з приміткою, у розділі стверджується теорема про експоненційне паралельне повторення, яка охоплює всі обмежені заплутані ігри для двох гравців, що складаються з одного раунду — грубо кажучи, твердження про те, що шанс перемогти таку гру експоненціально падає, коли багато копій грають одночасно гравці, які поділяють квантову заплутаність.
Спірний крок — це те, що в примітці називається лемою кількісного жадібного обумовлення, яка використовується на початку аргументації розділу. Його робота полягає у виборі невеликого набору координат, D, таким чином, що після того, як гравці виграють кожну координату в D, випадково вибрана координата, що залишилася, буде виграна із середньою ймовірністю принаймні 1−δ. Автори не заперечують це твердження; кажуть, що правильно. Вони заперечують проти аргументу, надрукованого під ним. Як написано, перевірка продовження процедури виражається в термінах середнього успіху, тоді як наступний крок вимагає існування певної координати, що несе велику умовну ймовірність відмови. У примітці сказано, що наслідки невірні.
Щоб підтвердити це твердження, автори наводять явний контрприклад і кажуть, що навіть прості приклади можуть залишити надруковану процедуру без дійсного наступного кроку — тобто цикл у написаному вигляді може зупинитися, а не створити потрібну йому координату. Потім вони визначають те, що вони вважають запланованою умовою продовження, вираженою в термінах невдачі, а не успіху, і надають повне виправлене підтвердження. Вони характеризують виправлення як локальне: твердження леми не змінюється, як і параметри, які витягує з нього решта розділу, тому наступні кроки, які посилаються на лему, не потребують переписування.
Замітка надзвичайно чітко говорить про те, чого вона не встановлює. Автори пишуть, що їх виправлення не слід розглядати як незалежну перевірку основної теореми про паралельне повторення; вони виправили одну ранню лему, а не розділ. Деякі речі невідомі з самого джерела. У ньому не вказується, яка модель створила розділ, не описується, як був згенерований текст, і не вказується, скільки людського редагування він отримав перед публікацією. У ньому не повідомляється про будь-яку перевірену машиною формалізацію дефектного чи виправленого доказу, не містить жодної відповіді від OpenAI і — як препринт arXiv — не містить ознак експертної перевірки. Твердження про те, що друкована пробна копія зламано, а ремонт дійсний, на даному етапі є твердженням авторів, яке відкрите для такого самого ретельного розгляду, як і вони.
Чому це важливо
Повідомлення про збій — це не галюцинація чи вигадане число, а одна перевернута нерівність, похована в інакше правдоподібному аргументі — вид дефекту, який виживає під час перегляду й виявляється лише під час читання рядок за рядком. Це конкретна точка даних у невирішеному питанні: як слід перевіряти створену ШІ математику, перш ніж на неї покладатися.
Більшість публічних обговорень помилок штучного інтелекту в технічному написанні зосереджується на очевидних помилках: сфабрикованих цитатах, вигаданих числах, арифметиці, яка розвалюється під час перевірки. Дефект, описаний тут, є іншого виду. Умова, викладена над однією подією, була написана над її доповненням — успіх там, де необхідна невдача. Навколишня проза читається правильно, лема, що доводиться, вірна, і всі параметри збігаються. Ця комбінація ускладнює завдання: аргумент правдоподібний на всіх рівнях, крім того, який вирішує, чи працює він. Рецензенти, які перевіряють твердження, константи та загальну форму, можуть пропустити його та все одно пропустити перерву.
Це має практичні наслідки для тих, хто використовує моделі для розробки похідних, аргументів правильності алгоритмів або аналізу протоколів. Підтвердження істинності результату не означає підтвердження того, що наданий доказ підтверджує це. У цьому випадку обидві речі виявилися роздільними: позов зберігся, а аргументація – ні. В інших випадках той самий клас помилок може підтримувати висновок, який є просто неправильним, без зовнішньої перевірки, щоб це вловити. Працездатний блок огляду математики, створеної штучним інтелектом, виглядає як окремий крок висновку, а не теорема, і це дорога людська робота.
Цей епізод також вказує на формальну перевірку як дискримінаційний інструмент. Зміна полярності між комплементарними подіями — це саме той тип дефекту, який помічник перевірки вловлює механічно, оскільки тип створеного об’єкта не збігатиметься з типом, необхідним для наступного кроку. Цей розділ, як описано, був прозовою математикою, перевіреною так, як прозова математика завжди перевірялася — читачами. Оскільки системи штучного інтелекту створюють більше доказів-кандидатів, ніж можуть прочитати експерти, розрив між тим, що можна згенерувати, і тим, що можна перевірити, збільшується, і машинна перевірка є очевидним кандидатом для його усунення.
Варто бути обережним щодо того, як далеко це читати. Це одна лема в одному розділі одного документа, викладена двома авторами у примітці на восьми сторінках. Він не надає частоти помилок, порівняння з доказами, написаними людиною, однакової довжини, і жодних доказів того, чи подібні помилки є рідкісними чи поширеними в математиці, створеній ШІ. Документи, написані людьми, також містять помилки, які можна виправити, і в літературі є давня традиція саме такого жанру виправлення. Новим є предмет: помилковий текст надійшов із системи, опублікованої компанією, яка сильно зацікавлена в тому, як оцінюється її математичний результат.
Interactive Mechanism: How It Actually Works
Explore the underlying technology behind this development interactively.
What is the best response when AI Models Explained makes a mistake in production?
Що дивитися далі
Чи OpenAI визнає або виправляє розділ, чи інші розділи проводять подібні перевірки та чи хтось незалежно перевіряє основну теорему про паралельне повторення, до якої входить виправлена лема. Також варто стежити за тим, чи стане перевірена машиною формалізація нормою для доказів, згенерованих ШІ.
Перше, на що слід звернути увагу, це чи відповість OpenAI — помилкою, переглянутою главою чи суттєвою незгодою. Видиме виправлення свідчить про те, що документ зберігається як технічний артефакт, а не як демонстрація; мовчання змусить читачів узгодити опублікований текст із приміткою третьої сторони. Чи збігається виправлення, якщо воно зроблене, із запропонованим тут, це окреме питання, яке варто відстежити, оскільки інший ремонт може не зберегти параметри, на які покладається пізніше розділ.
По-друге, чи інші розділи в тому самому документі вимагають порівнянної перевірки. Одна ревізія – анекдот; набір незалежних аудитів по десяти заявленим досягненням почав би характеризувати, наскільки надійним є збір і де згруповані режими відмов. Перешкода полягає в тому, що для такого рецензування потрібні експерти в галузі, готові витрачати серйозний час на чужий результат, маючи невелику звичайну академічну винагороду за це.
По-третє, чи хтось незалежно перевіряє основну теорему про паралельне повторення, підтверджену виправленою лемою. Автори чітко заявили, що ні. Поки цього не станеться, стан доказів полягає в тому, що один ранній крок тепер має докази, які, на думку авторів, є обґрунтованими, а більш широке твердження залишається неперевіреним у публіці. Перевірена машиною формалізація розділу — або навіть лише леми — різко змінила б те, яку вагу може мати результат.
По-четверте, чи формуються норми навколо розкриття та перевірки математики, створеної штучним інтелектом: позначаючи, які аргументи були створені моделлю, вказуючи, яка перевірка була застосована людиною чи автоматизованою, і розглядати неперевірені докази як чернетки, а не як результати. Журнали та сервери препринтів повільно просувалися у подібних питаннях. Ця примітка також є препринтом і сама по собі не була рецензована, тому її власний прийом — чи спеціалісти з квантового паралельного повторення підтверджують контрприклад і приймають виправлення — є частиною того, чого слід дотримуватися.