Что случилось
Anthropic говорит, что Claude работал в основном автономно в течение 11 дней, чтобы создать сквозную, проверенную компьютером формализацию Великой теоремы Ферма в помощнике по бережливому доказательству. Компания заявляет, что доказательство было проверено Лином, использовало только три стандартные аксиомы Лина и было рассмотрено математиком Кевином Баззардом.
Anthropic сообщает, что Claude формализовал Великую теорему Ферма, утверждение, что никакие положительные целые числа не удовлетворяют aⁿ + bⁿ = cⁿ для n больше 2. Теорема была впервые доказана Эндрю Уайлсом в 1995 году. Anthropic подчеркивает, что новая работа формализует и проверяет существующий математический результат, а не открывает новое доказательство.
Согласно Anthropic, Claude сгенерировал 13 миллионов строк Lean-кода, доказал 30 300 промежуточных теорем и использовал 29 500 из них в окончательном доказательстве. Десятки агентов Claude сотрудничали через Prove2Me, открытую платформу, которая отслеживала зависимости между утверждениями теорем и помогала агентам работать параллельно.
Anthropic сообщает, что готовое доказательство было проверено Лином и использует только три стандартные аксиомы Лина. Компания также сообщает, что компаратор подтвердил, что утверждение теоремы соответствует утверждению Mathlib о Великой теореме Ферма. Кевин Баззард рассмотрел доказательство и назвал достижение значительным, а Anthropic отмечает, что результат еще подлежит перепроверке.
Компания заявляет, что первые попытки провалились, потому что агенты потеряли контроль над состоянием проекта. Усилия увенчались успехом после того, как исследователи внедрили Prove2Me и мультиагентную систему на базе Claude Code. По оценкам Anthropic, проект потреблял около шести миллиардов выходных токенов из внутренней исследовательской модели, примерно сопоставимой с Claude Fable 5.1. Источник не указывает общедоступную цену за полное воспроизведение и не устанавливает, что тот же результат в настоящее время практичен для обычных пользователей Claude.
Подробности об источнике: anthropic.com ↗
Почему это важно
Работа посвящена проверке, а не открытию нового доказательства Великой теоремы Ферма. Если это будет воспроизведено независимо, это покажет, что системы ИИ могут помочь перевести чрезвычайно сложную человеческую математику в машинно-проверяемую форму, потенциально сокращая время, необходимое для проверки будущих доказательств и математических утверждений, сгенерированных ИИ. Результат также показывает, что полезная автономия может зависеть как от инструментов управления проектами и формальной поддержки, так и от базовой модели.
Формальные помощники по доказательству, такие как Lean, проверяют, следует ли каждый логический шаг из предыдущих определений, теорем и аксиом. Это может обеспечить более надежную проверку правильности, чем обычная рецензирование, хотя само по себе оно не делает доказательство понятным для неспециалистов и не устанавливает, что формализованное утверждение отражает все предполагаемые математические нюансы.
Заявленное достижение заключается в масштабах и скорости. Anthropic говорит, что формализация, исходя из существующего плана сообщества, должна была занять годы, а Claude завершил ее за 11 дней. Если публичный код выдержит независимую проверку, этот подход может помочь математикам проверять длинные доказательства и более эффективно проверять математику, созданную ИИ.
Результатом также является демонстрация системы. Anthropic приписывает успех не только Claude, но и отслеживанию зависимостей, поиску теорем, параллельному сотрудничеству, более быстрой компиляции и многоагентному рабочему процессу. Это говорит о том, что будущая математическая автоматизация может зависеть от специализированной инфраструктуры, а не от модели, работающей в одиночку.
Важные ограничения остаются. Источником является собственный отчет Anthropic о своей системе, и в статье не сообщается о завершенном независимом аудите, внешней репликации, сравнительных затратах или рецензируемой оценке всего артефакта. Обзор Баззарда является значимым свидетельством участия экспертов, но он не эквивалентен широкой независимой проверке.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Что посмотреть дальше
Перепроверка общедоступного кода Lean независимыми математиками будет иметь важное значение, поскольку будет свидетельствовать о том, что этот подход выходит за рамки теоремы с существующим планом доказательства. Практическая стоимость, воспроизводимость на внешних системах и удобство использования полученного доказательства для математиков остаются неясными.
Следите за независимыми проверками доказательства GitHub, в том числе за тем, составлено ли оно на основе опубликованных материалов и выявляют ли сторонние пользователи Lean ошибки, скрытые предположения или зависимости, не описанные в объявлении.
Посмотрите, может ли тот же рабочий процесс формализовать другие важные теоремы без необычайно подробного проекта, разработанного человеком. Anthropic сообщает о меньшем эксперименте по формализации теоремы трех простых чисел Виноградова за три дня с использованием трех личных планов Claude Max, но источник не дает независимой оценки этого результата.
Модель стоимости и доступа не решена. Anthropic заявляет, что предлагает бесплатные или льготные подписки, исследовательские кредиты и специальные гранты для более крупных проектов, но не утверждает, что полная формализация Ферма может быть воспроизведена посредством потребительской подписки, или раскрывает денежную стоимость заявленных шести миллиардов выходных токенов.
Более широкий тест будет заключаться в том, станет ли формализация обычным дополнением удобочитаемых математических статей. Anthropic утверждает, что доказательства, проверяемые машиной, могут помочь рецензентам идти в ногу с работой, создаваемой искусственным интеллектом, но при этом признает, что формализованные доказательства не должны заменять объяснения, написанные для читателей-людей.