Вернуться к новостям
ИнновацииAI Understanding брифинг

Математическое исследование с помощью искусственного интеллекта сужает границы давней константы

В тематическом исследовании сообщается, что исследовательская система ИИ помогла улучшить границы константы Гротендика, в то время как авторы подчеркивают, что исследователи-люди выбрали ключевой момент и независимо проверили только результат на уровне теоремы.

6 min readRead the primary source
ПервоисточникИсточник записан
Издатель
Long-horizon AI mathematics case study on arXiv
Ссылка на источник
arxiv.orghttps://arxiv.org/abs/2608.11195
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

API (интерфейс прикладного программирования)
Структурированный способ отправки одной программной системой запросов и получения ответов от другой системы.
Память (Память агента)
Сохраненный контекст, который агент ИИ использует на этапах или сеансах для улучшения непрерывности.
Контрольный показатель
Стандартизированный тест или набор данных, используемый для измерения и сравнения производительности модели.
Проверьте себяВикторина «Агенты ИИ»

Что случилось

В новом тематическом исследовании arXiv описывается, как исследовательская система искусственного интеллекта помогла математикам улучшить известные границы константы Гротендика, открытой проблемы, датируемой 1953 годом. В документе представлены как математические результаты, так и подробный отчет о том, где система работала хорошо, где людям приходилось ею управлять, и какие утверждения остаются проверенными машинами, а не людьми.

Константа Гротендика измеряет разрыв между сложной задачей комбинаторной оптимизации и более гибкой полуопределенной релаксацией. Авторы сообщают о новом интервале с нижней границей 6pi/11, около 1,7135, и верхней границей около 1,7818. Доказательства приведены в сопутствующей статье по математике. Результат нижней границы примечателен тем, что он не создает жесткий экземпляр; вместо этого он создает препятствие, которое применяется к соответствующим схемам округления.

Исследовательская система объединила модель рассуждения с агентом кодирования. В документе говорится, что при прогоне использовались GPT-5.5-Pro ​​и более поздние версии GPT-5.6-Sol для рассуждений, Claude Code с Opus и более поздние версии Fable 5 для выполнения, а также узел с четырьмя графическими процессорами для числового поиска. Сессии обеспечивали непрерывность через файлы, стенограммы, журналы экспериментов и сводку, в которой утверждения записывались как доказанные, численно подтвержденные, предположительные или эвристические, а не полагались на один непрерывный контекст.

Запуск охватывал около 240 исследовательских сессий с 16 июня по 24 июля, включая 2091 вызов модели рассуждения и примерно 152 миллиона токенов при ориентировочной стоимости API в 5400 долларов. Работой руководило около 40 устаревших распоряжений человека. Когда поиск по верхней границе остановился, операторы поняли, что повторяющиеся неудачи могут указывать на общее препятствие, и перенаправили систему на аргумент нижней границы. В документе такое изменение направления исследований описывается как человеческое вмешательство, а не автономное решение.

Система произвела центральный рефрейминг и полное доказательство нижней границы 6pi/11, которое авторы затем пересмотрели и независимо проверили. В результате также были получены более сильные численные кандидаты высшего и низшего уровня, прошедшие протокол внутренней проверки, но авторы не проверили эти сертификаты независимо и не формулируют их как теоремы. Таким образом, в документе отделен проверенный математический результат от более спекулятивных или машинно-проверенных результатов системы.

Подробности об источнике: Long-horizon AI mathematics case study on arXiv ↗

Почему это важно

Исследование предлагает необычайно конкретные доказательства использования ИИ в рамках исследовательской программы, а не в рамках одной контрольной задачи. Самый важный вывод — разделение труда: система была сильна в техническом исполнении, в то время как исследователи-люди оставались ответственными за определение повестки дня, принятие решений и окончательную проверку.

Долгосрочные исследования сложны для системы искусственного интеллекта, поскольку цель может измениться по мере накопления неудачных подходов. Полезный сотрудник должен сохранить то, что было опробовано, отличить тупик от нерешенной идеи и решить, когда новый вопрос более ценен, чем другая локальная оптимизация. Файловая память авторов и метки утверждений — это попытка сделать состояние исследования видимым и проверяемым, а не позволить беглому ответу подменять прогресс.

Открытие нижней границы показывает, почему человеческое суждение по-прежнему имеет значение, даже если агент может выполнять математические действия. Операторы заметили, что многие попытки строительства терпят неудачу, и предложили концептуальную основу: доказать само повторяющееся препятствие. Затем система помогла формализовать и подтвердить аргумент. Эта последовательность ближе к контролируемому исследованию, чем к независимому машинному математику, и это различие имеет значение при описании того, что подтверждается фактами.

Независимая проверка – это ворота для получения результата. В тематическом исследовании говорится, что нижняя оценка была проверена авторами и что полные доказательства приведены в сопутствующей статье. Это не говорит о том, что каждое число, полученное во время прогона, верно. Разделение утверждений на уровне теорем, кандидатов, проверенных машинами, и гипотез дает читателям возможность оценить вклад, не принимая внутреннюю уверенность системы ИИ в качестве математического доказательства.

Для исследовательских организаций практический урок носит оперативный характер. Система ИИ может искать литературу, писать код, проводить эксперименты, сохранять неудачные попытки и предлагать преобразования, но окружающий рабочий процесс требует происхождения, воспроизводимых вычислений, явных контрольных точек, выполняемых человеком, и способа понять, почему команда изменила направление. Сообщенные затраты и расчеты также ясно показывают, что долгосрочные возможности — это не только вопрос интеллекта модели; это зависит от строительных лесов, времени и постоянного надзора.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Что посмотреть дальше

Следующий вопрос заключается в том, распространяется ли эта модель сотрудничества за пределы одной проблемы и команды, и могут ли независимые исследователи воспроизвести проверенный результат, измеряя стоимость и надежность каждого вклада человека и ИИ.

Репликация должна проверять другие математические области, типы задач и исследовательские системы с различной памятью и конструкциями инструментов. Проблема Гротендика уже имела солидную, созданную человеком структуру, накопленные заметки, механизмы сертификации и возможные направления. Эта предыдущая структура помогла в работе, поэтому будущие исследования должны сообщать, какая часть состояния исследования была предоставлена ​​заранее и как меняются результаты, когда система должна сама определить проблему.

Исследователи также должны сравнивать техническое исполнение с исследовательскими суждениями, используя перспективные измерения. Полезные показатели могут включать качество выбранных направлений, время, необходимое для отказа от неудачного пути, количество необоснованных претензий, количество человеческого вмешательства и долю результатов, выдержавших независимую проверку. Подробное тематическое исследование может показать, что произошло, но необходимы контролируемые сравнения, чтобы оценить, когда сотрудник ИИ улучшает процесс, а не просто добавляет еще один уровень проверки.

Граница между машинной проверкой и проверкой человеком заслуживает постоянного внимания. Интервальная арифметика, помощники по проверке, тесты и состязательный аудит могут выявить множество ошибок, однако сертификат может по-прежнему кодировать неправильную цель или зависеть от предположений, которые никогда не подвергались сомнению. Последующая работа должна публиковать полные артефакты, повторно запускать самые сильные непроверенные оценки и делать неудачные или отозванные результаты такими же видимыми, как и успешные.

Наконец, версии моделей, подсказки, руководящие указания, код, вычисления и расшифровки должны сохраняться, если это разрешено лицензией и конфиденциальностью. Настоящая статья ценна отчасти потому, что в ней сообщается об этих условиях и описываются слабости системы, включая хрупкое представительство исследовательского государства и ограниченную автономию в суждениях. Пока другие команды не воспроизведут эту закономерность, это будет убедительным доказательством математического прогресса с помощью ИИ, а не доказательством того, что системы ИИ могут независимо проводить открытые исследования.

Сопутствующие руководства и викторины

ИИ-агентыОбъяснение моделей искусственного интеллектаОбучение искусственному интеллектуLLM оценкиПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?