Назад до новин
ІнноваціяAI Understanding брифінг

Математичні дослідження за допомогою штучного інтелекту звужують межі довготривалої константи

У прикладі повідомляється, що дослідницька система штучного інтелекту допомогла покращити межі константи Гротендіка, тоді як автори підкреслюють, що люди-дослідники вибрали ключову опору та незалежно перевірили лише результат на рівні теореми.

6 min readRead the primary source
Першоджерельний документДжерело записано
Видавець
Long-horizon AI mathematics case study on arXiv
Посилання на джерело
arxiv.orghttps://arxiv.org/abs/2608.11195
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

API (інтерфейс прикладного програмування)
Структурований спосіб для однієї програмної системи надсилати запити до іншої системи та отримувати відповіді від неї.
Пам'ять (Пам'ять агента)
Збережений контекст агент штучного інтелекту використовує на етапах або сеансах для покращення безперервності.
Еталон
Стандартизований тест або набір даних, який використовується для вимірювання та порівняння продуктивності моделі.
Перевір себеВікторина агентів ШІ

Що сталося

У новому тематичному дослідженні arXiv описується, як дослідницька система штучного інтелекту допомогла математикам покращити відомі межі постійної Гротендіка, відкритої проблеми, що датується 1953 роком. У статті представлено як математичний результат, так і детальний запис того, де система працювала добре, де людям доводилося керувати нею та які твердження залишаються перевіреними машиною, а не людиною.

Константа Гротендіка вимірює розрив між жорсткою задачею комбінаторної оптимізації та більш легкою напіввизначеною релаксацією. Автори повідомляють про новий інтервал із нижньою межею 6pi/11, приблизно 1,7135, і верхньою межею приблизно 1,7818. Супутня стаття з математики надає докази. Результат нижньої межі помітний, оскільки він не створює жорсткий екземпляр; натомість він отримує перешкоду, яка застосовується до відповідних схем округлення.

Дослідницька система поєднала модель аргументації з агентом кодування. У документі говориться, що в серії використовувався GPT-5.5-Pro ​​і пізніший GPT-5.6-Sol для міркувань, Claude Code з Opus і пізнішою Fable 5 для виконання, а також вузол із чотирма GPU для числового пошуку. Сеанси проходили безперервно через файли, стенограми, журнали експериментів і підсумки, які фіксували твердження як підтверджені, чисельно підтверджені, гіпотетичні чи евристичні, а не покладалися на один безперервний контекст.

Пробіг охоплював приблизно 240 дослідницьких сеансів з 16 червня по 24 липня з 2091 викликом моделі аргументації та приблизно 152 мільйонами токенів при оціночній вартості API 5400 доларів США. Роботою керували близько 40 датованих вказівок людини. Коли верхня межа пошуку вийшла на плато, оператори визнали, що повторювані помилки можуть вказувати на загальну перешкоду, і перенаправили систему до аргументу нижньої межі. У статті описується, що зміна напрямку дослідження є втручанням людини, а не автономним рішенням.

Система створила центральний рефрейм і повний доказ для нижньої межі 6pi/11, який автори потім переглянули та незалежно перевірили. Він також створив сильніші чисельні верхні та нижні кандидати, які пройшли протокол внутрішньої перевірки, але автори не перевіряли незалежно ці сертифікати та не стверджують їх як теореми. Таким чином, документ відокремлює перевірений математичний результат від більш спекулятивних або перевірених машиною результатів системи.

Деталі джерела: Long-horizon AI mathematics case study on arXiv ↗

Чому це важливо

Дослідження пропонує надзвичайно конкретні докази використання штучного інтелекту в дослідницькій програмі, а не в одному контрольному завданні. Його найважливішим відкриттям є розподіл праці: система була сильною в технічному виконанні, тоді як люди-дослідники залишалися відповідальними за встановлення порядку денного, судження та остаточну перевірку.

Довгострокові дослідження складні для системи штучного інтелекту, оскільки мета може змінюватися в міру накопичення невдалих підходів. Корисний співавтор повинен зберегти те, що було спробовано, відрізнити глухий кут від невирішеної ідеї та вирішити, коли нове питання є більш цінним, ніж інша локальна оптимізація. Пам'ять авторів на основі файлів і мітки претензій є спробою зробити цей стан дослідження видимим і таким, що можна перевірити, а не дозволити вільну відповідь заміщати прогрес.

Відкриття нижньої межі показує, чому людське судження все ще має значення, навіть якщо агент може виконувати математику. Оператори помітили, що багато спроб побудови були однаково невдалими, і дали концептуальну точку зору: доведіть саму повторювану перешкоду. Тоді система допомогла формалізувати та засвідчити аргумент. Ця послідовність ближча до контрольованого дослідження, ніж до незалежного машинного математика, і відмінність має значення, коли описується, що підтверджують докази.

Незалежна перевірка — це вихід для отримання результату. У прикладі сказано, що нижня межа була перевірена авторами, і що повні докази з’являються в супровідній статті. Це не означає, що кожне число, отримане під час прогону, є правильним. Зберігання тверджень на рівні теорем, машинно перевірених кандидатів і гіпотез окремо дає читачам можливість оцінити внесок, не приймаючи внутрішню впевненість системи ШІ як математичний доказ.

Для науково-дослідних організацій практичне заняття є оперативним. Система штучного інтелекту може шукати літературу, писати код, проводити експерименти, зберігати невдалі спроби та пропонувати трансформації, але навколишній робочий процес потребує походження, відтворюваних обчислень, чітких контрольних точок людини та способу реконструювати, чому команда змінила напрямок. Повідомлена вартість і обчислення також чітко показують, що довгострокові можливості — це не лише питання інтелекту моделі; це залежить від риштувань, часу та постійного нагляду.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Інтерактивна перевірка концепції+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Що дивитися далі

Наступне питання полягає в тому, чи ця модель співпраці виходить за межі однієї проблеми та команди, і чи можуть незалежні дослідники відтворити перевірений результат, одночасно вимірюючи вартість і надійність кожного внеску людини та ШІ.

Реплікація повинна тестувати інші математичні області, типи проблем і дослідницькі системи з різними конструкціями пам’яті та інструментів. Проблема Гротендіка вже прийшла з суттєвою структурою, створеною людьми, накопиченими нотатками, механізмом сертифікації та вказівками для кандидатів. Ця попередня структура допомогла працювати, тому майбутні дослідження повинні звітувати про те, скільки досліджуваного стану було надано заздалегідь і як змінюються результати, коли система сама повинна визначити проблему.

Дослідники також повинні порівнювати технічне виконання з дослідницьким судженням, використовуючи перспективні заходи. Корисні показники можуть включати якість вибраних напрямків, час на відмову від невдалого шляху, рівень непідтверджених претензій, кількість втручань людини та частку результатів, які витримують незалежну перевірку. Досконале прикладне дослідження може показати, що сталося, але контрольовані порівняння потрібні, щоб оцінити, коли співавтор ШІ покращує процес, а не просто додавати ще один рівень перевірки.

Кордон між машинною перевіркою та перевіркою людиною заслуговує постійної уваги. Інтервальна арифметика, помічники перевірки, тести та змагальні перевірки можуть виявити багато помилок, але сертифікат все одно може кодувати неправильну ціль або залежати від припущень, які ніколи не оскаржувались. Подальша робота повинна опублікувати повні артефакти, повторно перевірити найсильніші неперевірені межі та зробити невдалі або вилучені результати такими ж помітними, як і успішні.

Нарешті, версії моделі, підказки, керівні директиви, код, обчислення та стенограми слід зберігати, якщо це дозволено ліцензією та конфіденційністю. Поточна стаття є цінною частково тому, що вона повідомляє про ці умови та описує слабкі сторони системи, включаючи крихке представництво дослідницької держави та обмежену автономію в судженнях. Поки інші команди не відтворять цей шаблон, це є переконливим доказом математичного прогресу за допомогою штучного інтелекту, а не доказом того, що системи штучного інтелекту можуть незалежно проводити відкриті дослідження.

Пов’язані посібники та вікторини

Агенти ШІПояснення моделей AIНавчання ШІLLM ОцінкиПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїСлідкуйте за відстеженням випуску моделі AI
Знайшли це корисним?