Назад към Новини
ИновацияAI Understanding брифинг

Математическото изследване с помощта на AI затяга границите на дългогодишна константа

Казус съобщава, че изследователска система с изкуствен интелект е помогнала за подобряване на границите на константата на Grothendieck, докато авторите подчертават, че човешките изследователи са избрали ключовия център и са проверили независимо само резултата на ниво теорема.

6 min readRead the primary source
Документ с първичен източникИзточникът е записан
Издател
Long-horizon AI mathematics case study on arXiv
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2608.11195
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

API (интерфейс за програмиране на приложения)
Структуриран начин за една софтуерна система да изпраща заявки до и да получава отговори от друга система.
Памет (памет на агент)
Съхраненият контекст, който AI агент използва през стъпките или сесиите, за да подобри непрекъснатостта.
Бенчмарк
Стандартизиран тест или набор от данни, използвани за измерване и сравняване на ефективността на модела.
Тествайте себе сиAI Агенти Викторина

Какво стана

Нов казус arXiv описва как изследователска система с изкуствен интелект е помогнала на математиците да подобрят известните граници на константата на Гротендик, открит проблем от 1953 г. Документът представя както математическия резултат, така и подробен запис на това къде системата се е изпълнила добре, къде хората трябва да я управляват и кои твърдения остават проверени от машина, а не от хора.

Константата на Гротендик измерва разликата между труден проблем за комбинаторна оптимизация и по-податлива полуопределена релаксация. Авторите съобщават за нов интервал с долна граница от 6pi/11, около 1.7135, и горна граница от около 1.7818. Придружаващата хартия по математика предоставя доказателствата. Резултатът от долната граница е забележителен, защото не конструира твърд екземпляр; вместо това извлича пречка, която се прилага в съответните схеми за закръгляване.

Изследователската система съчетава модел на разсъждение с кодиращ агент. Документът казва, че изпълнението е използвало GPT-5.5-Pro ​​и по-късно GPT-5.6-Sol за разсъждения, Claude Code с Opus и по-късно Fable 5 за изпълнение и възел с четири GPU за числени търсения. Сесиите пренасят непрекъснатост чрез файлове, преписи, регистрационни файлове на експерименти и резюме, което записва твърдения като доказани, числено подкрепени, предполагаеми или евристични, вместо да разчитат на един непрекъснат контекст.

Сериалът обхвана приблизително 240 изследователски сесии от 16 юни до 24 юли, с 2091 извиквания на модел на разсъждение и приблизително 152 милиона токена на приблизителна цена на API от $5400. Около 40 датирани човешки директиви ръководеха работата. Когато търсенето на горната граница достигна плато, операторите разпознаха, че повтарящите се неуспехи може да означават обща пречка и пренасочиха системата към аргумент на долната граница. Документът описва тази промяна в посоката на изследване като човешка намеса, а не автономно решение.

Системата създаде централен рефрейм и пълно доказателство за долната граница 6pi/11, което след това авторите ревизираха и независимо провериха. Той също така генерира по-силни числени горни и долни кандидати, които са преминали протокола за вътрешна проверка, но авторите не са проверили независимо тези сертификати и не ги заявяват като теореми. Следователно документът разделя проверения математически резултат от по-спекулативните или машинно тествани резултати на системата.

Детайли за източника: Long-horizon AI mathematics case study on arXiv ↗

Защо има значение

Проучването предлага необичайно конкретни доказателства за AI, използван в рамките на изследователска програма, а не в една сравнителна задача. Най-важното му откритие е разделението на труда: системата беше силна в техническото изпълнение, докато човешките изследователи оставаха отговорни за определянето на дневния ред, преценката и окончателната проверка.

Изследванията с дълъг хоризонт са трудни за AI система, тъй като целта може да се промени с натрупването на неуспешни подходи. Полезният сътрудник трябва да запази опитаното, да разграничи задънената улица от неразрешената идея и да реши кога нов въпрос е по-ценен от друга локална оптимизация. Базираната на файлове памет и етикетите на претенциите на авторите са опит да се направи това състояние на изследването видимо и подлежащо на проверка, вместо да се позволи плавен отговор да замести напредъка.

Откритието на долната граница показва защо човешката преценка все още има значение, дори когато агентът може да изпълни математика. Операторите забелязаха, че много опити за конструиране се провалят по същия начин и предоставиха концептуалната опора: докажете самото повтарящо се препятствие. След това системата помогна за формализиране и сертифициране на аргумента. Тази последователност е по-близо до контролирано изследване, отколкото до независим машинен математик, и разграничението има значение, когато се описва какво подкрепят доказателствата.

Независимата проверка е вратата за освобождаване на резултата. Казусът казва, че долната граница е проверена от авторите и че пълните доказателства се появяват в придружаващ документ. Не се казва, че всяко число, произведено по време на бягането, е правилно. Поддържането на твърдения на ниво теорема, машинно тествани кандидати и хипотези отделно дава на читателите начин да оценят приноса, без да приемат вътрешната увереност на AI системата като математическо доказателство.

За изследователските организации практическият урок е оперативен. Една AI система може да търси литература, да пише код, да провежда експерименти, да запазва неуспешни опити и да предлага трансформации, но заобикалящият работен процес се нуждае от произход, възпроизводими изчисления, ясни човешки контролни точки и начин да се възстанови защо екипът е променил посоката. Отчетените разходи и изчисления също показват ясно, че възможностите за дълъг хоризонт не са само въпрос на интелигентност на модела; зависи от скелето, времето и постоянния надзор.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Какво да гледате след това

Следващият въпрос е дали този модел на сътрудничество се обобщава отвъд един проблем и екип и дали независими изследователи могат да възпроизведат проверения резултат, като същевременно измерват цената и надеждността на всеки човешки и AI принос.

Репликацията трябва да тества други математически области, типове проблеми и изследователски системи с различни дизайни на памет и инструменти. Проблемът с Grothendieck вече дойде със значителна рамка, създадена от човека, натрупани бележки, машини за сертифициране и указания за кандидати. Тази предишна структура помогна за изпълнението, така че бъдещите проучвания трябва да докладват каква част от състоянието на изследването е предоставена предварително и как се променят резултатите, когато системата трябва сама да дефинира проблема.

Изследователите трябва също да сравняват техническото изпълнение с изследователската преценка, използвайки проспективни мерки. Полезните показатели биха могли да включват качеството на избраните посоки, времето за изоставяне на неуспешен път, степента на неподкрепени искове, броя на човешките намеси и частта от резултатите, които оцеляват при независима проверка. Полираният казус може да покаже какво се е случило, но са необходими контролирани сравнения, за да се прецени кога сътрудник с изкуствен интелект подобрява процеса, вместо просто да добавя още един слой за преглед.

Границата между машинната проверка и човешката проверка заслужава непрекъснато внимание. Интервалната аритметика, асистентите за доказателство, тестовете и състезателните одити могат да уловят много грешки, но сертификатът все още може да кодира грешна цел или да зависи от предположения, които никога не са били оспорени. Последващата работа трябва да публикува пълни артефакти, да изпълни повторно най-силните непроверени граници и да направи неуспешните или оттеглените резултати толкова видими, колкото и успешните.

И накрая, версиите на модела, подканите, директивите за управление, кодът, изчисленията и транскриптите трябва да бъдат запазени, когато лицензирането и поверителността позволяват. Настоящият документ е ценен отчасти, защото отчита тези условия и описва слабостите на системата, включително крехкото представителство на изследователската държава и ограничената автономия в преценката. Докато други екипи не възпроизведат модела, това е убедително доказателство за математически напредък, подпомаган от AI, а не доказателство, че AI системите могат независимо да провеждат отворени изследвания.

Свързани ръководства и викторини

AI агентиОбяснени модели на AIAI обучениеLLM оценкиТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?