Какво стана
Нов казус arXiv описва как изследователска система с изкуствен интелект е помогнала на математиците да подобрят известните граници на константата на Гротендик, открит проблем от 1953 г. Документът представя както математическия резултат, така и подробен запис на това къде системата се е изпълнила добре, къде хората трябва да я управляват и кои твърдения остават проверени от машина, а не от хора.
Константата на Гротендик измерва разликата между труден проблем за комбинаторна оптимизация и по-податлива полуопределена релаксация. Авторите съобщават за нов интервал с долна граница от 6pi/11, около 1.7135, и горна граница от около 1.7818. Придружаващата хартия по математика предоставя доказателствата. Резултатът от долната граница е забележителен, защото не конструира твърд екземпляр; вместо това извлича пречка, която се прилага в съответните схеми за закръгляване.
Изследователската система съчетава модел на разсъждение с кодиращ агент. Документът казва, че изпълнението е използвало GPT-5.5-Pro и по-късно GPT-5.6-Sol за разсъждения, Claude Code с Opus и по-късно Fable 5 за изпълнение и възел с четири GPU за числени търсения. Сесиите пренасят непрекъснатост чрез файлове, преписи, регистрационни файлове на експерименти и резюме, което записва твърдения като доказани, числено подкрепени, предполагаеми или евристични, вместо да разчитат на един непрекъснат контекст.
Сериалът обхвана приблизително 240 изследователски сесии от 16 юни до 24 юли, с 2091 извиквания на модел на разсъждение и приблизително 152 милиона токена на приблизителна цена на API от $5400. Около 40 датирани човешки директиви ръководеха работата. Когато търсенето на горната граница достигна плато, операторите разпознаха, че повтарящите се неуспехи може да означават обща пречка и пренасочиха системата към аргумент на долната граница. Документът описва тази промяна в посоката на изследване като човешка намеса, а не автономно решение.
Системата създаде централен рефрейм и пълно доказателство за долната граница 6pi/11, което след това авторите ревизираха и независимо провериха. Той също така генерира по-силни числени горни и долни кандидати, които са преминали протокола за вътрешна проверка, но авторите не са проверили независимо тези сертификати и не ги заявяват като теореми. Следователно документът разделя проверения математически резултат от по-спекулативните или машинно тествани резултати на системата.
Детайли за източника: Long-horizon AI mathematics case study on arXiv ↗
Защо има значение
Проучването предлага необичайно конкретни доказателства за AI, използван в рамките на изследователска програма, а не в една сравнителна задача. Най-важното му откритие е разделението на труда: системата беше силна в техническото изпълнение, докато човешките изследователи оставаха отговорни за определянето на дневния ред, преценката и окончателната проверка.
Изследванията с дълъг хоризонт са трудни за AI система, тъй като целта може да се промени с натрупването на неуспешни подходи. Полезният сътрудник трябва да запази опитаното, да разграничи задънената улица от неразрешената идея и да реши кога нов въпрос е по-ценен от друга локална оптимизация. Базираната на файлове памет и етикетите на претенциите на авторите са опит да се направи това състояние на изследването видимо и подлежащо на проверка, вместо да се позволи плавен отговор да замести напредъка.
Откритието на долната граница показва защо човешката преценка все още има значение, дори когато агентът може да изпълни математика. Операторите забелязаха, че много опити за конструиране се провалят по същия начин и предоставиха концептуалната опора: докажете самото повтарящо се препятствие. След това системата помогна за формализиране и сертифициране на аргумента. Тази последователност е по-близо до контролирано изследване, отколкото до независим машинен математик, и разграничението има значение, когато се описва какво подкрепят доказателствата.
Независимата проверка е вратата за освобождаване на резултата. Казусът казва, че долната граница е проверена от авторите и че пълните доказателства се появяват в придружаващ документ. Не се казва, че всяко число, произведено по време на бягането, е правилно. Поддържането на твърдения на ниво теорема, машинно тествани кандидати и хипотези отделно дава на читателите начин да оценят приноса, без да приемат вътрешната увереност на AI системата като математическо доказателство.
За изследователските организации практическият урок е оперативен. Една AI система може да търси литература, да пише код, да провежда експерименти, да запазва неуспешни опити и да предлага трансформации, но заобикалящият работен процес се нуждае от произход, възпроизводими изчисления, ясни човешки контролни точки и начин да се възстанови защо екипът е променил посоката. Отчетените разходи и изчисления също показват ясно, че възможностите за дълъг хоризонт не са само въпрос на интелигентност на модела; зависи от скелето, времето и постоянния надзор.
Интерактивен механизъм: как всъщност работи
Разгледайте интерактивно основната технология зад тази разработка.
What most distinguishes an AI agent from a basic chatbot?
Какво да гледате след това
Следващият въпрос е дали този модел на сътрудничество се обобщава отвъд един проблем и екип и дали независими изследователи могат да възпроизведат проверения резултат, като същевременно измерват цената и надеждността на всеки човешки и AI принос.
Репликацията трябва да тества други математически области, типове проблеми и изследователски системи с различни дизайни на памет и инструменти. Проблемът с Grothendieck вече дойде със значителна рамка, създадена от човека, натрупани бележки, машини за сертифициране и указания за кандидати. Тази предишна структура помогна за изпълнението, така че бъдещите проучвания трябва да докладват каква част от състоянието на изследването е предоставена предварително и как се променят резултатите, когато системата трябва сама да дефинира проблема.
Изследователите трябва също да сравняват техническото изпълнение с изследователската преценка, използвайки проспективни мерки. Полезните показатели биха могли да включват качеството на избраните посоки, времето за изоставяне на неуспешен път, степента на неподкрепени искове, броя на човешките намеси и частта от резултатите, които оцеляват при независима проверка. Полираният казус може да покаже какво се е случило, но са необходими контролирани сравнения, за да се прецени кога сътрудник с изкуствен интелект подобрява процеса, вместо просто да добавя още един слой за преглед.
Границата между машинната проверка и човешката проверка заслужава непрекъснато внимание. Интервалната аритметика, асистентите за доказателство, тестовете и състезателните одити могат да уловят много грешки, но сертификатът все още може да кодира грешна цел или да зависи от предположения, които никога не са били оспорени. Последващата работа трябва да публикува пълни артефакти, да изпълни повторно най-силните непроверени граници и да направи неуспешните или оттеглените резултати толкова видими, колкото и успешните.
И накрая, версиите на модела, подканите, директивите за управление, кодът, изчисленията и транскриптите трябва да бъдат запазени, когато лицензирането и поверителността позволяват. Настоящият документ е ценен отчасти, защото отчита тези условия и описва слабостите на системата, включително крехкото представителство на изследователската държава и ограничената автономия в преценката. Докато други екипи не възпроизведат модела, това е убедително доказателство за математически напредък, подпомаган от AI, а не доказателство, че AI системите могат независимо да провеждат отворени изследвания.