Nini kilitokea
Uchunguzi mpya wa kesi wa arXiv unaeleza jinsi mfumo wa utafiti wa AI ulivyosaidia wanahisabati kuboresha mipaka inayojulikana kwenye Grothendieck mara kwa mara, tatizo la wazi lililoanza mwaka wa 1953. Karatasi inatoa matokeo ya hisabati na rekodi ya kina ya mahali ambapo mfumo ulitekelezwa vizuri, ambapo watu walipaswa kuuongoza, na ambayo madai yanasalia kuthibitishwa na mashine badala ya kuthibitishwa na binadamu.
Grothendieck mara kwa mara hupima pengo kati ya tatizo gumu la uboreshaji wa upatanishi na utulivu unaoweza kuteseka zaidi wa nusu kikomo. Waandishi wanaripoti muda mpya na mipaka ya chini ya 6pi / 11, kuhusu 1.7135, na mpaka wa juu wa 1.7818. Karatasi sahaba ya hisabati inatoa uthibitisho. Matokeo ya chini kabisa yanajulikana kwa sababu haijengi mfano mgumu; badala yake hupata kizuizi ambacho kinatumika katika miradi husika ya kuzungusha.
Mfumo wa utafiti uliunganisha modeli ya hoja na wakala wa usimbaji. Karatasi hiyo inasema kukimbia kulitumia GPT-5.5-Pro ββna baadaye GPT-5.6-Sol kwa hoja, Claude Code na Opus na baadaye Fable 5 kwa utekelezaji, na nodi ya GPU nne kwa utafutaji wa nambari. Vipindi viliendelezwa kupitia faili, nakala, kumbukumbu za majaribio, na muhtasari ambao ulirekodi madai kama yaliyothibitishwa, yanayoungwa mkono kwa nambari, ya kudhahania, au ya kutabiri badala ya kutegemea muktadha mmoja usiokatizwa.
Uendeshaji ulihusisha takribani vikao 240 vya utafiti kuanzia Juni 16 hadi Julai 24, na simu 2,091 za modeli za kufikiria na wastani wa tokeni milioni 152 kwa gharama inayokadiriwa ya $5,400 ya API. Takriban maagizo 40 ya tarehe ya kibinadamu yaliongoza kazi hiyo. Utafutaji wa sehemu ya juu ulipoongezeka, waendeshaji walitambua kuwa kushindwa mara kwa mara kunaweza kuonyesha kizuizi cha jumla na kuelekeza mfumo kwenye hoja ya chini kabisa. Karatasi inaelezea mabadiliko hayo katika mwelekeo wa utafiti kama uingiliaji wa kibinadamu, sio uamuzi wa uhuru.
Mfumo ulitoa reframe ya kati na uthibitisho kamili kwa 6pi/11 ya chini, ambayo waandishi waliirekebisha na kuthibitishwa kwa kujitegemea. Pia ilitoa watahiniwa wa nambari za juu na chini ambao walipitisha itifaki ya ukaguzi wa ndani, lakini waandishi hawajathibitisha vyeti hivyo kwa uhuru na hawasemi kama nadharia. Kwa hivyo karatasi hutenganisha matokeo ya hisabati yaliyothibitishwa kutoka kwa matokeo ya kubahatisha zaidi au yaliyojaribiwa na mashine.
Maelezo ya chanzo: Long-horizon AI mathematics case study on arXiv β
Kwa nini ni muhimu
Utafiti huo unatoa ushahidi kamili usio wa kawaida kuhusu AI inayotumiwa katika programu ya utafiti badala ya kazi moja ya kuigwa. Ugunduzi wake muhimu zaidi ni mgawanyiko wa kazi: mfumo ulikuwa na nguvu katika utekelezaji wa kiufundi, wakati watafiti wa kibinadamu walibaki na jukumu la kuweka ajenda, hukumu, na uthibitishaji wa mwisho.
Utafiti wa upeo wa macho ni mgumu kwa mfumo wa AI kwa sababu lengo linaweza kubadilika kadri mbinu zilizoshindwa zinavyojilimbikiza. Mshiriki muhimu lazima ahifadhi kile kilichojaribiwa, atofautishe kikomo kutoka kwa wazo ambalo halijatatuliwa, na aamue wakati swali jipya linafaa zaidi kuliko uboreshaji mwingine wa ndani. Kumbukumbu za faili za waandishi na lebo za madai ni jaribio la kufanya hali hiyo ya utafiti ionekane na iweze kukaguliwa badala ya kuruhusu majibu fasaha kusimama kwa ajili ya maendeleo.
Ugunduzi wa chini unaonyesha kwa nini uamuzi wa binadamu bado ni muhimu hata wakati wakala anaweza kutekeleza hisabati. Waendeshaji waligundua kuwa majaribio mengi ya ujenzi yalikuwa hayafaulu kwa njia ile ile na walitoa msingi wa dhana: thibitisha kizuizi kinachorudiwa yenyewe. Mfumo huo ulisaidia kurasimisha na kuthibitisha hoja. Mlolongo huo uko karibu na uchunguzi unaosimamiwa kuliko mtaalamu wa hisabati wa mashine, na tofauti ni muhimu wakati wa kuelezea kile ambacho ushahidi unaunga mkono.
Uthibitishaji wa kujitegemea ni lango la kutolewa kwa matokeo. Uchunguzi wa kifani unasema mipaka ya chini ilikaguliwa na waandishi na kwamba uthibitisho kamili unaonekana kwenye karatasi sanjari. Haisemi kwamba kila nambari inayozalishwa wakati wa kukimbia ni sahihi. Kutenganisha madai ya kiwango cha nadharia, wagombeaji waliojaribiwa na mashine na dhahania huwapa wasomaji njia ya kutathmini mchango bila kukubali imani ya ndani ya mfumo wa AI kama uthibitisho wa hisabati.
Kwa mashirika ya utafiti, somo la vitendo linafanya kazi. Mfumo wa AI unaweza kutafuta fasihi, kuandika msimbo, kuendesha majaribio, kuhifadhi majaribio ambayo hayajafaulu, na kupendekeza mabadiliko, lakini mtiririko wa kazi unaozunguka unahitaji asili, hesabu zinazoweza kurudiwa, vituo vya ukaguzi vya binadamu, na njia ya kuunda upya kwa nini timu ilibadilisha mwelekeo. Gharama iliyoripotiwa na hesabu pia huweka wazi kwamba uwezo wa upeo wa macho sio tu suala la akili ya mfano; inategemea kiunzi, wakati, na uangalizi endelevu.
Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli
Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.
What most distinguishes an AI agent from a basic chatbot?
Nini cha kutazama baadaye
Swali linalofuata ni ikiwa muundo huu wa ushirikiano unajumuisha zaidi ya tatizo na timu moja, na kama watafiti huru wanaweza kutoa matokeo yaliyothibitishwa huku wakipima gharama na uaminifu wa kila mchango wa binadamu na AI.
Urudufishaji unapaswa kujaribu vikoa vingine vya hisabati, aina za matatizo, na mifumo ya utafiti yenye kumbukumbu na miundo tofauti ya zana. Tatizo la Grothendieck tayari lilikuja na mfumo mkuu ulioundwa na binadamu, noti zilizokusanywa, mashine za uidhinishaji, na maelekezo ya watahiniwa. Muundo huo wa awali ulisaidia uendeshaji, kwa hivyo tafiti zijazo zinapaswa kuripoti ni kiasi gani cha hali ya utafiti kilitolewa mapema na jinsi matokeo yanavyobadilika wakati mfumo lazima ubainishe shida yenyewe.
Watafiti wanapaswa pia kulinganisha utekelezaji wa kiufundi na uamuzi wa utafiti kwa kutumia hatua zinazotarajiwa. Vipimo muhimu vinaweza kujumuisha ubora wa maelekezo uliyochagua, muda wa kuacha njia isiyofanikiwa, kiwango cha madai ambayo hayatumiki, idadi ya uingiliaji kati wa binadamu na sehemu ya matokeo ambayo yatabaki kukaguliwa. Uchunguzi ulioboreshwa unaweza kuonyesha kilichotokea, lakini ulinganisho unaodhibitiwa unahitajika ili kukadiria wakati mshiriki wa AI anaboresha mchakato badala ya kuongeza tu safu nyingine ya ukaguzi.
Mpaka kati ya uthibitishaji wa mashine na uthibitishaji wa binadamu unastahili kuendelea kuzingatiwa. Hesabu za muda, visaidizi vya uthibitisho, majaribio, na ukaguzi wa wapinzani vinaweza kupata makosa mengi, lakini cheti bado kinaweza kusimba lengo lisilo sahihi au kutegemea mawazo ambayo hayakuwahi kupingwa. Kazi ya ufuatiliaji inapaswa kuchapisha vizalia kamili, kutekeleza tena mipaka mikali ambayo haijathibitishwa, na kufanya matokeo yaliyoshindwa au yaliyoondolewa yaonekane kama yaliyofaulu.
Hatimaye, matoleo ya miundo, vidokezo, maelekezo ya uendeshaji, msimbo, kokotoo na nakala zinapaswa kuhifadhiwa pale ambapo leseni na faragha inaruhusiwa. Karatasi ya sasa ni muhimu kwa sababu inaripoti hali hizo na inaelezea udhaifu wa mfumo, ikiwa ni pamoja na uwakilishi dhaifu wa hali ya utafiti na uhuru mdogo katika uamuzi. Hadi timu zingine zitengeneze muundo huo, huu ni ushahidi dhabiti wa maendeleo ya hesabu yanayosaidiwa na AI, si uthibitisho kwamba mifumo ya AI inaweza kufanya utafiti usio na msingi kwa uhuru.