Înapoi la Știri
InovațieAI Understanding briefing

Studiul de matematică asistat de inteligență artificială întărește limitele unei constante de lungă durată

Un studiu de caz raportează că un sistem de cercetare AI a ajutat la îmbunătățirea limitelor constantei Grothendieck, în timp ce autorii subliniază că cercetătorii umani au ales pivotul cheie și au verificat în mod independent doar rezultatul la nivel de teoremă.

6 min readRead the primary source
Document sursă primarăSursa înregistrată
Editor
Long-horizon AI mathematics case study on arXiv
Link sursă
arxiv.orghttps://arxiv.org/abs/2608.11195
Tip sursă
Document principal — un anunț oficial, hârtie, depunere sau pagină primară pe care o citim direct.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

API (Interfață de programare a aplicației)
O modalitate structurată pentru ca un sistem software să trimită cereri și să primească răspunsuri de la un alt sistem.
Memorie (Memorie agent)
Context stocat pe care un agent AI îl folosește în pași sau sesiuni pentru a îmbunătăți continuitatea.
Benchmark
Un test standardizat sau un set de date utilizat pentru a măsura și compara performanța modelului.
Testează-teTest pentru agenții AI

Ce sa întâmplat

Un nou studiu de caz arXiv descrie modul în care un sistem de cercetare AI i-a ajutat pe matematicieni să îmbunătățească limitele cunoscute ale constantei Grothendieck, o problemă deschisă care datează din 1953. Lucrarea prezintă atât rezultatul matematic, cât și o înregistrare detaliată a locului în care sistemul a fost executat bine, unde au trebuit să-l orienteze oamenii și care afirmații rămân verificate de către om, mai degrabă decât de mașină.

Constanta Grothendieck măsoară decalajul dintre o problemă de optimizare combinatorică dificilă și o relaxare semidefinită mai tratabilă. Autorii raportează un nou interval cu o limită inferioară de 6pi/11, aproximativ 1,7135 și o limită superioară de aproximativ 1,7818. Lucrarea de matematică însoțitoare furnizează dovezile. Rezultatul limită inferioară este notabil deoarece nu construiește o instanță dificilă; în schimb, derivă o obstrucție care se aplică în toate schemele de rotunjire relevante.

Sistemul de cercetare a cuplat un model de raționament cu un agent de codare. Lucrarea spune că rularea a folosit GPT-5.5-Pro ​​și mai târziu GPT-5.6-Sol pentru raționament, Claude Code cu Opus și mai târziu Fable 5 pentru execuție și un nod cu patru GPU pentru căutări numerice. Sesiunile au asigurat continuitate prin fișiere, transcrieri, jurnale de experiment și un rezumat care înregistra afirmațiile ca dovedite, susținute numeric, conjecturale sau euristice, mai degrabă decât să se bazeze pe un context neîntrerupt.

Execuția a acoperit aproximativ 240 de sesiuni de cercetare din 16 iunie până pe 24 iulie, cu 2.091 de apeluri cu model de raționament și aproximativ 152 de milioane de jetoane la un cost API estimat la 5.400 USD. Aproximativ 40 de directive umane datate au condus lucrarea. Când o căutare a limitei superioare a atins platoul, operatorii au recunoscut că eșecurile repetate ar putea indica o obstrucție generală și au redirecționat sistemul către un argument de limita inferioară. Lucrarea descrie această schimbare în direcția cercetării ca o intervenție umană, nu o decizie autonomă.

Sistemul a produs o reîncadrare centrală și o dovadă completă pentru limita inferioară 6pi/11, pe care autorii le-au revizuit apoi și au verificat independent. De asemenea, a generat candidați numerici superioare și inferioare mai puternice care au trecut protocolul de verificare internă, dar autorii nu au verificat în mod independent acele certificate și nu le enunț ca teoreme. Prin urmare, lucrarea separă rezultatul matematic verificat de rezultatele mai speculative sau testate de mașină ale sistemului.

Detalii sursa: Long-horizon AI mathematics case study on arXiv ↗

De ce contează

Studiul oferă dovezi neobișnuit de concrete despre IA utilizată într-un program de cercetare, mai degrabă decât într-o singură sarcină de referință. Cea mai importantă constatare a acesteia este diviziunea muncii: sistemul a fost puternic la execuția tehnică, în timp ce cercetătorii umani au rămas responsabili pentru stabilirea agendei, judecata și verificarea finală.

Cercetarea pe orizont lung este dificilă pentru un sistem AI, deoarece obiectivul se poate schimba pe măsură ce abordările eșuate se acumulează. Un colaborator util trebuie să rețină ceea ce s-a încercat, să distingă un punct mort de o idee nerezolvată și să decidă când o nouă întrebare este mai valoroasă decât o altă optimizare locală. Memoria bazată pe fișiere și etichetele de revendicare ale autorilor sunt o încercare de a face ca starea de cercetare să fie vizibilă și auditabilă, mai degrabă decât să permită un răspuns fluent pentru progres.

Descoperirea limitei inferioare arată de ce judecata umană încă contează chiar și atunci când un agent poate executa matematica. Operatorii au observat că multe încercări de construcții eșuau în același mod și au furnizat pivotul conceptual: dovediți obstrucția repetată în sine. Apoi sistemul a ajutat la formalizarea și certificarea argumentului. Această secvență este mai aproape de explorarea supravegheată decât de un matematician independent de mașini, iar distincția contează atunci când descriem ceea ce susțin dovezile.

Verificarea independentă este poarta de eliberare a rezultatului. Studiul de caz spune că limita inferioară a fost verificată de autori și că dovezile complete apar într-o lucrare însoțitoare. Nu spune că fiecare număr produs în timpul rulării este corect. Menținerea separată a afirmațiilor la nivel de teoremă, a candidaților testați de mașină și a ipotezelor le oferă cititorilor o modalitate de a evalua contribuția fără a accepta încrederea internă a sistemului AI ca dovadă matematică.

Pentru organizațiile de cercetare, lecția practică este operațională. Un sistem AI poate căuta literatură, scrie cod, rula experimente, păstra încercările eșuate și poate propune transformări, dar fluxul de lucru din jur are nevoie de proveniență, calcule reproductibile, puncte de control umane explicite și o modalitate de a reconstrui motivul pentru care echipa și-a schimbat direcția. Costul raportat și calculul arată, de asemenea, că capacitatea pe orizont lung nu este doar o chestiune de inteligență a modelului; depinde de schele, timp și supraveghere susținută.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificare interactivă a conceptului+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Ce să urmărești în continuare

Următoarea întrebare este dacă acest model de colaborare se generalizează dincolo de o singură problemă și echipă și dacă cercetătorii independenți pot reproduce rezultatul verificat în timp ce măsoară costul și fiabilitatea fiecărei contribuții umane și AI.

Replicarea ar trebui să testeze alte domenii matematice, tipuri de probleme și sisteme de cercetare cu diferite modele de memorie și instrumente. Problema Grothendieck a venit deja cu un cadru substanțial construit de om, note acumulate, mașini de certificare și direcții candidate. Acea structură anterioară a ajutat rularea, așa că studiile viitoare ar trebui să raporteze cât de mult din starea cercetării a fost furnizată în avans și cum se schimbă rezultatele atunci când sistemul trebuie să definească problema în sine.

Cercetătorii ar trebui, de asemenea, să compare execuția tehnică cu raționamentul cercetării folosind măsuri prospective. Valorile utile ar putea include calitatea direcțiilor alese, timpul de abandonare a unei căi care eșuează, rata cererilor nesusținute, numărul intervențiilor umane și fracția de rezultate care supraviețuiesc verificării independente. Un studiu de caz rafinat poate arăta ce s-a întâmplat, dar sunt necesare comparații controlate pentru a estima când un colaborator AI îmbunătățește procesul, mai degrabă decât să adauge pur și simplu un alt nivel de revizuire.

Limita dintre verificarea mașinii și verificarea umană merită o atenție continuă. Aritmetica intervalelor, asistenții de dovezi, testele și auditurile contradictorii pot detecta multe erori, dar un certificat poate încă codifica ținta greșită sau poate depinde de ipoteze care nu au fost niciodată contestate. Lucrările ulterioare ar trebui să publice artefacte complete, să ruleze din nou cele mai puternice limite neverificate și să facă rezultatele eșuate sau retrase la fel de vizibile ca și cele de succes.

În cele din urmă, versiunile modelului, instrucțiunile, directivele de direcție, codul, calculul și transcrierile ar trebui păstrate acolo unde licențele și confidențialitatea permit. Lucrarea actuală este valoroasă parțial pentru că raportează acele condiții și descrie punctele slabe ale sistemului, inclusiv reprezentarea fragilă a statului de cercetare și autonomie limitată de judecată. Până când alte echipe reproduc modelul, aceasta este o dovadă puternică a progresului matematic asistat de AI, nu o dovadă că sistemele AI pot efectua în mod independent cercetări deschise.

Ghiduri și chestionare conexe

Agenți AIModelele AI explicateAntrenament AIEvaluări LLMTestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a lansării modelului AI
Ai găsit asta util?