Vissza a Hírekhez
InnovációAI Understanding eligazítás

A mesterséges intelligencia által támogatott matematikai tanulmányok hosszú ideig feszegetik a határokat

Egy esettanulmány arról számol be, hogy egy mesterséges intelligencia kutatási rendszere segített javítani a Grothendieck-állandó határait, míg a szerzők hangsúlyozzák, hogy az emberi kutatók a kulcsfontosságú forgáspontot választották, és egymástól függetlenül csak a tételszintű eredményt ellenőrizték.

6 min readRead the primary source
Elsődleges forrású dokumentumForrás rögzített
Kiadó
Long-horizon AI mathematics case study on arXiv
Forrás link
arxiv.orghttps://arxiv.org/abs/2608.11195
Forrás típusa
Elsődleges dokumentum – hivatalos közlemény, papír, irattár vagy belső oldal, amelyet közvetlenül olvasunk.
KontextusÉrtsd meg ezt 60 másodperc alatt

Kezdje itt

Kulcsfogalmak

API (Application Programming Interface)
Strukturált módja annak, hogy egy szoftverrendszer kéréseket küldjön egy másik rendszernek, és válaszokat fogadjon onnan.
Memória (ügynökmemória)
Tárolt kontextus, amelyet az AI-ügynök több lépésben vagy munkamenetben használ a folytonosság javítása érdekében.
Benchmark
A modell teljesítményének mérésére és összehasonlítására használt szabványos teszt vagy adatkészlet.
Teszteld magadAI ügynökök kvíz

Mi történt

Egy új arXiv esettanulmány leírja, hogy egy mesterséges intelligencia-kutatórendszer hogyan segített a matematikusoknak javítani a Grothendieck-állandó ismert határain, amely egy 1953-ig datálható nyitott probléma. A tanulmány bemutatja a matematikai eredményt és egy részletes feljegyzést arról, hogy a rendszer hol működött jól, hol kellett irányítani, és mely állítások maradnak gépi igazolás helyett.

A Grothendieck-konstans a kemény kombinatorikus optimalizálási probléma és a jobban kezelhető félig meghatározott relaxáció közötti rést méri. A szerzők egy új intervallumról számolnak be, amelynek alsó határa 6pi/11, körülbelül 1,7135, felső határa pedig körülbelül 1,7818. A kísérő matematikai dolgozat biztosítja a bizonyításokat. Az alsó korlát eredmény azért figyelemre méltó, mert nem hoz létre kemény példányt; ehelyett olyan akadályt vezet le, amely a vonatkozó kerekítési sémákra érvényes.

A kutatási rendszer egy érvelési modellt kódoló ágenssel párosított. A cikk szerint a futtatás a GPT-5.5-Pro ​​és később a GPT-5.6-Sol-t használta az érveléshez, a Claude Code-t Opus-szal és később a Fable 5-öt a végrehajtáshoz, valamint egy négy GPU-s csomópontot a numerikus keresésekhez. A munkamenetek folytonosságot hordoztak a fájlok, átiratok, kísérleti naplók és egy összefoglaló révén, amely az állításokat bizonyítottként, számszerűen alátámasztottként, sejtésként vagy heurisztikusként rögzítette, nem pedig egyetlen megszakítás nélküli kontextusra támaszkodva.

A futás nagyjából 240 kutatási munkamenetet foglalt le június 16. és július 24. között, 2091 okfejtési modellhívással és 152 millió tokennel, 5400 dolláros API-költséggel. Körülbelül 40 keltezett emberi irányelv irányította a munkát. Amikor a felső korlát keresése sima szintre emelkedett, az operátorok felismerték, hogy az ismétlődő hibák általános akadályt jelezhetnek, és átirányították a rendszert egy alsó határértékre. A tanulmány a kutatási irány megváltoztatását emberi beavatkozásként írja le, nem önálló döntésként.

A rendszer készített egy központi keretet és egy teljes bizonyítást a 6pi/11 alsó korláthoz, amelyet a szerzők azután felülvizsgáltak és függetlenül ellenőriztek. Erősebb numerikus felső és alsó jelölteket is generált, amelyek átmentek a belső ellenőrzési protokollon, de a szerzők nem ellenőrizték önállóan ezeket a tanúsítványokat, és nem állítják őket tételként. A tanulmány ezért elválasztja az ellenőrzött matematikai eredményt a rendszer spekulatívabb vagy gépi tesztelt kimeneteitől.

Forrás részletei: Long-horizon AI mathematics case study on arXiv ↗

Miért számít

A tanulmány szokatlanul konkrét bizonyítékokat kínál a kutatási program során alkalmazott AI-ról, nem pedig egyetlen feladatról. Legfontosabb megállapítása a munkamegosztás: a rendszer erős volt a technikai kivitelezésben, miközben az emberkutatók feladata maradt a napirend felállítása, az ítéletalkotás és a végső ellenőrzés.

A hosszú távú kutatás nehéz egy MI-rendszer számára, mert a cél megváltozhat, ahogy a sikertelen megközelítések halmozódnak. Egy hasznos munkatársnak meg kell őriznie a kipróbált dolgokat, meg kell különböztetnie a zsákutcát a megoldatlan ötlettől, és el kell döntenie, hogy egy új kérdés mikor értékesebb egy másik helyi optimalizálásnál. A szerzők fájl alapú memória- és követeléscímkéi arra tesznek kísérletet, hogy a kutatási állapotot láthatóvá és auditálhatóvá tegyék, ahelyett, hogy lehetővé tennék, hogy egy gördülékeny válasz álljon előre.

Az alsó határú felfedezés megmutatja, miért számít még akkor is az emberi ítélőképesség, ha egy ügynök képes végrehajtani a matematikát. Az üzemeltetők észrevették, hogy sok megkísérelt konstrukció ugyanúgy kudarcot vallott, és megadták a koncepcionális forgáspontot: magát az ismétlődő akadályt bizonyítsák be. A rendszer ezután segített az érvelés formalizálásában és hitelesítésében. Ez a szekvencia közelebb áll a felügyelt feltáráshoz, mint egy független gépi matematikushoz, és a különbségtétel fontos a bizonyítékok alátámasztásának leírásakor.

A független ellenőrzés az eredmény kioldó kapuja. Az esettanulmány szerint a szerzők ellenőrizték az alsó korlátot, és a teljes bizonyítványok egy kísérőanyagban jelennek meg. Nem azt mondja, hogy a futás során előállított minden szám helyes. A tételszintű állítások, a géppel tesztelt jelöltek és a hipotézisek külön tartása lehetőséget ad az olvasóknak, hogy értékeljék a hozzájárulást anélkül, hogy elfogadnák az AI-rendszer belső bizalmát matematikai bizonyítékként.

A kutatószervezetek számára a gyakorlati óra működőképes. Egy mesterséges intelligencia rendszer kutathat a szakirodalomban, írhat kódot, futtathat kísérleteket, megőrizheti a sikertelen kísérleteket és javasolhat átalakításokat, de a környező munkafolyamatnak forrásra, reprodukálható számításokra, explicit emberi ellenőrzőpontokra és egy módra van szüksége annak rekonstruálására, hogy a csapat miért változtatott irányt. A jelentett költségek és számítások azt is világossá teszik, hogy a hosszú távú képesség nem csak a modell intelligencia kérdése; az állványzattól, az időtől és a folyamatos felügyelettől függ.

Interactive Mechanism

Interaktív mechanizmus: Hogyan működik valójában

Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktív koncepció ellenőrzése+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Mit nézzünk ezután

A következő kérdés az, hogy ez az együttműködési minta általánosítható-e egy problémán és egy csapaton túl, és hogy a független kutatók képesek-e reprodukálni az ellenőrzött eredményt, miközben mérik az egyes emberi és mesterséges intelligencia hozzájárulás költségeit és megbízhatóságát.

A replikációnak más matematikai tartományokat, problématípusokat és kutatási rendszereket kell tesztelnie különböző memória- és eszközkialakítással. A Grothendieck-probléma már egy jelentős, ember által épített kerettel, felhalmozott jegyzetekkel, tanúsító gépezetekkel és jelölt irányokkal járt. Ez a korábbi struktúra segítette a futást, így a jövőbeni tanulmányoknak be kell számolniuk, hogy a kutatási állapotból mennyit adtak előre, és hogyan változnak az eredmények, amikor a rendszernek magának kell meghatároznia a problémát.

A kutatóknak össze kell hasonlítaniuk a műszaki végrehajtást a kutatási döntéssel, prospektív mérések segítségével. A hasznos mérőszámok közé tartozhat a választott irányok minősége, a kudarcos út elhagyásához szükséges idő, a nem alátámasztott követelések aránya, az emberi beavatkozások száma és a független ellenőrzést túlélő kimenetek hányada. Egy finomított esettanulmány megmutathatja, mi történt, de ellenőrzött összehasonlításokra van szükség annak becsléséhez, hogy az AI munkatársa mikor javítja a folyamatot, ahelyett, hogy egyszerűen hozzáadna egy újabb felülvizsgálati réteget.

A gépi ellenőrzés és az emberi ellenőrzés közötti határ folyamatos figyelmet érdemel. Az intervallum aritmetika, a bizonyítási asszisztensek, a tesztek és a kontradiktórius auditok sok hibát észlelhetnek, de előfordulhat, hogy a tanúsítvány továbbra is rossz célt kódol, vagy olyan feltevésektől függ, amelyeket soha nem támadtak meg. A nyomon követési munkának közzé kell tennie a teljes műtermékeket, újra le kell futnia a legerősebb ellenőrizetlen határokat, és a sikertelen vagy visszavont eredményeket ugyanúgy láthatóvá kell tennie, mint a sikereseket.

Végül meg kell őrizni a modellverziókat, promptokat, irányító utasításokat, kódot, számítást és átiratokat, ahol a licenc és az adatvédelem lehetővé teszi. A jelen tanulmány részben azért is értékes, mert beszámol ezekről a feltételekről, és leírja a rendszer gyengeségeit, beleértve a kutatóállamok törékeny képviseletét és az ítélkezésben való korlátozott autonómiát. Amíg más csapatok nem reprodukálják a mintát, ez a mesterséges intelligencia által támogatott matematikai fejlődés erős bizonyítéka, nem pedig annak bizonyítéka, hogy a mesterséges intelligencia rendszerek önállóan is végezhetnek nyílt végű kutatást.

Kapcsolódó útmutatók és vetélkedők

AI ügynökökAz AI modellek magyarázataAI képzésLLM értékelésekTesztelje, amit tud – próbáljon ki egy ingyenes AI-kvíztKeressen egy AI kifejezést a szószedetünkbenKövesse az AI modell kiadáskövetőjét
Ezt hasznosnak találta?