Wat is er gebeurd
Een nieuwe casestudy van arXiv beschrijft hoe een AI-onderzoekssysteem wiskundigen hielp de bekende grenzen van de Grothendieck-constante te verbeteren, een open probleem dat dateert uit 1953. Het artikel presenteert zowel de wiskundige uitkomst als een gedetailleerd verslag van waar het systeem goed presteerde, waar mensen het moesten sturen, en welke claims machinaal geverifieerd blijven in plaats van door mensen geverifieerd.
De constante van Grothendieck meet de kloof tussen een moeilijk combinatorisch optimalisatieprobleem en een beter handelbare semidefiniete relaxatie. De auteurs rapporteren een nieuw interval met een ondergrens van 6pi/11, ongeveer 1,7135, en een bovengrens van ongeveer 1,7818. Het bijbehorende wiskundepapier levert de bewijzen. Het ondergrensresultaat is opmerkelijk omdat het geen harde instantie oplevert; het leidt in plaats daarvan tot een belemmering die geldt voor de relevante afrondingsschema's.
Het onderzoekssysteem koppelde een redeneermodel aan een codeermiddel. Het artikel zegt dat de run GPT-5.5-Pro en later GPT-5.6-Sol gebruikte voor de redenering, Claude Code met Opus en later Fable 5 voor uitvoering, en een knooppunt met vier GPU's voor numerieke zoekopdrachten. Sessies brachten continuïteit door middel van bestanden, transcripties, experimentlogboeken en een samenvatting waarin beweringen werden vastgelegd als bewezen, numeriek ondersteund, speculatief of heuristisch in plaats van te vertrouwen op één ononderbroken context.
De run omvatte ongeveer 240 onderzoekssessies van 16 juni tot 24 juli, met 2.091 redeneringsmodeloproepen en naar schatting 152 miljoen tokens tegen geschatte API-kosten van $ 5.400. Ongeveer veertig gedateerde menselijke richtlijnen gaven richting aan het werk. Toen een zoekactie op de bovengrens vastliep, beseften de operators dat herhaalde mislukkingen op een algemene obstructie konden duiden en stuurden ze het systeem om naar een argument op de ondergrens. Het artikel beschrijft deze verandering in onderzoeksrichting als een menselijke tussenkomst en niet als een autonome beslissing.
Het systeem produceerde een centrale reframe en een volledig bewijs voor de 6pi/11-ondergrens, die de auteurs vervolgens herzien en onafhankelijk geverifieerd. Het genereerde ook sterkere numerieke bovenste en onderste kandidaten die het interne controleprotocol hebben doorstaan, maar de auteurs hebben deze certificaten niet onafhankelijk geverifieerd en stellen ze niet als stellingen. Het artikel scheidt daarom het geverifieerde wiskundige resultaat van de meer speculatieve of machinaal geteste resultaten van het systeem.
Brongegevens: Long-horizon AI mathematics case study on arXiv ↗
Waarom het ertoe doet
De studie biedt ongewoon concreet bewijs over AI die in een onderzoeksprogramma wordt gebruikt in plaats van een enkele benchmarktaak. De belangrijkste bevinding is een taakverdeling: het systeem was sterk in de technische uitvoering, terwijl menselijke onderzoekers verantwoordelijk bleven voor het opstellen van de agenda, het oordeel en de uiteindelijke verificatie.
Onderzoek op lange termijn is moeilijk voor een AI-systeem omdat het doel kan veranderen naarmate mislukte benaderingen zich opstapelen. Een nuttige medewerker moet behouden wat hij heeft geprobeerd, een doodlopend idee onderscheiden van een onopgelost idee en beslissen wanneer een nieuwe vraag waardevoller is dan een nieuwe lokale optimalisatie. Het op bestanden gebaseerde geheugen en de claimlabels van de auteurs zijn een poging om die onderzoeksstatus zichtbaar en controleerbaar te maken, in plaats van een vloeiend antwoord de vooruitgang te laten belemmeren.
De ondergrens-ontdekking laat zien waarom het menselijk oordeel nog steeds van belang is, zelfs als een agent wiskunde kan uitvoeren. De operators merkten dat veel constructiepogingen op dezelfde manier faalden en leverden de conceptuele spil: bewijs de herhaalde obstructie zelf. Het systeem hielp vervolgens bij het formaliseren en certificeren van het argument. Die volgorde ligt dichter bij verkenning onder toezicht dan bij een onafhankelijke machinewiskundige, en het onderscheid is van belang bij het beschrijven van wat het bewijsmateriaal ondersteunt.
Onafhankelijke verificatie is de vrijgavepoort voor het resultaat. De casestudy zegt dat de ondergrens door de auteurs is gecontroleerd en dat volledige bewijzen in een begeleidend artikel verschijnen. Er staat niet dat elk getal dat tijdens de run wordt geproduceerd, correct is. Door beweringen op stellingniveau, machinaal geteste kandidaten en hypothesen gescheiden te houden, krijgen lezers een manier om de bijdrage te evalueren zonder het interne vertrouwen van het AI-systeem als wiskundig bewijs te accepteren.
Voor onderzoeksorganisaties is de praktijkles operationeel. Een AI-systeem kan literatuur doorzoeken, code schrijven, experimenten uitvoeren, mislukte pogingen bewaren en transformaties voorstellen, maar de omringende workflow heeft herkomst, reproduceerbare berekeningen, expliciete menselijke controlepunten en een manier nodig om te reconstrueren waarom het team van richting is veranderd. De gerapporteerde kosten en rekenkracht maken ook duidelijk dat capaciteiten op de lange horizon niet alleen een kwestie zijn van modelintelligentie; het hangt af van steigers, tijd en voortdurend toezicht.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
What most distinguishes an AI agent from a basic chatbot?
Wat je nu moet bekijken
De volgende vraag is of dit samenwerkingspatroon zich verder uitstrekt dan één probleem en team, en of onafhankelijke onderzoekers het geverifieerde resultaat kunnen reproduceren terwijl ze de kosten en betrouwbaarheid van elke menselijke en AI-bijdrage meten.
Replicatie zou andere wiskundige domeinen, probleemtypen en onderzoekssystemen met verschillende geheugen- en toolontwerpen moeten testen. Het Grothendieck-probleem kwam al met een substantieel door mensen gebouwd raamwerk, verzamelde aantekeningen, certificeringsmechanismen en aanwijzingen voor kandidaten. Die eerdere structuur hielp dit proces, dus toekomstige studies zouden moeten rapporteren hoeveel van de onderzoeksstatus van tevoren was geleverd en hoe de resultaten veranderen wanneer het systeem het probleem zelf moet definiëren.
Onderzoekers moeten de technische uitvoering ook vergelijken met het onderzoeksoordeel met behulp van prospectieve metingen. Nuttige maatstaven kunnen zijn: de kwaliteit van de gekozen richting, de tijd om een falend pad te verlaten, het aantal niet-ondersteunde claims, het aantal menselijke tussenkomsten en het deel van de output dat onafhankelijke controle overleeft. Een gepolijste casestudy kan laten zien wat er is gebeurd, maar gecontroleerde vergelijkingen zijn nodig om in te schatten wanneer een AI-medewerker het proces verbetert, in plaats van simpelweg een nieuwe beoordelingslaag toe te voegen.
De grens tussen machineverificatie en menselijke verificatie verdient voortdurende aandacht. Intervalberekeningen, bewijsassistenten, tests en audits van tegenstanders kunnen veel fouten opsporen, maar toch kan een certificaat nog steeds het verkeerde doel coderen of afhankelijk zijn van aannames die nooit zijn betwist. Vervolgwerk moet volledige artefacten publiceren, de sterkste niet-geverifieerde grenzen opnieuw uitvoeren en mislukte of ingetrokken resultaten even zichtbaar maken als succesvolle.
Ten slotte moeten modelversies, prompts, stuurrichtlijnen, code, rekenkracht en transcripties behouden blijven waar licenties en privacy dit toelaten. Het huidige artikel is deels waardevol omdat het deze omstandigheden rapporteert en de zwakke punten van het systeem beschrijft, waaronder de kwetsbare representatie van de onderzoeksstaat en de beperkte autonomie in het oordeel. Totdat andere teams het patroon reproduceren, is dit een sterk bewijs van door AI ondersteunde wiskundige vooruitgang, en geen bewijs dat AI-systemen onafhankelijk onderzoek met een open einde kunnen uitvoeren.