Tillbaka till Nyheter
InnovationAI Understanding genomgång

Anthropic säger att Claude formaliserade Fermats sista teorem i Lean

Anthropic säger att Claude producerade en komplett datorkontrollerad formalisering av Fermats sista teorem på 11 dagar, med hjälp av 13 miljoner rader Lean-kod och tiotusentals mellansatser.

4 min readRead the primary source
Source-provided image accompanying Anthropic says Claude formalized Fermat’s Last Theorem in Lean
Primärt källdokumentKälla inspelad
Förläggare
anthropic.com
Källlänk
anthropic.comhttps://www.anthropic.com/research/formalizing-fermats-last-theorem
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
SammanhangFörstå detta på 60 sekunder

Börja här

Testa dig självAI Models Explained Quiz
Source video from anthropic.com · shown with attribution.

Vad hände

Anthropic säger att Claude arbetade i stort sett självständigt i 11 dagar för att producera en heltäckande, datorkontrollerad formalisering av Fermats sista teorem i Lean proof-assistenten. Företaget säger att beviset kontrollerades av Lean, använde endast Leans tre standardaxiom och granskades av matematikern Kevin Buzzard.

Anthropic rapporterar att Claude formaliserade Fermats sista sats, påståendet att inga positiva heltal uppfyller aⁿ + bⁿ = cⁿ för n större än 2. Satsen bevisades första gången av Andrew Wiles 1995. ZXQAIU0Q new work for betonar snarare ett existerande resultat än ett verifierat resultat. upptäcka ett nytt bevis.

Enligt Anthropic genererade Claude 13 miljoner rader med Lean-kod, bevisade 30 300 mellansatser och använde 29 500 av dem i det slutliga beviset. Dussintals Claude-agenter samarbetade genom Prove2Me, en öppen plattform som spårade beroenden mellan teoremsatser och hjälpte agenter att arbeta parallellt.

Anthropic säger att det färdiga beviset kontrollerades av Lean och använder endast Leans tre standardaxiom. Företaget säger också att en komparator bekräftade att satssatsen matchade Mathlibs uttalande om Fermats sista sats. Kevin Buzzard granskade beviset och beskrev prestationen som betydande, medan Anthropic noterar att resultatet förblir föremål för omprövning.

Företaget säger att tidiga försök misslyckades eftersom agenter tappade koll på projektets tillstånd. Ansträngningen lyckades efter att forskarna anammat Prove2Me och en Claude Code-baserad multi-agent sele. Anthropic uppskattar att projektet förbrukade cirka sex miljarder output-tokens från en intern forskningsmodell som är ungefär jämförbar med Claude Fable 5.1. Källan ger inte ett offentligt pris för att reproducera hela ansträngningen eller fastställa att samma resultat för närvarande är praktiskt för vanliga Claude-användare.

Källinformation: anthropic.com ↗

Varför det spelar roll

Verket handlar om verifiering snarare än att upptäcka ett nytt bevis på Fermats sista sats. Om det reproduceras oberoende, skulle det visa att AI-system kan hjälpa till att översätta extremt komplex mänsklig matematik till maskinkontrollerbar form, vilket potentiellt minskar tiden som krävs för att verifiera framtida bevis och AI-genererade matematiska påståenden. Resultatet visar också att användbar autonomi kan bero lika mycket på projektledningsverktyg och formella byggnadsställningar som på den underliggande modellen.

Formella korrekturassistenter som Lean kontrollerar om varje logiskt steg följer av tidigare definitioner, satser och axiom. Det kan ge en starkare korrekthetskontroll än vanlig referentgranskning, även om det inte i sig gör ett bevis förståeligt för icke-specialister eller slår fast att det formaliserade uttalandet fångar varje avsedd matematisk nyans.

Det påstådda framsteg är i skala och hastighet. Anthropic säger att formaliseringen förväntades ta år baserat på communityns befintliga ritning, medan Claude slutförde den på 11 dagar. Om den offentliga koden överlever oberoende granskning kan tillvägagångssättet hjälpa matematiker att kontrollera långa bevis och inspektera AI-genererad matematik mer effektivt.

Resultatet är också en systemdemonstration. Anthropic tillskriver framgång inte bara till Claude utan till beroendespårning, teoremsökning, parallellt samarbete, snabbare kompilering och ett arbetsflöde med flera agenter. Det tyder på att framtida matematisk automatisering kan bero på specialiserad infrastruktur snarare än på en modell som fungerar ensam.

Viktiga begränsningar kvarstår. Källan är Anthropic:s egen redogörelse för sitt system, och artikeln rapporterar inte en genomförd oberoende granskning, extern replikering, jämförande kostnader eller en peer-reviewed bedömning av hela artefakten. Buzzards granskning är ett meningsfullt bevis på expertengagemang, men den motsvarar inte bred oberoende validering.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konceptkontroll+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Vad du ska titta på härnäst

Oberoende matematikers omkontroll av den allmänt tillgängliga Lean-koden kommer att vara viktig, liksom bevis på att metoden generaliserar bortom ett teorem med en befintlig bevisritning. Den praktiska kostnaden, reproducerbarheten på externa system och användbarheten av det resulterande beviset för mänskliga matematiker är fortfarande oklart.

Se efter oberoende kontroller av GitHub-beviset, inklusive om det kompileras från det publicerade materialet och om externa Lean-användare identifierar fel, dolda antaganden eller beroenden som inte beskrivs i tillkännagivandet.

Se om samma arbetsflöde kan formalisera andra stora teorem utan en ovanligt detaljerad, mänskligt utvecklad ritning. Anthropic rapporterar ett mindre experiment som formaliserar Vinogradovs Three Primes Theorem på tre dagar med hjälp av tre personliga Claude Max-planer, men källan ger ingen oberoende utvärdering av det resultatet.

Kostnads- och åtkomstmodellen är olösta. Anthropic säger att det erbjuder gratis eller rabatterade prenumerationer, forskningskrediter och dedikerade anslag för större projekt, men det sägs inte att den fullständiga Fermat-formaliseringen kan reproduceras genom ett konsumentabonnemang eller avslöja den monetära kostnaden för de rapporterade sex miljarder output-token.

Det bredare testet kommer att vara om formalisering blir en rutinmässig följeslagare till mänskliga läsbara matematiska uppsatser. Anthropic hävdar att maskinkontrollerbara bevis kan hjälpa domare att hålla jämna steg med AI-genererat arbete, samtidigt som de erkänner att formaliserade bevis inte bör ersätta förklaringar skrivna för mänskliga läsare.

Relaterade guider och frågesporter

AI-modeller förklarasAI:s framtidAI utbildningTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker
Hittade du detta användbart?