Powrót do Wiadomości
InnowacjaAI Understanding odprawa

Anthropic mówi, że Claude sformalizował ostatnie twierdzenie Fermata w Lean

Anthropic mówi, że Claude stworzył kompletną, sprawdzoną komputerowo formalizację Ostatniego Twierdzenia Fermata w 11 dni, wykorzystując 13 milionów linii kodu Lean i dziesiątki tysięcy twierdzeń pośrednich.

4 min readRead the primary source
Source-provided image accompanying Anthropic says Claude formalized Fermat’s Last Theorem in Lean
Dokument źródłowyŹródło zapisane
Wydawca
anthropic.com
Link źródłowy
anthropic.comhttps://www.anthropic.com/research/formalizing-fermats-last-theorem
Typ źródła
Dokument podstawowy — oficjalne ogłoszenie, dokument, zgłoszenie lub strona własna, którą czytamy bezpośrednio.
KontekstZrozum to w 60 sekund

Zacznij tutaj

Sprawdź sięQuiz objaśniający modele AI
Source video from anthropic.com · shown with attribution.

Co się stało

Anthropic mówi, że Claude pracował w dużej mierze autonomicznie przez 11 dni, aby stworzyć kompleksową, sprawdzoną komputerowo formalizację Ostatniego twierdzenia Fermata w asystencie Lean Proof. Firma twierdzi, że dowód został sprawdzony przez Lean, wykorzystał jedynie trzy standardowe aksjomaty Leana i został sprawdzony przez matematyka Kevina Buzzarda.

Anthropic donosi, że Claude sformalizował Ostatnie Twierdzenie Fermata, stwierdzenie, że żadna dodatnia liczba całkowita nie spełnia aⁿ + bⁿ = cⁿ dla n większych niż 2. Twierdzenie zostało po raz pierwszy udowodnione przez Andrew Wilesa w 1995 r. Anthropic podkreśla, że ​​nowa praca formalizuje i weryfikuje istniejący wynik matematyczny, zamiast odkrywać nowy dowód.

Według Anthropic, Claude wygenerował 13 milionów linii kodu Lean, udowodnił 30 300 twierdzeń pośrednich i wykorzystał 29 500 z nich w ostatecznym dowodzie. Dziesiątki agentów Claude współpracowało za pośrednictwem Prove2Me, otwartej platformy, która śledziła zależności między instrukcjami twierdzeń i pomagała agentom pracować równolegle.

Anthropic mówi, że gotowy dowód został sprawdzony przez Lean i wykorzystuje tylko trzy standardowe aksjomaty Lean. Firma twierdzi również, że komparator potwierdził, że twierdzenie jest zgodne ze stwierdzeniem Mathliba dotyczącym Ostatniego Twierdzenia Fermata. Kevin Buzzard dokonał przeglądu dowodu i określił osiągnięcie jako znaczące, natomiast Anthropic zauważa, że ​​wynik podlega ponownemu sprawdzeniu.

Firma twierdzi, że wczesne próby zakończyły się niepowodzeniem, ponieważ agenci stracili kontrolę nad stanem projektu. Wysiłek zakończył się sukcesem, gdy badacze zastosowali Prove2Me i wieloagentową uprząż opartą na Claude Code. Anthropic szacuje, że projekt pochłonął około sześciu miliardów tokenów wyjściowych z wewnętrznego modelu badawczego, mniej więcej porównywalnego z Claude Fable 5.1. Źródło nie podaje publicznej ceny za odtworzenie pełnego wysiłku ani nie ustala, że ​​ten sam wynik jest obecnie praktyczny dla zwykłych użytkowników Claude.

Szczegóły źródła: anthropic.com ↗

Dlaczego to ma znaczenie

Praca skupia się na weryfikacji, a nie na odkrywaniu nowego dowodu Ostatniego Twierdzenia Fermata. Jeśli zostanie niezależnie odtworzone, pokazałoby, że systemy sztucznej inteligencji mogą pomóc w przetłumaczeniu niezwykle złożonej matematyki ludzkiej na formę sprawdzalną maszynowo, potencjalnie skracając czas wymagany do weryfikacji przyszłych dowodów i twierdzeń matematycznych generowanych przez sztuczną inteligencję. Wynik podkreśla również, że użyteczna autonomia może zależeć w równym stopniu od narzędzi do zarządzania projektami i formalnych rusztowań, jak i od modelu leżącego u ich podstaw.

Asystenci dowodu formalnego, tacy jak Lean, sprawdzają, czy każdy logiczny krok wynika z wcześniejszych definicji, twierdzeń i aksjomatów. Może to zapewnić skuteczniejszą kontrolę poprawności niż zwykła recenzja partnerska, chociaż samo w sobie nie stanowi dowodu zrozumiałego dla niespecjalistów ani nie ustala, że ​​sformalizowane stwierdzenie oddaje wszystkie zamierzone niuanse matematyczne.

Twierdzony postęp ma skalę i szybkość. Anthropic twierdzi, że na podstawie istniejącego planu społeczności formalizacja miała zająć lata, podczas gdy Claude zakończyła ją w 11 dni. Jeśli kod publiczny przetrwa niezależną kontrolę, podejście to może pomóc matematykom w sprawdzaniu długich dowodów i skuteczniejszej kontroli matematyki generowanej przez sztuczną inteligencję.

Rezultatem jest także demonstracja systemów. Anthropic przypisuje sukces nie tylko Claude, ale także śledzeniu zależności, wyszukiwaniu twierdzeń, współpracy równoległej, szybszej kompilacji i przepływowi pracy z wieloma agentami. Sugeruje to, że przyszła automatyzacja matematyczna może zależeć od wyspecjalizowanej infrastruktury, a nie od samodzielnego modelu.

Ważne ograniczenia pozostają. Źródłem jest własna relacja Anthropic dotycząca jego systemu, a artykuł nie opisuje zakończonego niezależnego audytu, replikacji zewnętrznej, kosztów porównawczych ani recenzowanej oceny całego artefaktu. Recenzja Buzzarda stanowi znaczący dowód zaangażowania ekspertów, ale nie jest równoznaczna z szeroką niezależną walidacją.

Interactive Mechanism

Mechanizm interaktywny: jak to faktycznie działa

Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktywna kontrola koncepcji+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Co obejrzeć dalej

Ważne będzie ponowne sprawdzenie przez niezależnych matematyków publicznie dostępnego kodu Lean, ponieważ udowodni to, że podejście to wykracza poza twierdzenie z istniejącym planem dowodu. Praktyczny koszt, odtwarzalność w systemach zewnętrznych i użyteczność uzyskanego dowodu dla matematyków pozostają niejasne.

Uważaj na niezależne kontrole dowodu GitHub, w tym na to, czy kompiluje się on na podstawie opublikowanych materiałów i czy zewnętrzni użytkownicy Lean identyfikują błędy, ukryte założenia lub zależności nie opisane w ogłoszeniu.

Sprawdź, czy ten sam przepływ pracy może sformalizować inne główne twierdzenia bez niezwykle szczegółowego planu opracowanego przez człowieka. Anthropic donosi o mniejszym eksperymencie formalizującym Twierdzenie o trzech liczbach pierwszych Vinogradowa w ciągu trzech dni przy użyciu trzech osobistych planów Claude Max, ale źródło nie podaje niezależnej oceny tego wyniku.

Model kosztów i dostępu pozostaje nierozwiązany. Anthropic twierdzi, że oferuje bezpłatne lub obniżone subskrypcje, kredyty badawcze i dedykowane granty na większe projekty, ale nie stwierdza, że ​​pełną formalizację Fermata można odtworzyć w ramach subskrypcji konsumenckiej ani nie ujawnia kosztu pieniężnego zgłoszonych sześciu miliardów tokenów wyjściowych.

Szerszym testem będzie sprawdzenie, czy formalizacja stanie się rutynowym towarzyszem prac matematycznych czytelnych dla człowieka. Anthropic argumentuje, że dowody sprawdzalne maszynowo mogłyby pomóc recenzentom dotrzymać kroku pracy generowanej przez sztuczną inteligencję, jednocześnie potwierdzając, że sformalizowane dowody nie powinny zastępować wyjaśnień pisanych dla ludzkich czytelników.

Powiązane przewodniki i quizy

Wyjaśnienie modeli AIPrzyszłość AISzkolenie AISprawdź swoją wiedzę — wypróbuj darmowy quiz dotyczący sztucznej inteligencjiWyszukaj termin związany ze sztuczną inteligencją w naszym glosariuszuPostępuj zgodnie z modułem śledzenia wydań modeli AI
Uznałeś to za przydatne?