Co się stało
Anthropic mówi, że Claude pracował w dużej mierze autonomicznie przez 11 dni, aby stworzyć kompleksową, sprawdzoną komputerowo formalizację Ostatniego twierdzenia Fermata w asystencie Lean Proof. Firma twierdzi, że dowód został sprawdzony przez Lean, wykorzystał jedynie trzy standardowe aksjomaty Leana i został sprawdzony przez matematyka Kevina Buzzarda.
Anthropic donosi, że Claude sformalizował Ostatnie Twierdzenie Fermata, stwierdzenie, że żadna dodatnia liczba całkowita nie spełnia aⁿ + bⁿ = cⁿ dla n większych niż 2. Twierdzenie zostało po raz pierwszy udowodnione przez Andrew Wilesa w 1995 r. Anthropic podkreśla, że nowa praca formalizuje i weryfikuje istniejący wynik matematyczny, zamiast odkrywać nowy dowód.
Według Anthropic, Claude wygenerował 13 milionów linii kodu Lean, udowodnił 30 300 twierdzeń pośrednich i wykorzystał 29 500 z nich w ostatecznym dowodzie. Dziesiątki agentów Claude współpracowało za pośrednictwem Prove2Me, otwartej platformy, która śledziła zależności między instrukcjami twierdzeń i pomagała agentom pracować równolegle.
Anthropic mówi, że gotowy dowód został sprawdzony przez Lean i wykorzystuje tylko trzy standardowe aksjomaty Lean. Firma twierdzi również, że komparator potwierdził, że twierdzenie jest zgodne ze stwierdzeniem Mathliba dotyczącym Ostatniego Twierdzenia Fermata. Kevin Buzzard dokonał przeglądu dowodu i określił osiągnięcie jako znaczące, natomiast Anthropic zauważa, że wynik podlega ponownemu sprawdzeniu.
Firma twierdzi, że wczesne próby zakończyły się niepowodzeniem, ponieważ agenci stracili kontrolę nad stanem projektu. Wysiłek zakończył się sukcesem, gdy badacze zastosowali Prove2Me i wieloagentową uprząż opartą na Claude Code. Anthropic szacuje, że projekt pochłonął około sześciu miliardów tokenów wyjściowych z wewnętrznego modelu badawczego, mniej więcej porównywalnego z Claude Fable 5.1. Źródło nie podaje publicznej ceny za odtworzenie pełnego wysiłku ani nie ustala, że ten sam wynik jest obecnie praktyczny dla zwykłych użytkowników Claude.
Szczegóły źródła: anthropic.com ↗
Dlaczego to ma znaczenie
Praca skupia się na weryfikacji, a nie na odkrywaniu nowego dowodu Ostatniego Twierdzenia Fermata. Jeśli zostanie niezależnie odtworzone, pokazałoby, że systemy sztucznej inteligencji mogą pomóc w przetłumaczeniu niezwykle złożonej matematyki ludzkiej na formę sprawdzalną maszynowo, potencjalnie skracając czas wymagany do weryfikacji przyszłych dowodów i twierdzeń matematycznych generowanych przez sztuczną inteligencję. Wynik podkreśla również, że użyteczna autonomia może zależeć w równym stopniu od narzędzi do zarządzania projektami i formalnych rusztowań, jak i od modelu leżącego u ich podstaw.
Asystenci dowodu formalnego, tacy jak Lean, sprawdzają, czy każdy logiczny krok wynika z wcześniejszych definicji, twierdzeń i aksjomatów. Może to zapewnić skuteczniejszą kontrolę poprawności niż zwykła recenzja partnerska, chociaż samo w sobie nie stanowi dowodu zrozumiałego dla niespecjalistów ani nie ustala, że sformalizowane stwierdzenie oddaje wszystkie zamierzone niuanse matematyczne.
Twierdzony postęp ma skalę i szybkość. Anthropic twierdzi, że na podstawie istniejącego planu społeczności formalizacja miała zająć lata, podczas gdy Claude zakończyła ją w 11 dni. Jeśli kod publiczny przetrwa niezależną kontrolę, podejście to może pomóc matematykom w sprawdzaniu długich dowodów i skuteczniejszej kontroli matematyki generowanej przez sztuczną inteligencję.
Rezultatem jest także demonstracja systemów. Anthropic przypisuje sukces nie tylko Claude, ale także śledzeniu zależności, wyszukiwaniu twierdzeń, współpracy równoległej, szybszej kompilacji i przepływowi pracy z wieloma agentami. Sugeruje to, że przyszła automatyzacja matematyczna może zależeć od wyspecjalizowanej infrastruktury, a nie od samodzielnego modelu.
Ważne ograniczenia pozostają. Źródłem jest własna relacja Anthropic dotycząca jego systemu, a artykuł nie opisuje zakończonego niezależnego audytu, replikacji zewnętrznej, kosztów porównawczych ani recenzowanej oceny całego artefaktu. Recenzja Buzzarda stanowi znaczący dowód zaangażowania ekspertów, ale nie jest równoznaczna z szeroką niezależną walidacją.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Co obejrzeć dalej
Ważne będzie ponowne sprawdzenie przez niezależnych matematyków publicznie dostępnego kodu Lean, ponieważ udowodni to, że podejście to wykracza poza twierdzenie z istniejącym planem dowodu. Praktyczny koszt, odtwarzalność w systemach zewnętrznych i użyteczność uzyskanego dowodu dla matematyków pozostają niejasne.
Uważaj na niezależne kontrole dowodu GitHub, w tym na to, czy kompiluje się on na podstawie opublikowanych materiałów i czy zewnętrzni użytkownicy Lean identyfikują błędy, ukryte założenia lub zależności nie opisane w ogłoszeniu.
Sprawdź, czy ten sam przepływ pracy może sformalizować inne główne twierdzenia bez niezwykle szczegółowego planu opracowanego przez człowieka. Anthropic donosi o mniejszym eksperymencie formalizującym Twierdzenie o trzech liczbach pierwszych Vinogradowa w ciągu trzech dni przy użyciu trzech osobistych planów Claude Max, ale źródło nie podaje niezależnej oceny tego wyniku.
Model kosztów i dostępu pozostaje nierozwiązany. Anthropic twierdzi, że oferuje bezpłatne lub obniżone subskrypcje, kredyty badawcze i dedykowane granty na większe projekty, ale nie stwierdza, że pełną formalizację Fermata można odtworzyć w ramach subskrypcji konsumenckiej ani nie ujawnia kosztu pieniężnego zgłoszonych sześciu miliardów tokenów wyjściowych.
Szerszym testem będzie sprawdzenie, czy formalizacja stanie się rutynowym towarzyszem prac matematycznych czytelnych dla człowieka. Anthropic argumentuje, że dowody sprawdzalne maszynowo mogłyby pomóc recenzentom dotrzymać kroku pracy generowanej przez sztuczną inteligencję, jednocześnie potwierdzając, że sformalizowane dowody nie powinny zastępować wyjaśnień pisanych dla ludzkich czytelników.