Co się stało
Nowe studium przypadku arXiv opisuje, jak system badawczy AI pomógł matematykom ulepszyć znane granice stałej Grothendiecka, otwartego problemu sięgającego 1953 roku. W artykule przedstawiono zarówno wyniki matematyczne, jak i szczegółowy zapis tego, gdzie system działał dobrze, gdzie ludzie musieli nim sterować i które twierdzenia pozostają weryfikowane przez maszynę, a nie przez człowieka.
Stała Grothendiecka mierzy różnicę pomiędzy trudnym problemem optymalizacji kombinatorycznej a łatwiejszą do wykonania relaksacją półokreśloną. Autorzy podają nowy przedział z dolną granicą wynoszącą 6pi/11, około 1,7135 i górną granicą około 1,7818. Dowodów dostarcza towarzysząca praca matematyczna. Wynik dolnej granicy jest godny uwagi, ponieważ nie tworzy twardej instancji; zamiast tego tworzy przeszkodę mającą zastosowanie we wszystkich odpowiednich schematach zaokrąglania.
System badawczy połączył model rozumowania z czynnikiem kodującym. W artykule napisano, że w uruchomieniu wykorzystano GPT-5.5-Pro, a później GPT-5.6-Sol do wnioskowania, Claude Code z Opusem, a później Fable 5 do wykonania, oraz węzeł z czterema GPU do wyszukiwań numerycznych. Sesje zapewniały ciągłość poprzez pliki, transkrypcje, dzienniki eksperymentów i podsumowanie, w którym rejestrowano twierdzenia jako udowodnione, poparte numerycznie, przypuszczalne lub heurystyczne, a nie opierające się na jednym nieprzerwanym kontekście.
Przegląd obejmował około 240 sesji badawczych od 16 czerwca do 24 lipca, obejmujących 2091 wywołań modeli wnioskowania i szacunkowo 152 miliony tokenów, a koszt interfejsu API szacowany był na 5400 dolarów. Pracą kierowało około 40 przestarzałych ludzkich dyrektyw. Gdy wyszukiwanie w górnej granicy ustabilizowało się, operatorzy uznali, że powtarzające się niepowodzenia mogą wskazywać na ogólną przeszkodę, i przekierowali system w stronę argumentu z dolnej granicy. W artykule tę zmianę kierunku badań opisano jako interwencję człowieka, a nie autonomiczną decyzję.
System stworzył centralną przebudowę i kompletny dowód dla dolnej granicy 6pi/11, który następnie autorzy poprawili i niezależnie zweryfikowali. Wygenerowało to również silniejszych numerycznych górnych i dolnych kandydatów, którzy przeszli wewnętrzny protokół kontroli, ale autorzy nie zweryfikowali niezależnie tych certyfikatów i nie podają ich jako twierdzeń. Dlatego w artykule oddziela się zweryfikowany wynik matematyczny od bardziej spekulacyjnych lub przetestowanych maszynowo wyników systemu.
Szczegóły źródła: Long-horizon AI mathematics case study on arXiv ↗
Dlaczego to ma znaczenie
Badanie dostarcza niezwykle konkretnych dowodów na temat wykorzystania sztucznej inteligencji w całym programie badawczym, a nie w pojedynczym zadaniu porównawczym. Najważniejszym odkryciem jest podział pracy: system był dobrze wykonany pod względem technicznym, podczas gdy badacze-ludzi pozostali odpowiedzialni za ustalanie programu, ocenę i ostateczną weryfikację.
Badania długoterminowe są trudne w przypadku systemu sztucznej inteligencji, ponieważ cel może się zmieniać w miarę kumulowania się nieudanych podejść. Przydatny współpracownik musi zachować to, co zostało wypróbowane, odróżnić ślepy zaułek od nierozwiązanego pomysłu i zdecydować, kiedy nowe pytanie jest cenniejsze niż kolejna lokalna optymalizacja. Autorskie etykiety pamięci i twierdzeń oparte na plikach mają na celu uczynienie stanu badawczego widocznym i możliwym do skontrolowania, zamiast pozwalać, aby płynna reakcja zastępowała postęp.
Odkrycie dolnej granicy pokazuje, dlaczego ludzki osąd nadal ma znaczenie, nawet jeśli agent potrafi wykonywać obliczenia matematyczne. Operatorzy zauważyli, że wiele prób konstrukcji zawodziło w ten sam sposób i zapewnili podstawę koncepcyjną: udowodnienie samej powtarzającej się przeszkody. System pomógł następnie sformalizować i poświadczyć argumentację. Ta sekwencja jest bliższa nadzorowanej eksploracji niż niezależnemu matematykowi maszynowemu, a rozróżnienie ma znaczenie przy opisywaniu tego, co potwierdzają dowody.
Niezależna weryfikacja jest bramą do wydania wyniku. Ze studium przypadku wynika, że autorzy sprawdzili dolną granicę, a pełne dowody przedstawiono w artykule towarzyszącym. Nie oznacza to, że każda liczba wygenerowana podczas biegu jest poprawna. Oddzielenie twierdzeń na poziomie twierdzeń, kandydatów przetestowanych maszynowo i hipotez umożliwia czytelnikom ocenę wkładu bez akceptowania wewnętrznej pewności systemu AI jako dowodu matematycznego.
W przypadku organizacji badawczych lekcja praktyczna ma charakter praktyczny. System sztucznej inteligencji może przeszukiwać literaturę, pisać kod, przeprowadzać eksperymenty, utrwalać nieudane próby i proponować transformacje, ale otaczający go przepływ pracy wymaga pochodzenia, powtarzalnych obliczeń, wyraźnych ludzkich punktów kontrolnych i sposobu na zrekonstruowanie, dlaczego zespół zmienił kierunek. Zgłoszone koszty i obliczenia jasno pokazują, że długoterminowe możliwości to nie tylko kwestia inteligencji modelu; zależy to od rusztowań, czasu i stałego nadzoru.
Mechanizm interaktywny: jak to faktycznie działa
Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.
What most distinguishes an AI agent from a basic chatbot?
Co obejrzeć dalej
Kolejne pytanie dotyczy tego, czy ten wzorzec współpracy wykracza poza jeden problem i zespół oraz czy niezależni badacze mogą odtworzyć zweryfikowane wyniki, mierząc koszt i niezawodność każdego wkładu człowieka i sztucznej inteligencji.
Replikacja powinna testować inne domeny matematyczne, typy problemów i systemy badawcze z różnymi konstrukcjami pamięci i narzędzi. Problem Grothendiecka pojawił się już wraz z istotnymi strukturami stworzonymi przez ludzi, zgromadzonymi notatkami, maszynami certyfikującymi i wskazówkami kandydatów. Ta wcześniejsza struktura pomogła w uruchomieniu, dlatego przyszłe badania powinny raportować, jaka część stanu badawczego została dostarczona z wyprzedzeniem i jak zmieniają się wyniki, gdy system musi sam zdefiniować problem.
Badacze powinni także porównać wykonanie techniczne z oceną badań przy użyciu miar prospektywnych. Przydatne wskaźniki mogą obejmować jakość wybranych kierunków, czas porzucenia błędnej ścieżki, odsetek nieuzasadnionych roszczeń, liczbę interwencji człowieka i odsetek wyników, które przetrwały niezależne sprawdzenie. Dopracowane studium przypadku może pokazać, co się stało, ale potrzebne są kontrolowane porównania, aby oszacować, kiedy współpracownik AI usprawni proces, zamiast po prostu dodawać kolejny poziom przeglądu.
Granica między weryfikacją maszynową a weryfikacją przez człowieka zasługuje na ciągłą uwagę. Arytmetyka przedziałowa, asystenci dowodów, testy i audyty kontradyktoryjne mogą wychwycić wiele błędów, a mimo to certyfikat może nadal kodować niewłaściwy cel lub zależeć od założeń, które nigdy nie zostały zakwestionowane. Dalsze prace powinny publikować kompletne artefakty, ponownie uruchamiać najsilniejsze niezweryfikowane granice i sprawić, że nieudane lub wycofane wyniki będą tak samo widoczne jak udane.
Wreszcie, wersje modelu, podpowiedzi, wytyczne sterujące, kod, obliczenia i transkrypcje powinny zostać zachowane, jeśli pozwala na to licencja i prywatność. Obecny artykuł jest cenny częściowo dlatego, że opisuje te warunki i opisuje słabe strony systemu, w tym niestabilną reprezentację państwa badawczego i ograniczoną autonomię w ocenie. Dopóki inne zespoły nie odtworzą tego wzorca, jest to mocny dowód na postęp matematyczny wspomagany sztuczną inteligencją, a nie dowód na to, że systemy sztucznej inteligencji mogą niezależnie prowadzić badania otwarte.