Powrót do Wiadomości
InnowacjaAI Understanding odprawa

Badania matematyczne wspomagane sztuczną inteligencją zawężają granice długotrwałej stałej

Studium przypadku pokazuje, że system badawczy AI pomógł poprawić granice stałej Grothendiecka, podczas gdy autorzy podkreślają, że badacze-ludzi wybrali kluczowy punkt obrotu i niezależnie zweryfikowali jedynie wynik na poziomie twierdzenia.

6 min readRead the primary source
Dokument źródłowyŹródło zapisane
Wydawca
Long-horizon AI mathematics case study on arXiv
Link źródłowy
arxiv.orghttps://arxiv.org/abs/2608.11195
Typ źródła
Dokument podstawowy — oficjalne ogłoszenie, dokument, zgłoszenie lub strona własna, którą czytamy bezpośrednio.
KontekstZrozum to w 60 sekund

Zacznij tutaj

Kluczowe terminy

API (interfejs programowania aplikacji)
Ustrukturyzowany sposób wysyłania żądań przez jeden system oprogramowania i otrzymywania odpowiedzi z innego systemu.
Pamięć (pamięć agenta)
Przechowywany kontekst, którego agent AI używa na różnych etapach lub sesjach, aby poprawić ciągłość.
Punkt odniesienia
Standaryzowany test lub zbiór danych używany do pomiaru i porównania wydajności modelu.
Sprawdź sięQuiz dotyczący agentów AI

Co się stało

Nowe studium przypadku arXiv opisuje, jak system badawczy AI pomógł matematykom ulepszyć znane granice stałej Grothendiecka, otwartego problemu sięgającego 1953 roku. W artykule przedstawiono zarówno wyniki matematyczne, jak i szczegółowy zapis tego, gdzie system działał dobrze, gdzie ludzie musieli nim sterować i które twierdzenia pozostają weryfikowane przez maszynę, a nie przez człowieka.

Stała Grothendiecka mierzy różnicę pomiędzy trudnym problemem optymalizacji kombinatorycznej a łatwiejszą do wykonania relaksacją półokreśloną. Autorzy podają nowy przedział z dolną granicą wynoszącą 6pi/11, około 1,7135 i górną granicą około 1,7818. Dowodów dostarcza towarzysząca praca matematyczna. Wynik dolnej granicy jest godny uwagi, ponieważ nie tworzy twardej instancji; zamiast tego tworzy przeszkodę mającą zastosowanie we wszystkich odpowiednich schematach zaokrąglania.

System badawczy połączył model rozumowania z czynnikiem kodującym. W artykule napisano, że w uruchomieniu wykorzystano GPT-5.5-Pro, a później GPT-5.6-Sol do wnioskowania, Claude Code z Opusem, a później Fable 5 do wykonania, oraz węzeł z czterema GPU do wyszukiwań numerycznych. Sesje zapewniały ciągłość poprzez pliki, transkrypcje, dzienniki eksperymentów i podsumowanie, w którym rejestrowano twierdzenia jako udowodnione, poparte numerycznie, przypuszczalne lub heurystyczne, a nie opierające się na jednym nieprzerwanym kontekście.

Przegląd obejmował około 240 sesji badawczych od 16 czerwca do 24 lipca, obejmujących 2091 wywołań modeli wnioskowania i szacunkowo 152 miliony tokenów, a koszt interfejsu API szacowany był na 5400 dolarów. Pracą kierowało około 40 przestarzałych ludzkich dyrektyw. Gdy wyszukiwanie w górnej granicy ustabilizowało się, operatorzy uznali, że powtarzające się niepowodzenia mogą wskazywać na ogólną przeszkodę, i przekierowali system w stronę argumentu z dolnej granicy. W artykule tę zmianę kierunku badań opisano jako interwencję człowieka, a nie autonomiczną decyzję.

System stworzył centralną przebudowę i kompletny dowód dla dolnej granicy 6pi/11, który następnie autorzy poprawili i niezależnie zweryfikowali. Wygenerowało to również silniejszych numerycznych górnych i dolnych kandydatów, którzy przeszli wewnętrzny protokół kontroli, ale autorzy nie zweryfikowali niezależnie tych certyfikatów i nie podają ich jako twierdzeń. Dlatego w artykule oddziela się zweryfikowany wynik matematyczny od bardziej spekulacyjnych lub przetestowanych maszynowo wyników systemu.

Szczegóły źródła: Long-horizon AI mathematics case study on arXiv ↗

Dlaczego to ma znaczenie

Badanie dostarcza niezwykle konkretnych dowodów na temat wykorzystania sztucznej inteligencji w całym programie badawczym, a nie w pojedynczym zadaniu porównawczym. Najważniejszym odkryciem jest podział pracy: system był dobrze wykonany pod względem technicznym, podczas gdy badacze-ludzi pozostali odpowiedzialni za ustalanie programu, ocenę i ostateczną weryfikację.

Badania długoterminowe są trudne w przypadku systemu sztucznej inteligencji, ponieważ cel może się zmieniać w miarę kumulowania się nieudanych podejść. Przydatny współpracownik musi zachować to, co zostało wypróbowane, odróżnić ślepy zaułek od nierozwiązanego pomysłu i zdecydować, kiedy nowe pytanie jest cenniejsze niż kolejna lokalna optymalizacja. Autorskie etykiety pamięci i twierdzeń oparte na plikach mają na celu uczynienie stanu badawczego widocznym i możliwym do skontrolowania, zamiast pozwalać, aby płynna reakcja zastępowała postęp.

Odkrycie dolnej granicy pokazuje, dlaczego ludzki osąd nadal ma znaczenie, nawet jeśli agent potrafi wykonywać obliczenia matematyczne. Operatorzy zauważyli, że wiele prób konstrukcji zawodziło w ten sam sposób i zapewnili podstawę koncepcyjną: udowodnienie samej powtarzającej się przeszkody. System pomógł następnie sformalizować i poświadczyć argumentację. Ta sekwencja jest bliższa nadzorowanej eksploracji niż niezależnemu matematykowi maszynowemu, a rozróżnienie ma znaczenie przy opisywaniu tego, co potwierdzają dowody.

Niezależna weryfikacja jest bramą do wydania wyniku. Ze studium przypadku wynika, że ​​autorzy sprawdzili dolną granicę, a pełne dowody przedstawiono w artykule towarzyszącym. Nie oznacza to, że każda liczba wygenerowana podczas biegu jest poprawna. Oddzielenie twierdzeń na poziomie twierdzeń, kandydatów przetestowanych maszynowo i hipotez umożliwia czytelnikom ocenę wkładu bez akceptowania wewnętrznej pewności systemu AI jako dowodu matematycznego.

W przypadku organizacji badawczych lekcja praktyczna ma charakter praktyczny. System sztucznej inteligencji może przeszukiwać literaturę, pisać kod, przeprowadzać eksperymenty, utrwalać nieudane próby i proponować transformacje, ale otaczający go przepływ pracy wymaga pochodzenia, powtarzalnych obliczeń, wyraźnych ludzkich punktów kontrolnych i sposobu na zrekonstruowanie, dlaczego zespół zmienił kierunek. Zgłoszone koszty i obliczenia jasno pokazują, że długoterminowe możliwości to nie tylko kwestia inteligencji modelu; zależy to od rusztowań, czasu i stałego nadzoru.

Interactive Mechanism

Mechanizm interaktywny: jak to faktycznie działa

Poznaj interaktywnie technologię leżącą u podstaw tego rozwoju.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktywna kontrola koncepcji+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Co obejrzeć dalej

Kolejne pytanie dotyczy tego, czy ten wzorzec współpracy wykracza poza jeden problem i zespół oraz czy niezależni badacze mogą odtworzyć zweryfikowane wyniki, mierząc koszt i niezawodność każdego wkładu człowieka i sztucznej inteligencji.

Replikacja powinna testować inne domeny matematyczne, typy problemów i systemy badawcze z różnymi konstrukcjami pamięci i narzędzi. Problem Grothendiecka pojawił się już wraz z istotnymi strukturami stworzonymi przez ludzi, zgromadzonymi notatkami, maszynami certyfikującymi i wskazówkami kandydatów. Ta wcześniejsza struktura pomogła w uruchomieniu, dlatego przyszłe badania powinny raportować, jaka część stanu badawczego została dostarczona z wyprzedzeniem i jak zmieniają się wyniki, gdy system musi sam zdefiniować problem.

Badacze powinni także porównać wykonanie techniczne z oceną badań przy użyciu miar prospektywnych. Przydatne wskaźniki mogą obejmować jakość wybranych kierunków, czas porzucenia błędnej ścieżki, odsetek nieuzasadnionych roszczeń, liczbę interwencji człowieka i odsetek wyników, które przetrwały niezależne sprawdzenie. Dopracowane studium przypadku może pokazać, co się stało, ale potrzebne są kontrolowane porównania, aby oszacować, kiedy współpracownik AI usprawni proces, zamiast po prostu dodawać kolejny poziom przeglądu.

Granica między weryfikacją maszynową a weryfikacją przez człowieka zasługuje na ciągłą uwagę. Arytmetyka przedziałowa, asystenci dowodów, testy i audyty kontradyktoryjne mogą wychwycić wiele błędów, a mimo to certyfikat może nadal kodować niewłaściwy cel lub zależeć od założeń, które nigdy nie zostały zakwestionowane. Dalsze prace powinny publikować kompletne artefakty, ponownie uruchamiać najsilniejsze niezweryfikowane granice i sprawić, że nieudane lub wycofane wyniki będą tak samo widoczne jak udane.

Wreszcie, wersje modelu, podpowiedzi, wytyczne sterujące, kod, obliczenia i transkrypcje powinny zostać zachowane, jeśli pozwala na to licencja i prywatność. Obecny artykuł jest cenny częściowo dlatego, że opisuje te warunki i opisuje słabe strony systemu, w tym niestabilną reprezentację państwa badawczego i ograniczoną autonomię w ocenie. Dopóki inne zespoły nie odtworzą tego wzorca, jest to mocny dowód na postęp matematyczny wspomagany sztuczną inteligencją, a nie dowód na to, że systemy sztucznej inteligencji mogą niezależnie prowadzić badania otwarte.

Powiązane przewodniki i quizy

Agenci AIWyjaśnienie modeli AISzkolenie AIOceny LLMSprawdź swoją wiedzę — wypróbuj darmowy quiz dotyczący sztucznej inteligencjiWyszukaj termin związany ze sztuczną inteligencją w naszym glosariuszuPostępuj zgodnie z modułem śledzenia wydań modeli AI
Uznałeś to za przydatne?