Apa yang berlaku
Kajian kes arXiv baharu menerangkan bagaimana sistem penyelidikan AI membantu ahli matematik meningkatkan had yang diketahui pada pemalar Grothendieck, masalah terbuka sejak 1953. Kertas kerja ini membentangkan kedua-dua hasil matematik dan rekod terperinci tentang tempat sistem dilaksanakan dengan baik, di mana orang terpaksa mengemudinya, dan yang dakwaan kekal disahkan oleh mesin dan bukannya disahkan oleh manusia.
Pemalar Grothendieck mengukur jurang antara masalah pengoptimuman gabungan keras dan kelonggaran separuh pasti yang lebih mudah dikendalikan. Penulis melaporkan selang baharu dengan sempadan bawah 6pi/11, kira-kira 1.7135, dan sempadan atas kira-kira 1.7818. Kertas matematik rakan membekalkan bukti. Hasil sempadan bawah adalah ketara kerana ia tidak membina contoh yang sukar; ia sebaliknya memperoleh halangan yang terpakai merentasi skim pembundaran yang berkaitan.
Sistem penyelidikan menggabungkan model penaakulan dengan agen pengekodan. Kertas itu mengatakan larian menggunakan GPT-5.5-Pro ββdan kemudiannya GPT-5.6-Sol untuk penaakulan, Claude Code dengan Opus dan kemudian Fable 5 untuk pelaksanaan dan nod empat GPU untuk carian berangka. Sesi membawa kesinambungan melalui fail, transkrip, log percubaan dan ringkasan yang merekodkan tuntutan sebagai terbukti, disokong secara numerik, tekaan atau heuristik dan bukannya bergantung pada satu konteks tanpa gangguan.
Larian itu meliputi kira-kira 240 sesi penyelidikan dari 16 Jun hingga 24 Julai, dengan 2,091 panggilan model penaakulan dan anggaran 152 juta token pada anggaran kos API $5,400. Kira-kira 40 arahan manusia bertarikh mengemudi kerja itu. Apabila carian sempadan atas mendatar, pengendali menyedari bahawa kegagalan berulang mungkin menunjukkan halangan umum dan mengubah hala sistem ke arah hujah sempadan bawah. Makalah itu menerangkan perubahan dalam arah penyelidikan sebagai campur tangan manusia, bukan keputusan autonomi.
Sistem ini menghasilkan rangka semula pusat dan bukti lengkap untuk sempadan bawah 6pi/11, yang kemudiannya disemak dan disahkan oleh pengarang secara bebas. Ia juga menjana calon atas dan bawah berangka yang lebih kukuh yang melepasi protokol semakan dalaman, tetapi pengarang tidak mengesahkan sijil tersebut secara bebas dan tidak menyatakannya sebagai teorem. Maka kertas itu memisahkan hasil matematik yang disahkan daripada keluaran sistem yang lebih spekulatif atau diuji mesin.
Butiran sumber: Long-horizon AI mathematics case study on arXiv β
Mengapa ia penting
Kajian itu menawarkan bukti konkrit yang luar biasa tentang AI yang digunakan merentas program penyelidikan dan bukannya satu tugas penanda aras. Penemuannya yang paling penting ialah pembahagian kerja: sistem itu kukuh pada pelaksanaan teknikal, manakala penyelidik manusia tetap bertanggungjawab untuk penetapan agenda, pertimbangan dan pengesahan akhir.
Penyelidikan ufuk panjang adalah sukar untuk sistem AI kerana objektif boleh berubah apabila pendekatan yang gagal terkumpul. Kolaborator yang berguna mesti mengekalkan perkara yang telah dicuba, membezakan jalan buntu daripada idea yang tidak dapat diselesaikan dan memutuskan bila soalan baharu lebih bernilai daripada pengoptimuman tempatan yang lain. Memori berasaskan fail dan label tuntutan pengarang adalah percubaan untuk menjadikan keadaan penyelidikan itu kelihatan dan boleh diaudit dan bukannya membenarkan respons yang lancar untuk menyokong kemajuan.
Penemuan sempadan bawah menunjukkan mengapa pertimbangan manusia masih penting walaupun ejen boleh melaksanakan matematik. Pengendali menyedari bahawa banyak percubaan pembinaan gagal dengan cara yang sama dan membekalkan pangsi konseptual: buktikan halangan berulang itu sendiri. Sistem itu kemudian membantu merasmikan dan mengesahkan hujah. Urutan itu lebih dekat dengan penerokaan diselia daripada ahli matematik mesin bebas, dan perbezaan itu penting apabila menerangkan perkara yang disokong oleh bukti.
Pengesahan bebas ialah pintu keluar untuk keputusan. Kajian kes mengatakan sempadan bawah telah disemak oleh pengarang dan bukti lengkap dipaparkan dalam kertas pendamping. Ia tidak mengatakan bahawa setiap nombor yang dihasilkan semasa larian adalah betul. Mengekalkan tuntutan peringkat teorem, calon yang diuji mesin dan hipotesis secara berasingan memberi pembaca cara untuk menilai sumbangan tanpa menerima keyakinan dalaman sistem AI sebagai bukti matematik.
Bagi organisasi penyelidikan, pelajaran praktikal adalah beroperasi. Sistem AI boleh mencari literatur, menulis kod, menjalankan eksperimen, mengekalkan percubaan yang gagal, dan mencadangkan transformasi, tetapi aliran kerja di sekeliling memerlukan asal, pengiraan yang boleh dihasilkan semula, pusat pemeriksaan manusia yang jelas dan cara untuk membina semula sebab pasukan berubah arah. Kos dan pengiraan yang dilaporkan juga menjelaskan bahawa keupayaan jangka panjang bukan sahaja soal kecerdasan model; ia bergantung pada perancah, masa, dan pengawasan yang berterusan.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
What most distinguishes an AI agent from a basic chatbot?
Apa yang perlu ditonton seterusnya
Soalan seterusnya ialah sama ada corak kerjasama ini melangkaui satu masalah dan pasukan, dan sama ada penyelidik bebas boleh menghasilkan semula hasil yang disahkan sambil mengukur kos dan kebolehpercayaan setiap sumbangan manusia dan AI.
Replikasi harus menguji domain matematik lain, jenis masalah, dan sistem penyelidikan dengan memori dan reka bentuk alat yang berbeza. Masalah Grothendieck telah datang dengan rangka kerja yang besar yang dibina oleh manusia, nota terkumpul, jentera pensijilan dan arahan calon. Struktur terdahulu itu membantu berjalan, jadi kajian masa depan harus melaporkan berapa banyak keadaan penyelidikan dibekalkan lebih awal dan cara keputusan berubah apabila sistem mesti menentukan masalah itu sendiri.
Penyelidik juga harus membandingkan pelaksanaan teknikal dengan pertimbangan penyelidikan menggunakan langkah-langkah prospektif. Metrik berguna boleh termasuk kualiti arah yang dipilih, masa untuk meninggalkan laluan yang gagal, kadar tuntutan yang tidak disokong, bilangan campur tangan manusia dan pecahan output yang bertahan dalam pemeriksaan bebas. Kajian kes yang digilap boleh menunjukkan perkara yang berlaku, tetapi perbandingan terkawal diperlukan untuk menganggarkan apabila kolaborator AI meningkatkan proses dan bukannya hanya menambah satu lagi lapisan semakan.
Sempadan antara pengesahan mesin dan pengesahan manusia patut diberi perhatian berterusan. Aritmetik selang waktu, pembantu bukti, ujian dan audit lawan boleh menangkap banyak ralat, namun sijil mungkin masih mengekod sasaran yang salah atau bergantung pada andaian yang tidak pernah dicabar. Kerja susulan hendaklah menerbitkan artifak yang lengkap, menjalankan semula had yang paling kukuh yang belum disahkan dan menjadikan hasil yang gagal atau ditarik balik kelihatan seperti yang berjaya.
Akhir sekali, versi model, gesaan, arahan pemanduan, kod, pengiraan dan transkrip hendaklah dikekalkan jika pelesenan dan privasi membenarkan. Kertas semasa adalah bernilai sebahagiannya kerana ia melaporkan keadaan tersebut dan menerangkan kelemahan sistem, termasuk perwakilan negara penyelidikan yang rapuh dan autonomi terhad dalam penghakiman. Sehingga pasukan lain menghasilkan semula corak, ini adalah bukti kukuh kemajuan matematik berbantukan AI, bukan bukti bahawa sistem AI boleh menjalankan penyelidikan terbuka secara bebas.