Apa yang terjadi
Sebuah studi kasus arXiv baru menjelaskan bagaimana sistem penelitian AI membantu ahli matematika meningkatkan batas yang diketahui pada konstanta Grothendieck, sebuah masalah terbuka yang dimulai pada tahun 1953. Makalah ini menyajikan hasil matematis dan catatan terperinci tentang bagian mana sistem dijalankan dengan baik, bagian mana yang harus dikendalikan oleh manusia, dan klaim mana yang tetap terverifikasi mesin, bukan terverifikasi manusia.
Konstanta Grothendieck mengukur kesenjangan antara masalah optimasi kombinatorial keras dan relaksasi semidefinit yang lebih mudah diselesaikan. Penulis melaporkan interval baru dengan batas bawah 6pi/11, sekitar 1,7135, dan batas atas sekitar 1,7818. Makalah matematika pendamping memberikan buktinya. Hasil batas bawah penting karena tidak membuat hard instance; hal ini malah menimbulkan hambatan yang berlaku di seluruh skema pembulatan yang relevan.
Sistem penelitian menggabungkan model penalaran dengan agen pengkodean. Makalah tersebut mengatakan bahwa proses tersebut menggunakan GPT-5.5-Pro ββdan yang lebih baru GPT-5.6-Sol untuk penalaran, Claude Code dengan Opus dan yang lebih baru Fable 5 untuk eksekusi, dan node empat GPU untuk pencarian numerik. Sesi membawa kesinambungan melalui file, transkrip, log eksperimen, dan ringkasan yang mencatat klaim sebagai terbukti, didukung secara numerik, bersifat dugaan, atau heuristik daripada mengandalkan satu konteks yang tidak terputus.
Prosesnya mencakup sekitar 240 sesi penelitian dari 16 Juni hingga 24 Juli, dengan 2,091 panggilan model penalaran dan sekitar 152 juta token dengan perkiraan biaya API $5,400. Sekitar 40 arahan manusia yang tertanggal mengarahkan pekerjaan ini. Ketika pencarian batas atas stabil, operator menyadari bahwa kegagalan yang berulang mungkin mengindikasikan adanya hambatan umum dan mengarahkan sistem ke argumen batas bawah. Makalah ini menjelaskan bahwa perubahan arah penelitian merupakan intervensi manusia, bukan keputusan yang otonom.
Sistem menghasilkan pembingkaian ulang terpusat dan bukti lengkap untuk batas bawah 6pi/11, yang kemudian direvisi dan diverifikasi secara independen oleh penulis. Hal ini juga menghasilkan kandidat atas dan bawah yang lebih kuat dan lolos protokol pemeriksaan internal, namun penulis belum memverifikasi sertifikat tersebut secara independen dan tidak menyatakannya sebagai teorema. Oleh karena itu, makalah ini memisahkan hasil matematis yang terverifikasi dari keluaran sistem yang lebih spekulatif atau teruji oleh mesin.
Detail sumber: Long-horizon AI mathematics case study on arXiv β
Mengapa itu penting
Studi ini menawarkan bukti nyata yang luar biasa tentang penggunaan AI di seluruh program penelitian, bukan hanya pada satu tugas . Temuan terpentingnya adalah pembagian kerja: sistem ini kuat dalam pelaksanaan teknis, sementara peneliti manusia tetap bertanggung jawab atas penetapan agenda, penilaian, dan verifikasi akhir.
Penelitian jangka panjang sulit dilakukan pada sistem AI karena tujuannya dapat berubah seiring dengan bertambahnya pendekatan yang gagal. Kolaborator yang berguna harus mempertahankan apa yang telah dicoba, membedakan ide yang buntu dari ide yang belum terselesaikan, dan memutuskan kapan pertanyaan baru lebih berharga daripada optimasi lokal lainnya. Memori berbasis file dan label klaim penulis adalah upaya untuk membuat status penelitian tersebut terlihat dan dapat diaudit daripada membiarkan respons yang lancar menghalangi kemajuan.
Penemuan batas bawah ini menunjukkan mengapa penilaian manusia masih penting bahkan ketika agen dapat mengeksekusi matematika. Operator memperhatikan bahwa banyak upaya konstruksi yang gagal dengan cara yang sama dan memberikan poros konseptual: buktikan sendiri hambatan yang berulang. Sistem kemudian membantu memformalkan dan mengesahkan argumen tersebut. Urutan tersebut lebih mirip dengan eksplorasi yang diawasi dibandingkan dengan ahli matematika mesin independen, dan perbedaan tersebut penting saat menjelaskan bukti yang didukung.
Verifikasi independen adalah gerbang keluarnya hasil. Studi kasus mengatakan batas bawah telah diperiksa oleh penulis dan bukti lengkap muncul di makalah pendamping. Tidak dikatakan bahwa setiap angka yang dihasilkan selama proses dijalankan adalah benar. Memisahkan klaim tingkat teorema, kandidat yang diuji mesin, dan hipotesis memberi pembaca cara untuk mengevaluasi kontribusi tanpa menerima keyakinan internal sistem AI sebagai bukti matematis.
Bagi organisasi penelitian, pelajaran praktis bersifat operasional. Sistem AI dapat mencari literatur, menulis kode, menjalankan eksperimen, menyimpan upaya yang gagal, dan mengusulkan transformasi, namun alur kerja di sekitarnya memerlukan asal usul, komputasi yang dapat direproduksi, pos pemeriksaan manusia yang eksplisit, dan cara untuk merekonstruksi alasan tim mengubah arah. Biaya dan komputasi yang dilaporkan juga memperjelas bahwa kemampuan jangka panjang bukan hanya soal kecerdasan model; hal ini bergantung pada perancah, waktu, dan pengawasan berkelanjutan.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
What most distinguishes an AI agent from a basic chatbot?
Apa yang harus ditonton selanjutnya
Pertanyaan berikutnya adalah apakah pola kolaborasi ini dapat digeneralisasikan lebih dari satu masalah dan tim, dan apakah peneliti independen dapat mereproduksi hasil terverifikasi sambil mengukur biaya dan keandalan setiap kontribusi manusia dan AI.
Replikasi harus menguji domain matematika lain, jenis masalah, dan sistem penelitian dengan memori dan desain alat yang berbeda. Masalah Grothendieck telah muncul dengan kerangka kerja substansial yang dibuat oleh manusia, akumulasi catatan, mesin sertifikasi, dan arahan kandidat. Struktur sebelumnya membantu pelaksanaannya, jadi penelitian di masa depan harus melaporkan seberapa banyak status penelitian yang disediakan sebelumnya dan bagaimana hasilnya berubah ketika sistem harus mendefinisikan masalahnya sendiri.
Peneliti juga harus membandingkan pelaksanaan teknis dengan penilaian penelitian yang menggunakan ukuran prospektif. Metrik yang berguna dapat mencakup kualitas arah yang dipilih, waktu untuk meninggalkan jalur yang gagal, tingkat klaim yang tidak didukung, jumlah intervensi manusia, dan persentase output yang dapat bertahan dalam pemeriksaan independen. Studi kasus yang menyeluruh dapat menunjukkan apa yang terjadi, namun perbandingan terkontrol diperlukan untuk memperkirakan kapan kolaborator AI dapat meningkatkan proses, bukan sekadar menambahkan lapisan tinjauan lainnya.
Batasan antara verifikasi mesin dan verifikasi manusia patut mendapat perhatian terus-menerus. Aritmatika interval, asisten pembuktian, pengujian, dan audit permusuhan dapat menemukan banyak kesalahan, namun sertifikat mungkin masih menyandikan target yang salah atau bergantung pada asumsi yang tidak pernah ditentang. Pekerjaan tindak lanjut harus mempublikasikan artefak yang lengkap, menjalankan kembali batasan terkuat yang belum diverifikasi, dan membuat hasil yang gagal atau ditarik terlihat seperti hasil yang berhasil.
Terakhir, versi model, perintah, arahan pengarah, kode, komputasi, dan transkrip harus dipertahankan jika lisensi dan privasi mengizinkan. Makalah yang ada saat ini sangat berharga karena melaporkan kondisi-kondisi tersebut dan menjelaskan kelemahan-kelemahan sistem tersebut, termasuk lemahnya keterwakilan negara dalam penelitian dan terbatasnya otonomi dalam pengambilan keputusan. Sampai tim lain dapat mereproduksi pola tersebut, hal ini merupakan bukti kuat kemajuan matematika yang dibantu oleh AI, bukan bukti bahwa sistem AI dapat melakukan penelitian terbuka secara mandiri.