Kembali ke Berita
InovasiAI Understanding pengarahan

Pembelajaran Matematika dengan Bantuan AI Memperketat Batasan pada Konstanta yang Sudah Lama Ada

Sebuah studi kasus melaporkan bahwa sistem penelitian AI membantu meningkatkan batas konstanta Grothendieck, sementara penulis menekankan bahwa peneliti manusia memilih poros kunci dan secara independen hanya memverifikasi hasil tingkat teorema.

6 min readRead the primary source
Dokumen sumber utamaSumber direkam
Penerbit
Long-horizon AI mathematics case study on arXiv
Tautan sumber
arxiv.orghttps://arxiv.org/abs/2608.11195
Jenis sumber
Dokumen primer β€” pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

API (Antarmuka Pemrograman Aplikasi)
Cara terstruktur bagi satu sistem perangkat lunak untuk mengirim permintaan dan menerima tanggapan dari sistem lain.
Memori (Memori Agen)
Konteks tersimpan yang digunakan agen AI di seluruh langkah atau sesi untuk meningkatkan kontinuitas.
Tolok ukur
Tes atau kumpulan data standar yang digunakan untuk mengukur dan membandingkan kinerja model.
Uji diri Anda sendiriKuis Agen AI

Apa yang terjadi

Sebuah studi kasus arXiv baru menjelaskan bagaimana sistem penelitian AI membantu ahli matematika meningkatkan batas yang diketahui pada konstanta Grothendieck, sebuah masalah terbuka yang dimulai pada tahun 1953. Makalah ini menyajikan hasil matematis dan catatan terperinci tentang bagian mana sistem dijalankan dengan baik, bagian mana yang harus dikendalikan oleh manusia, dan klaim mana yang tetap terverifikasi mesin, bukan terverifikasi manusia.

Konstanta Grothendieck mengukur kesenjangan antara masalah optimasi kombinatorial keras dan relaksasi semidefinit yang lebih mudah diselesaikan. Penulis melaporkan interval baru dengan batas bawah 6pi/11, sekitar 1,7135, dan batas atas sekitar 1,7818. Makalah matematika pendamping memberikan buktinya. Hasil batas bawah penting karena tidak membuat hard instance; hal ini malah menimbulkan hambatan yang berlaku di seluruh skema pembulatan yang relevan.

Sistem penelitian menggabungkan model penalaran dengan agen pengkodean. Makalah tersebut mengatakan bahwa proses tersebut menggunakan GPT-5.5-Pro ​​dan yang lebih baru GPT-5.6-Sol untuk penalaran, Claude Code dengan Opus dan yang lebih baru Fable 5 untuk eksekusi, dan node empat GPU untuk pencarian numerik. Sesi membawa kesinambungan melalui file, transkrip, log eksperimen, dan ringkasan yang mencatat klaim sebagai terbukti, didukung secara numerik, bersifat dugaan, atau heuristik daripada mengandalkan satu konteks yang tidak terputus.

Prosesnya mencakup sekitar 240 sesi penelitian dari 16 Juni hingga 24 Juli, dengan 2,091 panggilan model penalaran dan sekitar 152 juta token dengan perkiraan biaya API $5,400. Sekitar 40 arahan manusia yang tertanggal mengarahkan pekerjaan ini. Ketika pencarian batas atas stabil, operator menyadari bahwa kegagalan yang berulang mungkin mengindikasikan adanya hambatan umum dan mengarahkan sistem ke argumen batas bawah. Makalah ini menjelaskan bahwa perubahan arah penelitian merupakan intervensi manusia, bukan keputusan yang otonom.

Sistem menghasilkan pembingkaian ulang terpusat dan bukti lengkap untuk batas bawah 6pi/11, yang kemudian direvisi dan diverifikasi secara independen oleh penulis. Hal ini juga menghasilkan kandidat atas dan bawah yang lebih kuat dan lolos protokol pemeriksaan internal, namun penulis belum memverifikasi sertifikat tersebut secara independen dan tidak menyatakannya sebagai teorema. Oleh karena itu, makalah ini memisahkan hasil matematis yang terverifikasi dari keluaran sistem yang lebih spekulatif atau teruji oleh mesin.

Detail sumber: Long-horizon AI mathematics case study on arXiv β†—

Mengapa itu penting

Studi ini menawarkan bukti nyata yang luar biasa tentang penggunaan AI di seluruh program penelitian, bukan hanya pada satu tugas . Temuan terpentingnya adalah pembagian kerja: sistem ini kuat dalam pelaksanaan teknis, sementara peneliti manusia tetap bertanggung jawab atas penetapan agenda, penilaian, dan verifikasi akhir.

Penelitian jangka panjang sulit dilakukan pada sistem AI karena tujuannya dapat berubah seiring dengan bertambahnya pendekatan yang gagal. Kolaborator yang berguna harus mempertahankan apa yang telah dicoba, membedakan ide yang buntu dari ide yang belum terselesaikan, dan memutuskan kapan pertanyaan baru lebih berharga daripada optimasi lokal lainnya. Memori berbasis file dan label klaim penulis adalah upaya untuk membuat status penelitian tersebut terlihat dan dapat diaudit daripada membiarkan respons yang lancar menghalangi kemajuan.

Penemuan batas bawah ini menunjukkan mengapa penilaian manusia masih penting bahkan ketika agen dapat mengeksekusi matematika. Operator memperhatikan bahwa banyak upaya konstruksi yang gagal dengan cara yang sama dan memberikan poros konseptual: buktikan sendiri hambatan yang berulang. Sistem kemudian membantu memformalkan dan mengesahkan argumen tersebut. Urutan tersebut lebih mirip dengan eksplorasi yang diawasi dibandingkan dengan ahli matematika mesin independen, dan perbedaan tersebut penting saat menjelaskan bukti yang didukung.

Verifikasi independen adalah gerbang keluarnya hasil. Studi kasus mengatakan batas bawah telah diperiksa oleh penulis dan bukti lengkap muncul di makalah pendamping. Tidak dikatakan bahwa setiap angka yang dihasilkan selama proses dijalankan adalah benar. Memisahkan klaim tingkat teorema, kandidat yang diuji mesin, dan hipotesis memberi pembaca cara untuk mengevaluasi kontribusi tanpa menerima keyakinan internal sistem AI sebagai bukti matematis.

Bagi organisasi penelitian, pelajaran praktis bersifat operasional. Sistem AI dapat mencari literatur, menulis kode, menjalankan eksperimen, menyimpan upaya yang gagal, dan mengusulkan transformasi, namun alur kerja di sekitarnya memerlukan asal usul, komputasi yang dapat direproduksi, pos pemeriksaan manusia yang eksplisit, dan cara untuk merekonstruksi alasan tim mengubah arah. Biaya dan komputasi yang dilaporkan juga memperjelas bahwa kemampuan jangka panjang bukan hanya soal kecerdasan model; hal ini bergantung pada perancah, waktu, dan pengawasan berkelanjutan.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Pemeriksaan Konsep Interaktif+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Apa yang harus ditonton selanjutnya

Pertanyaan berikutnya adalah apakah pola kolaborasi ini dapat digeneralisasikan lebih dari satu masalah dan tim, dan apakah peneliti independen dapat mereproduksi hasil terverifikasi sambil mengukur biaya dan keandalan setiap kontribusi manusia dan AI.

Replikasi harus menguji domain matematika lain, jenis masalah, dan sistem penelitian dengan memori dan desain alat yang berbeda. Masalah Grothendieck telah muncul dengan kerangka kerja substansial yang dibuat oleh manusia, akumulasi catatan, mesin sertifikasi, dan arahan kandidat. Struktur sebelumnya membantu pelaksanaannya, jadi penelitian di masa depan harus melaporkan seberapa banyak status penelitian yang disediakan sebelumnya dan bagaimana hasilnya berubah ketika sistem harus mendefinisikan masalahnya sendiri.

Peneliti juga harus membandingkan pelaksanaan teknis dengan penilaian penelitian yang menggunakan ukuran prospektif. Metrik yang berguna dapat mencakup kualitas arah yang dipilih, waktu untuk meninggalkan jalur yang gagal, tingkat klaim yang tidak didukung, jumlah intervensi manusia, dan persentase output yang dapat bertahan dalam pemeriksaan independen. Studi kasus yang menyeluruh dapat menunjukkan apa yang terjadi, namun perbandingan terkontrol diperlukan untuk memperkirakan kapan kolaborator AI dapat meningkatkan proses, bukan sekadar menambahkan lapisan tinjauan lainnya.

Batasan antara verifikasi mesin dan verifikasi manusia patut mendapat perhatian terus-menerus. Aritmatika interval, asisten pembuktian, pengujian, dan audit permusuhan dapat menemukan banyak kesalahan, namun sertifikat mungkin masih menyandikan target yang salah atau bergantung pada asumsi yang tidak pernah ditentang. Pekerjaan tindak lanjut harus mempublikasikan artefak yang lengkap, menjalankan kembali batasan terkuat yang belum diverifikasi, dan membuat hasil yang gagal atau ditarik terlihat seperti hasil yang berhasil.

Terakhir, versi model, perintah, arahan pengarah, kode, komputasi, dan transkrip harus dipertahankan jika lisensi dan privasi mengizinkan. Makalah yang ada saat ini sangat berharga karena melaporkan kondisi-kondisi tersebut dan menjelaskan kelemahan-kelemahan sistem tersebut, termasuk lemahnya keterwakilan negara dalam penelitian dan terbatasnya otonomi dalam pengambilan keputusan. Sampai tim lain dapat mereproduksi pola tersebut, hal ini merupakan bukti kuat kemajuan matematika yang dibantu oleh AI, bukan bukti bahwa sistem AI dapat melakukan penelitian terbuka secara mandiri.

Panduan & kuis terkait

Agen AIModel AI DijelaskanPelatihan AIEvaluasi LLMUji pengetahuan Anda β€” coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak rilis model AI
Apakah ini berguna?