Apa yang terjadi
Catatan delapan halaman yang diposting ke arXiv pada tanggal 3 Agustus 2026 melaporkan bahwa bukti tercetak dari lemma pengkondisian serakah di Bab 6 dari Sepuluh Kemajuan dalam Matematika dan Ilmu Komputer Teoretis OpenAI membalikkan kondisi antara peristiwa yang saling melengkapi. Para penulis mengatakan pernyataan lemma itu benar, memberikan contoh tandingan terhadap prosedur yang dicetak, dan memberikan bukti koreksi yang mereka gambarkan sebagai perbaikan lokal.
Catatan singkat yang diposting ke arXiv pada tanggal 3 Agustus 2026 oleh MikoΕaj Sienicki dan Krzysztof Sienicki melaporkan kesalahan dalam cetakan bukti lemma di dalam Bab 6 dari dokumen OpenAI berjudul Sepuluh Kemajuan dalam Matematika dan Ilmu Komputer Teoretis. Daftar arXiv (2608.14673) diajukan di bawah Kecerdasan Buatan dan didaftarkan silang ke Fisika Kuantum, dan metadatanya menjelaskan makalah delapan halaman dengan lima referensi. Menurut catatan tersebut, bab ini mengklaim teorema pengulangan paralel eksponensial yang mencakup semua permainan terjerat dua pemain dan satu putaran yang terbatas - secara kasar, sebuah pernyataan bahwa peluang untuk mengalahkan permainan seperti itu berkurang secara eksponensial ketika banyak salinan dimainkan sekaligus oleh pemain yang berbagi keterikatan kuantum.
Langkah yang diperdebatkan ini adalah apa yang disebut dalam catatan tersebut sebagai lemma pengondisian serakah kuantitatif, yang digunakan pada awal argumen bab ini. Tugasnya adalah memilih sekumpulan kecil koordinat, D, sehingga setelah mengkondisikan pemain yang memenangkan setiap koordinat di D, sisa koordinat yang dipilih secara acak dimenangkan dengan probabilitas rata-rata minimal 1βΞ΄. Penulis tidak membantah pernyataan tersebut; mereka bilang itu benar. Keberatan mereka adalah pada argumen yang tercetak di bawahnya. Seperti yang tertulis, pengujian kelanjutan prosedur dinyatakan dalam keberhasilan rata-rata, sedangkan langkah berikutnya memerlukan adanya koordinat tertentu yang membawa probabilitas kegagalan bersyarat yang besar. Catatan itu mengatakan bahwa implikasinya salah.
Untuk mendukung klaim tersebut, penulis memberikan contoh tandingan yang eksplisit, dan mengatakan bahwa contoh sederhana sekalipun dapat membuat prosedur tercetak tidak memiliki langkah selanjutnya yang valid - yaitu, perulangan seperti yang tertulis dapat terhenti daripada menghasilkan koordinat yang dibutuhkan. Mereka kemudian mengidentifikasi apa yang mereka anggap sebagai kondisi kelanjutan yang diinginkan, dinyatakan dalam istilah kegagalan, bukan keberhasilan, dan memberikan bukti koreksi yang lengkap. Mereka mengkarakterisasi perbaikan tersebut sebagai perbaikan lokal: pernyataan lemma tidak berubah, begitu pula parameter-parameter yang diambil dari bab ini, sehingga langkah-langkah hilir yang mengutip lemma tidak perlu ditulis ulang.
Catatan tersebut sangat eksplisit tentang apa yang tidak ditetapkannya. Para penulis menulis bahwa koreksi mereka tidak boleh dibaca sebagai verifikasi independen terhadap teorema pengulangan paralel utama; mereka menetapkan satu lemma awal, bukan babnya. Ada beberapa hal yang tidak diketahui dari sumbernya sendiri. Ia tidak menyebutkan model mana yang menghasilkan bab tersebut, menjelaskan bagaimana teks tersebut dihasilkan, atau menyebutkan berapa banyak penyuntingan manusia yang diterima sebelum diterbitkan. Laporan ini tidak melaporkan formalisasi yang diperiksa mesin baik dari bukti yang cacat maupun yang telah diperbaiki, tidak menyertakan respons apa pun dari OpenAI, dan β sebagai pracetak arXiv β tidak menunjukkan indikasi tinjauan sejawat. Klaim bahwa bukti cetak rusak dan perbaikannya valid, pada tahap ini, merupakan klaim penulis, terbuka untuk pemeriksaan yang sama seperti yang mereka terapkan.
Mengapa itu penting
Kegagalan yang dilaporkan bukanlah sebuah kutipan halusinasi atau sebuah angka yang dibuat-buat, melainkan sebuah ketidaksetaraan terbalik yang terkubur dalam sebuah argumen yang masuk akal β sebuah jenis cacat yang hanya dapat dilihat sekilas dan hanya dapat diketahui melalui pembacaan baris demi baris. Ini adalah titik data konkrit dalam pertanyaan yang belum terselesaikan: bagaimana matematika yang dihasilkan AI harus diperiksa sebelum dapat diandalkan.
Sebagian besar diskusi publik tentang kesalahan AI dalam penulisan teknis berpusat pada kegagalan yang nyata: kutipan palsu, angka-angka yang diciptakan, aritmatika yang berantakan saat diperiksa. Cacat yang dijelaskan di sini adalah spesies yang berbeda. Suatu kondisi yang dinyatakan dalam suatu peristiwa dituliskan sebagai pelengkapnya β keberhasilan dimana kegagalan diperlukan. Prosa di sekitarnya terbaca dengan benar, lemma yang dibuktikan benar, dan parameternya semuanya sejalan. Kombinasi itulah yang membuatnya sulit: argumennya masuk akal di setiap tingkat kecuali pada tingkat yang menentukan apakah argumen tersebut berhasil. Peninjau yang memeriksa pernyataan, konstanta, dan bentuk keseluruhan dapat lulus dan masih melewatkan jeda.
Hal ini memiliki konsekuensi praktis bagi siapa pun yang menggunakan model untuk menyusun derivasi, argumen kebenaran algoritma, atau analisis protokol. Mengonfirmasi kebenaran suatu hasil tidak sama dengan mengonfirmasi bahwa bukti yang diberikan membuktikan kebenarannya. Dalam kasus ini, kedua hal tersebut ternyata dapat dipisahkan: klaimnya bertahan, alasannya tidak. Dalam kasus lain, jenis slip yang sama dapat mendukung kesimpulan yang salah, tanpa adanya pemeriksaan eksternal untuk menangkapnya. Unit peninjauan yang bisa diterapkan untuk matematika yang dihasilkan AI tampaknya merupakan langkah inferensial individu, bukan teorema, dan itu merupakan pekerjaan manusia yang mahal.
Episode ini juga menunjuk pada verifikasi formal sebagai alat diskriminatif. Pembalikan polaritas antara peristiwa-peristiwa yang saling melengkapi adalah jenis cacat yang ditangkap oleh asisten pembuktian secara mekanis, karena jenis objek yang dihasilkan tidak akan cocok dengan jenis yang diperlukan pada langkah berikutnya. Bab ini, sebagaimana dijelaskan, adalah matematika prosa, diperiksa sebagaimana matematika prosa selalu diperiksa - oleh pembaca. Ketika sistem AI menghasilkan lebih banyak bukti kandidat daripada yang dapat dibaca oleh para ahli, kesenjangan antara apa yang dapat dihasilkan dan apa yang dapat diaudit semakin lebar, dan pemeriksaan mesin adalah kandidat yang jelas untuk menutupnya.
Diperlukan kehati-hatian mengenai seberapa jauh membaca ini. Ini adalah satu lemma dalam satu bab dari satu dokumen, dilaporkan oleh dua penulis dalam catatan delapan halaman. Ini tidak memberikan tingkat kesalahan, tidak ada perbandingan dengan bukti tertulis manusia dengan panjang yang sama, dan tidak ada bukti apakah kesalahan semacam ini jarang atau umum terjadi dalam matematika yang dihasilkan AI. Makalah yang ditulis oleh manusia juga mengandung kesalahan yang dapat diperbaiki, dan literatur memiliki tradisi panjang mengenai genre catatan korektif ini. Yang baru adalah subjeknya: teks yang cacat berasal dari sebuah sistem, yang diterbitkan oleh sebuah perusahaan yang sangat tertarik pada bagaimana keluaran matematisnya dinilai.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
What is the best response when AI Models Explained makes a mistake in production?
Apa yang harus ditonton selanjutnya
Apakah OpenAI mengakui atau mengoreksi bab tersebut, apakah bab lain melakukan audit serupa, dan apakah ada orang yang secara independen memverifikasi teorema pengulangan paralel utama yang dimasukkan ke dalam lemma yang dikoreksi. Yang juga patut diperhatikan adalah apakah formalisasi yang diperiksa mesin menjadi norma untuk pembuktian yang dihasilkan AI.
Hal pertama yang harus diperhatikan adalah apakah OpenAI merespons β dengan kesalahan, bab yang direvisi, atau ketidaksepakatan substantif. Koreksi yang terlihat akan menunjukkan bahwa dokumen tersebut dipertahankan seperti artefak teknis dan bukan demonstrasi; keheningan akan membuat pembaca merekonsiliasi teks yang diterbitkan dengan catatan pihak ketiga. Apakah koreksi tersebut, jika dilakukan, sesuai dengan yang diusulkan di sini merupakan pertanyaan terpisah yang patut ditelusuri, karena perbaikan yang berbeda mungkin tidak mempertahankan parameter yang diandalkan dalam bab ini nanti.
Kedua, apakah bab-bab lain dalam dokumen yang sama menarik perhatian serupa. Audit tunggal hanyalah sebuah anekdot; serangkaian audit independen terhadap sepuluh kemajuan yang diklaim akan mulai mengkarakterisasi seberapa andal pengumpulan tersebut dan di mana kelompok mode kegagalan. Hambatannya adalah peninjauan semacam ini memerlukan pakar domain yang bersedia meluangkan waktu serius untuk mengerjakan keluaran orang lain, dengan sedikit imbalan akademis konvensional untuk melakukannya.
Ketiga, apakah ada orang yang secara independen memverifikasi teorema utama pengulangan paralel yang didukung oleh lemma yang dikoreksi. Para penulis secara eksplisit menyatakan bahwa mereka tidak melakukannya. Sampai hal ini terjadi, bukti-bukti yang ada adalah bahwa satu langkah awal kini mempunyai bukti yang diyakini oleh para penulisnya, dan klaim yang lebih besar masih belum terverifikasi di masyarakat. Formalisasi bab yang diperiksa dengan mesin β atau bahkan lemma saja β akan secara drastis mengubah seberapa besar bobot yang dapat ditanggung oleh hasil tersebut.
Keempat, apakah norma-norma terbentuk dalam pengungkapan dan audit matematika yang dihasilkan oleh AI: memberi label argumen mana yang dihasilkan oleh model, menyatakan pemeriksaan manusia atau otomatis apa yang diterapkan, dan memperlakukan bukti yang belum diverifikasi sebagai rancangan, bukan hasil. Jurnal dan server pracetak bergerak lambat dalam menjawab pertanyaan serupa. Catatan ini juga merupakan pracetak dan belum ditinjau oleh rekan sejawat, jadi penerimaannya sendiri β apakah spesialis dalam pengulangan paralel kuantum mengkonfirmasi contoh tandingan dan menerima perbaikan β adalah bagian dari apa yang harus diikuti.