Apa yang terjadi
MIT Technology Review menerbitkan fitur interaktif yang dibangun berdasarkan tujuh teka-teki yang menyelidiki cara berpikir model AI. Artikel tersebut melaporkan bahwa model telah meningkat pesat pada beberapa tugas tetapi masih kesulitan dengan manipulasi spasial, variasi halus dari masalah yang sudah dikenal, abstraksi visual, dan penalaran multilangkah yang semakin kompleks.
MIT Technology Review melaporkan bahwa fiturnya menghadirkan tujuh tes yang meliputi penalaran spasial, memori dan kemampuan beradaptasi, penalaran abstrak dan visual, intuisi manusia, dan kompleksitas yang semakin meningkat. Artikel ini menempatkan pemecahan teka-teki dalam sejarah evaluasi AI yang lebih panjang, dengan mencatat bahwa permainan seperti catur, catur, dan Go telah digunakan sebagai tempat uji coba sejak tahun-tahun awal bidang ini. Dikatakan bahwa kinerja teka-teki telah meningkat secara substansial: tim Universitas Columbia menemukan pada akhir tahun 2024 bahwa model-model terkemuka hanya memecahkan 18% dari teka-teki New York Times Connections, sementara pada awal tahun 2025 beberapa model dapat menyelesaikannya dengan hampir sempurna setiap saat. Sumber tidak mengidentifikasi model atau memberikan perbandingan standar di seluruh contoh dalam fitur.
Tinjauan Teknologi MIT mengatakan penalaran spasial masih menjadi kelemahan utama. Bagian rotasi mentalnya meminta pembaca untuk mengidentifikasi objek tiga dimensi yang ditampilkan dari sudut lain, dan artikel tersebut melaporkan bahwa model bahasa dengan kemampuan masukan visual masih berkinerja sangat buruk pada tugas-tugas tersebut. Fitur tersebut menghubungkan kesulitan ini dengan klaim tentang sistem AI yang mengembangkan model dunia, dengan alasan bahwa model bahasa besar saat ini tampaknya tidak memanipulasi objek tiga dimensi dengan cara yang sama seperti yang mungkin dilakukan oleh spesialis spasial manusia. Artikel ini juga menjelaskan masalah memori dan kemampuan beradaptasi: model yang dilatih dengan sejumlah besar informasi mungkin mengenali pola teka-teki yang sudah dikenal dan mengabaikan perubahan kecil. Laporan tersebut mengutip studi Google dan Universitas Illinois Urbana-Champaign tahun 2024 yang melibatkan variasi teka-teki Knights dan Knaves sebagai bukti atas kekhawatiran ini.
Fitur tersebut kemudian beralih ke abstraksi dua dimensi dan penalaran visual. Tinjauan Teknologi MIT melaporkan bahwa model berperforma lebih baik pada teka-teki ARC-AGI ketika kisi disediakan sebagai string numerik yang mengkode warna sel, bukan sebagai gambar. Dikatakan juga bahwa penelitian telah menemukan bahwa model terkadang dapat mencapai jawaban yang benar melalui aturan yang rumit dan tidak dapat digeneralisasikan, sementara manusia mungkin mengandalkan konsep visual yang lebih sederhana. Artikel ini menyajikan pertanyaan SimpleBench, masalah Knights dan Knaves, dan teka-teki transformasi ARC-AGI sebagai contoh tugas yang dapat mengungkap perbedaan tersebut.
Ini secara terpisah menjelaskan tes intuisi di mana orang sering memberikan jawaban yang cepat namun salah, sementara model mungkin merespons dengan lebih hati-hati. Salah satu contoh menanyakan berapa lama waktu yang dibutuhkan sebuah gua untuk terisi setengahnya jika populasi kelelawar di dalamnya berlipat ganda setiap hari; yang lain meminta pembaca untuk mengidentifikasi kutipan yang terkait dengan Alice.
Terakhir, MIT Technology Review melaporkan bahwa kinerja sering kali menurun seiring dengan bertambahnya masalah yang kompleks. Laporan ini mengutip temuan penelitian Apple bahwa model bahasa dapat memecahkan versi sederhana dari masalah Menara Hanoi dan penyeberangan sungai, namun mulai terputus-putus ketika jumlah disk atau orang mencapai enam atau lebih. Laporan ini juga mengutip penelitian para peneliti di Universitas Washington, Universitas Stanford, dan Institut Allen yang menemukan kesulitan serupa dengan teka-teki jaringan logika. Fitur tersebut mencatat bahwa para komentator mempertanyakan apakah hasil ini mengungkapkan keterbatasan penalaran yang unik seperti mesin atau sekadar mencerminkan fakta bahwa orang juga membuat lebih banyak kesalahan seiring dengan meningkatnya kompleksitas. Oleh karena itu, contoh penyeberangan sungai dan jaringan logika tidak hanya menguji apakah suatu model dapat menghasilkan jawaban, namun apakah model tersebut dapat mempertahankan batasan di beberapa deduksi yang terhubung.
Detail sumber: technologyreview.com ↗
Mengapa itu penting
Fitur ini menunjukkan mengapa klaim luas mengenai kecerdasan AI bisa menyesatkan. Sebuah model mungkin berkinerja baik pada hal-hal sepele atau tolok ukur yang umum, namun gagal dalam perubahan kecil dalam kata-kata, transformasi visual, atau masalah yang memerlukan beberapa langkah yang bergantung. Perbedaan-perbedaan tersebut menjadi penting ketika sistem digunakan untuk mengambil keputusan dan bukan untuk demonstrasi.
Pelajaran utamanya adalah bahwa kinerja pada satu kelas tes tidak boleh diperlakukan sebagai ukuran kecerdasan secara umum. Contoh-contoh yang diberikan oleh MIT Technology Review mencakup tugas-tugas yang tampak sederhana namun membutuhkan kemampuan yang berbeda: memutar suatu objek secara mental, melacak kebenaran dan kepalsuan di seluruh pernyataan, menyimpulkan aturan visual, menolak intuisi yang menyesatkan, atau merencanakan rangkaian dalam batasan. Suatu sistem bisa menjadi sangat kuat di satu bidang dan tidak dapat diandalkan di bidang lain. Ketidakmerataan tersebut sangat relevan ketika pengguna menafsirkan jawaban yang lancar sebagai bukti bahwa model memahami masalah mendasar.
Artikel ini juga menyoroti masalah evaluasi: format tugas dapat mempengaruhi hasil secara signifikan. Tinjauan Teknologi MIT melaporkan bahwa kinerja ARC-AGI meningkat ketika kisi-kisi visual diubah menjadi representasi numerik. Hal ini menunjukkan bahwa skor mungkin mencerminkan tidak hanya kemampuan penalaran model namun juga cara masalah dikodekan dan disajikan. Kekhawatiran yang sama juga berlaku pada teka-teki yang familiar. Jika model menemukan varian yang mirip selama pelatihan, jawaban yang benar mungkin mencerminkan pengenalan atau pengambilan pola, bukan kemampuan untuk mengadaptasi aturan ke kasus baru. Sumber tidak menentukan seberapa sering mekanisme tersebut terjadi di seluruh sistem yang diterapkan.
Keterbatasan ini memiliki implikasi praktis bagi siapa pun yang menggunakan AI dalam pendidikan, perangkat lunak, penelitian, administrasi, atau lingkungan lain yang melibatkan kasus-kasus asing. Sebuah model yang berhasil pada contoh-contoh rutin mungkin masih gagal ketika kata-katanya berubah, beberapa kendala berinteraksi, atau informasi yang relevan bersifat visual dan bukan tekstual. Fitur ini tidak melaporkan peluncuran produk baru, rilis model baru, atau penilaian terkontrol terhadap sistem komersial tertentu. Nilainya cukup jelas: memberikan pembaca cara konkrit untuk melihat mengapa pencapaian benchmark dan bahasa yang disempurnakan tidak dengan sendirinya menghasilkan alasan yang kuat. Artikel ini juga mempertahankan kualifikasi penting: manusia memiliki biasnya sendiri dan bisa lebih lambat atau kurang dapat diandalkan dalam beberapa masalah.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang harus ditonton selanjutnya
Evaluasi di masa depan perlu menguji lebih dari sekadar skor utama. Pertanyaan-pertanyaan penting mencakup apakah model dapat menggeneralisasi masalah-masalah yang tidak biasa, apakah jawabannya bergantung pada bagaimana informasi direpresentasikan, bagaimana kinerja berubah seiring meningkatnya kompleksitas, dan apakah keberhasilan mencerminkan strategi yang dapat digunakan kembali atau pola-pola yang diingat.
Perkembangan berguna berikutnya adalah pengujian yang lebih luas dan dapat direproduksi pada seluruh model dan format tugas. Fitur MIT Technology Review tidak menyediakan satu kartu skor yang mencakup ketujuh pengujian, dan sumbernya juga tidak menentukan nama model, versi, ukuran sampel, kondisi yang mendorong, atau tingkat kesalahan untuk sebagian besar contoh. Rincian tersebut diperlukan untuk menentukan apakah kelemahan yang dilaporkan tersebar luas, terkonsentrasi pada kelompok model tertentu, atau sensitif terhadap cara pelaksanaan tes.
Evaluasi independen juga harus memisahkan kegagalan persepsi visual dari kegagalan penalaran dengan menjaga teka-teki yang mendasarinya tetap konstan sambil memvariasikan representasinya. Peneliti dan evaluator juga harus memperhatikan apakah model menjadi lebih baik melalui generalisasi yang sebenarnya atau melalui paparan yang lebih besar terhadap materi yang mirip dengan benchmark. Diskusi artikel tentang teka-teki Connections dan variasi Knights and Knaves menunjukkan mengapa kontaminasi dan keakraban itu penting. Sebuah model yang berkinerja baik pada pertanyaan-pertanyaan yang dipublikasikan atau terkait erat mungkin tidak mampu menangani masalah-masalah baru dengan struktur dasar yang sama. Oleh karena itu, pengujian harus mencakup teka-teki yang sudah ada, perubahan kata-kata, tata letak visual yang asing, dan tugas-tugas yang memerlukan penjelasan atau pemeriksaan kendala perantara tanpa berasumsi bahwa jawaban persuasif benar.
Kompleksitas dan transfer dunia nyata masih menjadi pertanyaan terbuka. Tinjauan Teknologi MIT melaporkan bahwa kinerja dapat menurun seiring bertambahnya jumlah elemen atau langkah yang diperlukan, namun sumbernya tidak menjelaskan bagaimana temuan tersebut diterjemahkan ke dalam sistem praktis dengan alat, pengambilan, memori eksternal, atau pengawasan manusia. Pelaporan di masa mendatang harus melacak apakah penambahan tersebut meningkatkan keandalan, sekadar membantu pencarian model dengan lebih efektif, atau memperkenalkan mode kegagalan baru. Pembaca juga harus memperhatikan evaluasi yang mengukur kualitas strategi, bukan hanya jawaban akhir, karena hasil yang benar yang dicapai melalui aturan yang rapuh atau tidak dapat digeneralisasikan mungkin tidak akan bertahan jika ada perubahan kecil dalam permasalahan.