Apa yang terjadi
Para peneliti memposting makalah yang menjelaskan The Unwrite , yang meminta model multimodal untuk mengidentifikasi kata-kata yang ditulis hanya dengan menggunakan suara pena dan video tangan yang bergerak, tanpa tinta yang terlihat. Abstrak melaporkan akurasi surat pesanan manusia di atas 80% dan model terkemuka, termasuk GPT-4o dan Gemini 2.5-Pro, di bawah 10%, dan mengatakan bahwa menggabungkan kedua modalitas tersebut sering kali menurunkan kinerja model daripada meningkatkannya.
Tiga peneliti – Garima Arya Yadav, Nilay Yilmaz, dan Yezhou Yang – telah menerbitkan makalah yang memperkenalkan apa yang mereka sebut Tolok Ukur Tidak Tertulis, sebuah pengujian apakah model pembelajaran mesin multimodal dapat mengetahui apa yang ditulis seseorang tanpa pernah melihat tulisan itu sendiri. Makalah ini terdaftar di arXiv sebagai 2608.14558, diajukan di bawah kecerdasan buatan dengan daftar silang ke visi komputer dan pengenalan pola. Penulis mendefinisikan tugas inti sebagai "inferensi kata akustik-kinematik": model hanya diberikan audio goresan pena dan video gerakan tangan, tanpa jejak tinta yang terlihat, dan harus menguraikan kata yang sedang ditulis. Abstrak mengatakan tugas tersebut mencakup tiga gaya penulisan yang berbeda. Daftar arXiv memberikan tanggal penyerahan 15 Mei 2026 dan memuat komentar yang menyatakan bahwa karya tersebut akan dipublikasikan dalam Temuan CVPR 2026.
Hasil utama adalah kesenjangan. Berdasarkan abstrak, peserta manusia mencapai akurasi huruf terurut yang tinggi – menurut penulis lebih dari 80% – sementara model multimodal terkemuka gagal melampaui 10%. Dua model yang disebutkan dalam abstrak adalah GPT-4o dan Gemini 2.5-Pro. Makalah ini membingkai hal ini bukan sebagai kegagalan pengenalan yang sempit tetapi sebagai bukti adanya keterbatasan dalam penalaran kausal lintas-modal dan dalam apa yang penulis sebut sebagai mikro-kinematika tulisan: gerakan tangan dan pena yang halus dan cepat yang membawa informasi tentang huruf mana yang sedang dibentuk.
Temuan kedua yang dilaporkan kurang diharapkan. Para penulis menggambarkan “efek fusi paradoks,” di mana penyediaan audio dan video ke suatu model sering kali menurunkan kinerjanya dibandingkan dengan penyediaan modalitas tunggal. Mereka membaca hal ini sebagai gangguan dalam kemampuan model untuk mensintesis isyarat persepsi yang saling melengkapi. Abstrak tidak melaporkan skor per-modalitas, sehingga ukuran degradasi tersebut, dan apakah degradasi tersebut muncul untuk setiap model yang diuji, tidak ditentukan oleh materi yang ditinjau di sini.
Akun ini diambil dari halaman abstrak arXiv saja; makalah lengkap, lampirannya, dan materi apa pun yang dirilis tidak diperiksa. Beberapa rincian yang penting untuk menilai hasil tidak disebutkan di sana. Abstrak tidak memberikan jumlah kata atau klip dalam kumpulan data, jumlah peserta manusia atau kondisi saat mereka diuji, bahasa atau skrip yang digunakan, definisi pasti keakuratan huruf yang diurutkan, cara model diminta, cara video dan audio diambil sampelnya dan diteruskan, atau apakah data dan kode akan dipublikasikan. Makalah ini juga terdaftar sebagai makalah yang akan diterbitkan dalam jalur temuan konferensi dan bukan sebagai publikasi lengkap yang telah melalui tinjauan sejawat, dan tidak ada replikasi independen yang diketahui pada saat ini.
Mengapa itu penting
Kebanyakan evaluasi multimodal menguji pengenalan terhadap apa yang terlihat atau terdengar secara langsung. Yang ini menguji inferensi dari sesuatu yang tidak pernah ditampilkan, dan melaporkan bahwa menambahkan modalitas kedua bisa merugikan - hasil yang bertentangan dengan asumsi umum bahwa menggabungkan audio dan video bersifat aditif. Jika hal ini bertahan, hal ini menunjukkan kelemahan dalam cara sistem saat ini menggabungkan saluran persepsi, bukan hanya pada tugas yang sulit.
Tolok ukur multimodal yang paling banyak digunakan menguji apakah suatu sistem dapat memberi nama apa yang ada dalam gambar, video, atau klip audio. Yang ini sengaja menghilangkan jawaban dari masukan. Kata itu tidak pernah diperlihatkan; itu harus direkonstruksi dari proses fisik yang menghasilkannya. Desain tersebut menargetkan suatu kemampuan – menyimpulkan penyebab yang tidak terlihat dari bukti dinamis – yang lebih mirip dengan cara orang membaca suatu adegan dibandingkan dengan pencocokan pola pada konten statis, dan ini adalah kemampuan yang sebagian besar tidak diisolasi oleh rangkaian evaluasi saat ini.
Hasil penggabungan ini bisa dibilang lebih konsekuensial dari kedua klaim tersebut. Banyak rekayasa produk berasumsi bahwa memberi model saluran persepsi yang lebih banyak akan membantu: asisten rapat menggabungkan ucapan dengan video layar, alat aksesibilitas menggabungkan input kamera dan mikrofon, dan tumpukan robotika menggabungkan beberapa sensor dengan asumsi bahwa redundansi bersifat protektif. Jika modalitas kedua dapat membuat model menjadi lebih buruk pada tugas yang kedua salurannya membawa sinyal nyata, maka asumsi tersebut memerlukan pengujian, bukan kepercayaan. Makalah ini tidak menetapkan bahwa hal ini terjadi secara umum – makalah ini melaporkannya pada satu tugas, dengan sejumlah kecil model bernama – tetapi ini adalah kasus nyata di mana lebih banyak masukan menghasilkan jawaban yang lebih buruk.
Tugas tersebut juga berada di dekat dua bidang praktis. Salah satunya adalah aksesibilitas dan digitalisasi: menangkap tulisan tangan dari suara dan gerakan, tanpa pena pintar atau pemindai, akan berguna untuk menangkap catatan dan bagi orang yang menulis di kertas biasa. Yang lainnya adalah privasi. Menyimpulkan konten tertulis dari sinyal akustik dan visual yang tidak disengaja, pada prinsipnya, merupakan masalah saluran samping, dan serangan saluran samping pada keyboard dari audio telah dipelajari selama bertahun-tahun. Berdasarkan bukti dalam abstrak ini, model tujuan umum yang ada saat ini masih jauh dari mampu melakukan hal ini – di bawah 10% hampir tidak dapat digunakan – sementara manusia dilaporkan dapat melakukannya. Itu adalah temuan tentang kemampuan model saat ini, bukan jaminan yang tahan lama.
Keterbatasan ini berlaku dua arah dan patut dinyatakan dengan jelas. Skor yang sangat rendah pada tolok ukur yang baru diperkenalkan adalah hal biasa, dan skor tersebut tidak dapat membedakan antara defisit penalaran yang sebenarnya, ketidaksesuaian antara format tugas dan cara model ini menyerap video dan audio, serta pemanfaatan evaluasi yang tidak disesuaikan untuk tugas tersebut. Kedua model yang disebutkan adalah sistem komersial untuk keperluan umum, bukan sistem yang dibangun atau disesuaikan untuk analisis gerak yang lebih detail, dan model yang lebih kuat atau lebih baru mungkin belum diuji. Garis dasar manusia dilaporkan sebagai satu angka tanpa kondisi yang dijelaskan. Dan tolok ukur yang dibuat oleh tim yang sama yang melaporkan kesenjangan tersebut belum diuji oleh orang lain.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
What is the best response when AI Models Explained makes a mistake in production?
Apa yang harus ditonton selanjutnya
Apakah kumpulan data, kode, dan protokol dasar manusia dirilis dan direproduksi secara independen; apakah model yang lebih baru atau dorongan yang berbeda dapat menutup kesenjangan; dan apakah degradasi fusi yang dilaporkan muncul pada tugas audio-video lainnya atau ternyata spesifik untuk tolok ukur ini.
Hal pertama yang harus diperhatikan adalah rilis dan reproduktifitas. Apakah penulis mempublikasikan kumpulan data, kode evaluasi, dan protokol penelitian manusia yang tepat akan menentukan seberapa cepat nomor judul dapat diperiksa. Entri arXiv yang diulas di sini tidak menunjukkan kode atau tautan data. Tolok ukur yang melaporkan kesenjangan manusia-mesin sebesar 70 poin mengundang replikasi independen, dan nilai klaim tersebut sangat bergantung pada apakah kelompok lain dapat mereproduksi skor model dan data dasar manusia.
Pertanyaan kedua adalah apakah kesenjangan tersebut dapat bertahan jika terjadi kontak dengan pengaturan yang lebih baik. Skor pada tugas multimodal baru sering kali berubah secara substansial dengan perubahan yang tidak ada hubungannya dengan penalaran — kecepatan bingkai, pengambilan sampel audio, dan prapemrosesan, berapa banyak bingkai yang benar-benar dilihat oleh model, struktur cepat, atau sedikit penyesuaian khusus tugas. Jika perubahan teknis kecil meningkatkan model jauh di atas 10%, hasilnya terutama terlihat sebagai masalah saluran masukan. Jika penyesuaian yang cermat membuat mereka hampir gagal, klaim kuat penulis tentang penalaran kausal lintas-modal menjadi lebih sulit untuk diabaikan.
Ketiga adalah efek fusi. Pertanyaan menariknya adalah apakah degradasi akibat penambahan modalitas muncul pada tugas audio-video lainnya, atau apakah ini khusus untuk tugas ini. Jika kelompok lain menemukan pola yang sama di tempat lain, hal ini akan menunjukkan sesuatu yang struktural dalam cara model saat ini memberi bobot dan menggabungkan saluran, bukan kekhasan goresan pena dan gerakan tangan. Ablasi per-modalitas dalam makalah lengkap, dan upaya untuk mereproduksinya, adalah tempat yang diselesaikan.
Terakhir, perhatikan adopsi. Tolok ukur menjadi penting ketika laboratorium lain melaporkan skornya dan ketika angkanya berpindah dari generasi model ke generasi berikutnya. Apakah hal ini muncul dalam jalur temuan CVPR 2026 seperti yang dinyatakan, apakah laboratorium perbatasan memasukkannya ke dalam laporan evaluasi, dan apakah peneliti privasi dan keamanan mengambil pembingkaian saluran samping, semuanya akan terlihat dalam beberapa bulan mendatang. Perlu dicatat juga bahwa tolok ukur yang jauh dari saturasi memberikan sinyal yang jelas untuk sementara waktu — hingga akhirnya tidak memberikan sinyal yang jelas, dan pada saat itulah pertanyaannya adalah apakah model mempelajari kemampuan atau kumpulan datanya.