Kembali ke Berita
InovasiAI Understanding pengarahan

Makalah Memperkenalkan "Evaluasi Bayangan": Agen AI Melakukan Rekayasa tetapi Gagal dalam Dua Pertanyaan Penelitian

Pracetak yang terdiri dari 24 penulis meminta agen AI terdepan untuk menjawab pertanyaan penelitian utama dari dua kiriman NeurIPS 2026 yang tidak dipublikasikan, lalu meminta penulis makalah tersebut menilai hasilnya. Agen tersebut menangani rekayasa tanpa bantuan selama enam hari tetapi jelas ditolak dalam penelitian tersebut.

6 min readRead the primary source
Source-provided image accompanying Paper Introduces "Shadow Evaluations": AI Agents Did the Engineering but Failed Two Research Questions
Dokumen sumber utamaSumber direkam
Penerbit
arxiv.org
Tautan sumber
arxiv.orghttps://arxiv.org/abs/2607.27191
Jenis sumber
Dokumen primer โ€” pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

Kecerdasan Buatan (AI)
Bidang luas dalam membangun sistem yang melakukan tugas yang memerlukan pengenalan pola, penalaran, bahasa, atau pengambilan keputusan.
Pembelajaran Mesin (ML)
Metode yang memungkinkan sistem mempelajari pola dari data dan meningkat seiring waktu.
Tata Kelola AI
Kebijakan, standar, dan mekanisme pengawasan yang memandu bagaimana AI dikembangkan dan digunakan di masyarakat.
Uji diri Anda sendiriKuis Agen AI

Apa yang terjadi

Pracetak yang diposting ke arXiv pada tanggal 29 Juli 2026 dan direvisi pada tanggal 7 Agustus mengusulkan cara baru untuk mengukur kemajuan menuju penelitian AI otomatis: berikan pertanyaan terbuka utama kepada agen mengenai makalah berkualitas tinggi yang belum dipublikasikan dan minta penulis asli makalah tersebut menilai hasilnya. Dalam dua uji coba, agen perbatasan menyelesaikan rekayasa tanpa bantuan manusia tetapi ditolak oleh manusia yang menilai, dan penulis mengidentifikasi lima mode kegagalan yang berulang.

Pracetak di arXiv, diserahkan pada 29 Juli 2026 dan direvisi pada 7 Agustus 2026, menanyakan apakah agen AI dapat melakukan penelitian AI terbuka. Ini membawa 24 penulis terdaftar, termasuk Peter Kirgis, Sayash Kapoor, Helen Toner, Gillian Hadfield, Seth Lazar, Rishi Bommasani dan Arvind Narayanan, dan berada di bawah kecerdasan buatan, komputer dan masyarakat, dan pembelajaran mesin. Kontribusi utamanya adalah metode pengukuran yang penulis sebut sebagai "evaluasi bayangan": agen diberikan pertanyaan penelitian sentral dan terbuka mengenai makalah berkualitas tinggi namun belum dipublikasikan, dan penulis asli makalah tersebut kemudian menilai apa yang dihasilkan oleh agen tersebut.

Para penulis memposisikan hal ini sebagai pilihan ketiga di antara dua pendekatan yang mereka anggap tidak memadai. Evaluasi agen saat ini, tulis mereka, adalah menguji agen pada tugas-tugas yang sempit dan dapat diverifikasi โ€“ yang secara konstruksi tidak mencakup penelitian terbuka โ€“ atau mengirimkan makalah yang dihasilkan AI ke tinjauan sejawat buta, yang mereka anggap terlalu berlebihan, stokastik, dan memiliki kualitas ulasan yang buruk. Evaluasi bayangan justru menggunakan orang-orang yang telah mengetahui permasalahannya, literaturnya, dan kesulitan-kesulitannya sebagai penilai, karena mereka mempunyai jawaban yang belum dipublikasikan untuk dibandingkan.

Tim menjalankan metode ini pada dua kiriman yang tidak dipublikasikan ke NeurIPS 2026. Menurut abstrak, agen perbatasan diberi waktu enam hari dan ribuan dolar komputasi per upaya. Para agen menyelesaikan semua rekayasa tanpa bantuan manusia โ€“ kode, eksperimen, infrastruktur โ€“ tetapi tidak dapat membuat kemajuan besar dalam menjawab pertanyaan penelitian itu sendiri. Kedua makalah yang dihasilkan, menurut kata-kata penulis, ditolak secara tegas oleh penulis asli yang bertindak sebagai peninjau.

Dari transkrip tersebut, penulis mengekstrak lima mode kegagalan yang berulang: penilaian yang buruk tentang batasan penelitian yang dapat dipublikasikan; tanggapan tidak kreatif terhadap kekurangan dalam desain penelitian; kemunduran yang tidak efektif dari jalan buntu; kesadaran sumber daya yang buruk; dan penyimpangan instruksi. Mereka melaporkan bahwa pemeriksaan ketahanan menggunakan model kedua dan perancah kedua menghasilkan kegagalan yang sama, dengan alasan bahwa hasil tersebut merupakan artefak dari satu sistem atau sistem tertentu. Tim mengatakan mereka merilis ulasan para ahli, tanggapan survei, repositori agen, dan log.

Ada beberapa hal yang tidak ditetapkan dalam abstrak, ada baiknya dinyatakan dengan jelas. Ini tidak menyebutkan agen, model atau perancah mana yang digunakan, atau sistem kedua dalam pemeriksaan ketahanan. Ini tidak mengidentifikasi dua kiriman NeurIPS atau subbidangnya, memberikan angka komputasi yang tepat melebihi "ribuan dolar", menjelaskan rubrik penilaian, atau menyatakan apakah penilai tidak mengetahui fakta bahwa mereka sedang meninjau keluaran agen. Karya tersebut merupakan pracetak; tidak ada apa pun di sumbernya yang menunjukkan bahwa ia telah menyelesaikan tinjauan sejawat. Dan sampelnya adalah dua pertanyaan penelitian, yang dinilai oleh orang yang mengajukannya.

Detail sumber: arxiv.org โ†—

Mengapa itu penting

Argumen bahwa kemajuan AI akan meningkat tajam bertumpu pada premis bahwa sistem AI dapat mengambil alih penelitian AI itu sendiri. Hal ini merupakan bukti langsung, meskipun kecil, bahwa premis tersebut belum dapat dipegang, dan hal ini memisahkan bagian-bagian yang sudah dapat dilakukan oleh agen โ€“ implementasi โ€“ dari bagian-bagian yang tidak dapat mereka lakukan: menilai apa yang layak dipublikasikan, mendesain ulang penelitian yang cacat, dan meninggalkan jalan buntu.

Kerangka makalah ini sejalan dengan asumsi beban dalam perkiraan AI saat ini. Seperti yang dijelaskan secara abstrak, perkiraan kemajuan AI yang luar biasa bergantung pada agen AI yang mengotomatiskan penelitian AI โ€“ sebuah lingkaran di mana sistem yang lebih baik akan membangun sistem yang lebih baik. Perulangan tersebut sering kali ditegaskan dan jarang diukur, karena hal yang diotomatisasi adalah jenis pekerjaan yang menolak skrip penilaian. Sebuah metode yang menghasilkan keputusan bertingkat dari peneliti yang bekerja pada pertanyaan langsung dan belum terjawab adalah penyelidikan yang lebih langsung terhadap asumsi tersebut dibandingkan skor patokan pada tugas-tugas dengan jawaban yang diketahui.

Hasilnya menarik garis di tengah-tengah pekerjaan, bukan di sekelilingnya. Agen menjalankan program eksperimental selama beberapa hari tanpa pengawasan dan menghasilkan kode serta hasil yang berfungsi โ€” ini adalah kemampuan nyata dan perubahan yang berarti dari beberapa tahun yang lalu. Apa yang tidak mereka lakukan adalah bagian yang menentukan apakah penelitian layak dipublikasikan: menyadari bahwa hasilnya tipis, menemukan jalan keluar dari cacat desain, dan mengetahui kapan jalur serangan sudah mati. Untuk tim yang memutuskan di mana akan menempatkan agen dalam jalur penelitian atau teknik, perbedaan tersebut lebih dapat ditindaklanjuti dibandingkan skor kemampuan agregat.

Dua dari lima mode kegagalan digeneralisasikan jauh melampaui penelitian. Kesadaran akan sumber daya yang buruk โ€” menghabiskan komputasi tetap atau anggaran waktu tanpa penyesuaian โ€” dan penyimpangan instruksi, di mana agen secara bertahap berhenti melakukan apa yang diminta, merupakan masalah yang berulang dalam penerapan otonom jangka panjang, mulai dari agen pengkodean multi-hari hingga otomatisasi operasional. Periode enam hari di sini merupakan periode yang sangat lama menurut standar evaluasi, dan jangka waktu yang panjang adalah saat di mana kegagalan ini memiliki ruang untuk bertambah parah sebelum ada yang menyadarinya.

Keterbatasan tersebut nyata dan penulis tidak menyembunyikannya. Dua studi kasus di satu tempat, yang dievaluasi berdasarkan satu cuplikan model, tidak dapat mendukung klaim tentang apa yang dapat dilakukan agen tahun depan. Ini adalah hasil nol dengan stempel waktu. Para penulis yang menilai juga memiliki kepentingan yang jelas dalam pertanyaan yang mereka pilih untuk dikerjakan, dan metode ini juga menghabiskan sebagian waktunya: begitu sebuah makalah diterbitkan, pertanyaan penelitiannya tidak dapat lagi berfungsi sebagai ujian yang tidak terlihat. Melepaskan ulasan, repositori, dan log adalah hal yang membuat temuan tersebut dapat diperiksa dan bukan klaim yang dapat diambil berdasarkan kepercayaan.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:๐Ÿ›ก๏ธ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language modelโ€”it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Pemeriksaan Konsep Interaktif+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

Apa yang harus ditonton selanjutnya

Apakah evaluasi bayangan diulangi pada skala yang lebih besar dengan penilaian yang buta dan telah didaftarkan sebelumnya; apakah agen dan scaffold yang lebih baru menutup kesenjangan ketika dijalankan kembali terhadap repositori dan log yang dirilis; dan apakah kelima mode kegagalan tersebut bertahan dalam pengawasan independen dan tinjauan sejawat.

Hal pertama yang harus diperhatikan adalah apakah evaluasi bayangan menjadi instrumen yang dapat diulang atau hanya sekedar demonstrasi. Hal ini berarti lebih banyak makalah di lebih banyak tempat dan subbidang, rubrik penilaian yang telah didaftarkan sebelumnya disetujui sebelum agen dijalankan, dan penilaian tidak mengetahui apakah keluaran berasal dari agen atau manusia. Hal ini juga berarti mengatasi masalah pasokan: metode ini memerlukan aliran karya berkualitas tinggi yang tidak dipublikasikan yang penulisnya bersedia melakukan upaya peninjauan nyata pada upaya agen.

Yang kedua adalah apakah kesenjangan tersebut dapat ditutup, dan seberapa cepatnya. Karena repositori agen dan log sedang dirilis, kelompok lain dapat menjalankan kembali model dan scaffold yang lebih baru terhadap dua pertanyaan penelitian yang sama dan membandingkannya secara langsung. Perhatikan apakah perbaikan muncul sebagai rekayasa yang lebih baik โ€“ yang telah dilakukan oleh para agen โ€“ atau sebagai gerakan atas kegagalan penilaian, yang menurut makalah ini merupakan bagian yang hilang. Percobaan ulang yang menghasilkan lebih banyak eksperimen namun penolakan yang sama akan menjadi sinyal yang berbeda dibandingkan penayangan ulang yang menghasilkan makalah yang dianggap serius oleh penulis aslinya.

Ketiga, pengawasan independen terhadap artefak yang dilepaskan. Lima mode kegagalan adalah pembacaan transkrip oleh penulis sendiri; peneliti lain yang membaca log yang sama mungkin mengkategorikan pengelompokan secara berbeda, atau menemukan bahwa beberapa kegagalan berasal dari perancah dan pemicunya, bukan dari modelnya. Apakah pracetak tersebut lolos tinjauan sejawat, dan apakah taksonominya dapat bertahan jika dibandingkan dengan evaluasi orang lain, akan menentukan seberapa besar bobot yang dapat ditanggungnya.

Terakhir, penyerapan di luar komunitas riset. Daftar penulis mencakup orang-orang yang bekerja secara langsung pada tata kelola dan kebijakan AI, dan jadwal waktu untuk penelitian dan pengembangan AI otomatis yang dimasukkan ke dalam kerangka kerja keselamatan perbatasan, ambang batas kemampuan, dan perdebatan kebijakan nasional. Perhatikan apakah bukti ini dikutip dalam situasi tersebut, dan apakah dilaporkan secara akurat: makalah ini mengatakan bahwa agen-agen saat ini berjuang dengan bagian-bagian penting dari siklus hidup penelitian, berdasarkan dua kasus โ€” bukan karena mereka tidak akan pernah bisa melakukan penelitian, dan bukan karena kemampuan teknik yang mereka tunjukkan adalah hal yang remeh.

Panduan & kuis terkait

Agen AIMasa Depan AIModel AI DijelaskanUji pengetahuan Anda โ€” coba kuis AI gratisCari istilah AI di glosarium kami
Apakah ini berguna?