Apa yang terjadi
Para peneliti memperkenalkan BenchBench-Protocol, sebuah yang dibangun dari 149 modifikasi protokol laboratorium basah di dunia nyata. Dari sembilan model, Claude Opus 5 mencapai skor rubrik ternormalisasi tertinggi yang dilaporkan, namun tolok ukurnya menunjukkan masih banyak ruang untuk perbaikan.
Makalah arXiv memperkenalkan BenchBench-Protocol sebagai tolok ukur untuk model bahasa besar yang menangani penalaran dan modifikasi protokol laboratorium basah. Ini berisi 149 tugas yang direkonstruksi dari perbedaan antara protokol yang diterbitkan dan versi yang dimodifikasi oleh para ilmuwan selama pekerjaan eksperimental nyata. Para penulis mengatakan tolok ukur tersebut mengacu pada 96 protokol sumber yang mencakup sembilan domain biologi laboratorium basah, dan tugas-tugas yang disertakan diberi peringkat tinggi setelah ditinjau oleh pakar domain.
Desain ini menjadikan objek utama tolok ukur tersebut sebagai perubahan nyata terhadap prosedur yang sudah ada, dan bukan sekedar pertanyaan yang dihasilkan hanya dengan meminta para ahli untuk membayangkan sebuah tantangan. Makalah ini membingkai adaptasi protokol sebagai tugas laboratorium yang rutin namun memiliki konsekuensi. Seorang peneliti yang memodifikasi prosedur yang dipublikasikan harus mempertimbangkan pilihan-pilihan sebelumnya dan langkah-langkah yang mengikuti perubahan tersebut. BenchBench-Protocol menggunakan modifikasi nyata tersebut untuk membentuk kueri dan membuat elemen rubrik berbobot untuk menilai tanggapan. Sumber menyajikan ini sebagai cara untuk mendasarkan evaluasi pada struktur eksperimen nyata, sambil mempertahankan format terbuka daripada mereduksi setiap jawaban menjadi satu string yang tepat. Oleh karena itu, tolok ukur ini menguji apakah suatu model dapat mempertahankan ketergantungan yang relevan di seluruh prosedur, bukan hanya menghasilkan bahasa yang masuk akal secara ilmiah.
Penulis mengevaluasi sembilan model tertutup dan terbuka. Claude Opus 5 menerima hasil tertinggi yang dilaporkan, skor rubrik yang dinormalisasi sebesar 59,2%; model lainnya mendapat skor antara 34,1% dan 47,1%, menurut abstrak. Tolok ukurnya juga tetap tidak jenuh ketika upaya terbaik dari sepuluh upaya digunakan, yang berarti upaya berulang tampaknya tidak menghabiskan kinerja yang tersedia berdasarkan pengaturan evaluasi makalah. Sumber tidak mengidentifikasi setiap model yang dievaluasi secara abstrak, menjelaskan interpretasi yang tepat dari skor yang dinormalisasi, atau melaporkan bahwa jawaban model mana pun digunakan untuk melaksanakan eksperimen yang berhasil.
Mengapa itu penting
Sistem AI semakin banyak digunakan untuk mendukung penelitian ilmu hayati, dimana perubahan prosedural yang tampaknya kecil dapat mempengaruhi langkah selanjutnya dan hasil eksperimen. Menguji model terhadap modifikasi yang dilakukan selama karya ilmiah aktual menawarkan ukuran keandalan yang lebih praktis daripada hanya mengevaluasi pertanyaan-pertanyaan yang dibuat-buat.
Penelitian ini mengatasi kelemahan praktis dalam banyak evaluasi AI untuk sains: sebuah model mungkin tampak mampu menjawab pertanyaan-pertanyaan ilmiah yang luas, namun harus berjuang dengan pilihan-pilihan yang terperinci dan bergantung yang membuat prosedur laboratorium berhasil. Dengan mendasarkan tugas pada perubahan yang sebenarnya dilakukan ilmuwan pada protokol yang dipublikasikan, tolok ukur ini memberikan evaluator cara untuk memeriksa apakah sistem AI dapat melakukan penalaran melalui modifikasi lokal tanpa kehilangan jejak konsekuensi hilirnya. Hal ini secara langsung relevan bagi peneliti yang menggunakan model bahasa untuk perencanaan, dokumentasi, atau dukungan prosedural.
Rubrik yang diberi bobot juga penting karena perubahan protokol bisa saja benar sebagian namun tetap menghilangkan detail yang penting di kemudian hari. Suatu respons mungkin mengidentifikasi substitusi yang jelas namun gagal menyesuaikan langkah, kondisi, kuantitas, atau kontrol berikutnya. Sumber ini tidak memberikan perincian jenis-jenis kesalahan ini, namun desain tolok ukurnya dimaksudkan untuk membuat kelalaian tersebut terlihat dan bukan hanya memberi penghargaan pada jawaban yang terdengar lancar. Dalam praktiknya, hal ini dapat membantu laboratorium membandingkan sistem pada pekerjaan yang benar-benar memerlukan bantuan, dibandingkan mengandalkan skor model tujuan umum. Hasil yang dilaporkan menunjukkan adanya kesenjangan kemampuan bahkan di antara sistem terkuat yang diuji.
Skor ternormalisasi teratas sebesar 59,2% tidak boleh dibaca sebagai tingkat keberhasilan 59,2% dalam eksperimen laboratorium, karena abstrak menggambarkan skor rubrik daripada hasil eksperimen yang lengkap. Perbedaan antara skor tertinggi dan terendah yang dilaporkan menunjukkan bahwa pilihan model dapat memengaruhi kinerja tugas ini, namun sumber tidak menentukan karakteristik model mana yang menjelaskan perbedaan tersebut. Hal ini juga tidak menunjukkan bahwa kinerja memprediksi keamanan, reproduktifitas, atau validitas ilmiah di luar protokol yang diuji.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang harus ditonton selanjutnya
Pertanyaan berikutnya adalah apakah tolok ukur tersebut direproduksi secara independen, bagaimana kinerja model pada perubahan protokol individual, dan apakah skor yang lebih kuat berarti bantuan yang lebih aman dan berguna di laboratorium sebenarnya. Sumber tersebut tidak menetapkan bahwa model yang dievaluasi dapat melakukan eksperimen secara independen atau menghasilkan prosedur yang divalidasi.
Langkah penting berikutnya adalah pemeriksaan rinci terhadap tolok ukur lengkap dan proses penilaiannya. Pembaca harus mencari distribusi tugas di sembilan domain, contoh modifikasi dengan skor tinggi dan rendah, identitas dan versi kesembilan model, dan elemen rubrik individual yang paling sering diabaikan oleh model. Rincian tersebut akan menunjukkan apakah hasil tersebut mencerminkan keterbatasan yang luas dalam adaptasi protokol atau serangkaian kesulitan yang lebih kecil dan berulang. Abstrak sumbernya saja tidak menjawab pertanyaan-pertanyaan tersebut.
Replikasi independen akan membantu menentukan seberapa stabil temuan tersebut. Pemeriksaan yang berguna mencakup menjalankan ulang model, menguji format cepat yang berbeda, mengukur variasi di seluruh upaya berulang, dan mengevaluasi apakah peringkat yang sama berlaku pada protokol yang tidak dimasukkan dalam konstruksi . Karena tolok ukurnya tetap tidak jenuh setelah sepuluh kali percobaan, penelitian di masa depan juga harus memperjelas apakah pengambilan sampel tambahan, alat, pengambilan, atau tinjauan manusia akan mengubah kinerja secara signifikan. Tak satu pun dari hasil tersebut dilaporkan dalam sumbernya.
Pertanyaan yang paling penting adalah apakah skor yang lebih baik berarti bantuan laboratorium yang lebih baik. Evaluasi di masa depan dapat membandingkan saran model dengan modifikasi yang telah ditinjau oleh para ahli dan, jika sesuai, validasi eksperimental terkontrol. Pekerjaan seperti itu perlu membedakan kebenaran tekstual dari keberhasilan eksperimen sebenarnya dan memerlukan perlindungan terhadap kesalahan. Untuk saat ini, BenchBench-Protocol memberikan bukti tentang respons model terhadap serangkaian tugas yang diturunkan dari dunia nyata, bukan bukti bahwa sistem ini dapat dengan aman memodifikasi atau menjalankan prosedur laboratorium basah tanpa pengawasan manusia yang berkualifikasi.