Apa yang terjadi
Para peneliti memperkenalkan BixBench3, sebuah tolok ukur yang dirancang untuk menguji agen AI pada tugas-tugas biologi komputasi yang dimodelkan pada pekerjaan penelitian yang didelegasikan. Seorang ilmuwan memberikan pertanyaan penelitian dan metode tingkat tinggi, sementara agen harus menerapkan analisis dan menghasilkan keluaran yang sebanding dengan yang dilaporkan dalam penelitian dasar yang dipublikasikan.
BixBench3 mengevaluasi agen AI dari data biologis mentah melalui artefak komputasi menengah hingga hasil ilmiah. Tolok ukur ini berisi 20 tugas yang diambil dari studi ilmiah yang dipublikasikan dan mencakup 138 artefak unik, termasuk matriks panggilan puncak dan tabel ekspresi diferensial. Artefak tersebut dinilai secara terprogram berdasarkan artefak terkait yang dihasilkan dan dilaporkan dalam studi asli.
Tolok ukur ini dirancang berdasarkan pembagian kerja tertentu. Seorang ilmuwan memilih pertanyaan penelitian dan memberikan panduan metodologis; agen AI bertanggung jawab untuk menerapkan analisis. Hal ini menguji lebih dari sekadar apakah suatu model dapat menjawab pertanyaan biologi atau menghasilkan potongan kode yang terisolasi. Ini menguji apakah sistem dapat mempertahankan alur kerja yang koheren di beberapa operasi dan menghasilkan keluaran dalam bentuk yang diharapkan.
Penulis melaporkan skor mulai dari 0,00 untuk Gemini 3.1 Flash Lite hingga 0,48 untuk GPT 5.6 Sol di 13 model frontier. Performa menurun pada tugas-tugas yang melibatkan kumpulan data mentah yang lebih besar, dengan skor yang dilaporkan sebesar 0,36 pada tugas-tugas yang melibatkan 100 GB data. Nilai ini juga turun seiring dengan bertambahnya jumlah langkah analisis berurutan: skornya adalah 0,36 untuk tugas yang memerlukan satu atau dua langkah dan 0,24 untuk tugas yang memerlukan tiga langkah atau lebih.
Kebutuhan sumber daya sangat besar. Agen menggunakan rata-rata 6,8 jam, 102 juta token, dan $43 per tugas. Upaya terlama memakan waktu 24 jam, menggunakan 1,07 miliar token dan biaya $525. Para penulis juga melaporkan bahwa agen dengan skor tertinggi menggunakan lebih sedikit token dan lebih murah dibandingkan opsi dengan kinerja lebih rendah, yang menunjukkan bahwa pengeluaran yang lebih besar tidak secara otomatis memberikan hasil yang lebih baik.
Mengapa itu penting
Hasilnya menunjukkan bahwa kinerja yang kuat pada pengujian yang terisolasi tidak selalu menghasilkan pelaksanaan keseluruhan alur kerja ilmiah yang andal. Tolok ukur ini mengukur hambatan praktis—urutan panjang dari langkah-langkah yang bergantung, kumpulan data mentah yang besar, dan perbedaan di seluruh domain biologis—yang dapat menentukan apakah agen berguna dalam konteks penelitian nyata.
Biologi komputasi sering kali bergantung pada rantai transformasi, bukan pada satu prediksi. Seorang agen mungkin perlu menafsirkan instruksi metodologis, memanipulasi data mentah, menjalankan beberapa analisis, dan menjaga konsistensi antara hasil antara. Oleh karena itu, penurunan yang dilaporkan BixBench3 pada alur kerja yang lebih panjang relevan dengan bagaimana sistem AI dapat digunakan dalam penelitian sebenarnya, di mana kesalahan awal dapat memengaruhi artefak selanjutnya.
Tolok ukur ini juga mengalihkan perhatian dari demonstrasi yang halus ke keluaran yang dapat diverifikasi. Daripada hanya menilai penjelasan tertulis, penulis membandingkan artefak yang dihasilkan oleh agen dengan artefak dari penelitian asli. Pendekatan tersebut dapat mengungkap kegagalan yang mungkin disembunyikan oleh ringkasan yang lancar, meskipun mencocokkan artefak yang diharapkan tidak sama dengan memvalidasi penemuan ilmiah baru.
Rentang skor yang luas yang dilaporkan di seluruh model yang diuji menunjukkan bahwa pilihan model dapat mempengaruhi secara signifikan apakah suatu agen dapat menyelesaikan tugas biologi komputasi. Sumber tersebut tidak menjelaskan mengapa model-model tersebut berbeda, apakah hasilnya menggeneralisasi melebihi sistem yang diuji atau apakah skor yang lebih rendah mencerminkan satu kelemahan teknis tertentu. Hal ini membuktikan bahwa agen yang dievaluasi tidak bekerja secara seragam pada kelas pekerjaan yang sama.
Angka biaya dan waktu menjadikan keandalan sebagai masalah operasional dan juga masalah teknis. Tugas rata-rata yang membutuhkan waktu berjam-jam dan puluhan juta token mungkin dapat dikelola oleh beberapa tim peneliti tetapi tidak praktis untuk analisis rutin dan bervolume tinggi. Proses terpanjang yang dilaporkan menunjukkan bahwa tugas-tugas sulit dapat menghabiskan lebih banyak sumber daya. Temuan bahwa agen dengan skor terbaik juga lebih murah menunjukkan bahwa efisiensi dan kemampuan terkadang saling memperkuat, namun sumber tersebut tidak memberikan rincian yang cukup untuk mengidentifikasi penyebabnya.
Bagi peneliti, implikasi praktisnya adalah kehati-hatian dalam mendelegasikan analisis lengkap tanpa titik pemeriksaan. Tolok ukur ini mendukung evaluasi keluaran antara, penanganan urutan, dan skala kumpulan data sebelum memperlakukan agen sebagai asisten peneliti yang dapat diandalkan. Hal ini tidak menunjukkan bahwa agen AI siap menggantikan ilmuwan, juga tidak menunjukkan bahwa mereka menghasilkan pengetahuan biologi baru secara mandiri.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Apa yang harus ditonton selanjutnya
Makalah ini merupakan pracetak arXiv yang baru diserahkan, sehingga temuannya belum ditetapkan secara independen melalui tinjauan sejawat. Pekerjaan lanjutan harus menguji apakah tugas mewakili praktik biologi komputasi yang lebih luas, apakah agen dapat berkembang dengan alat atau pengawasan yang lebih baik, dan seberapa dekat skor tingkat artefak melacak kesimpulan yang bermakna secara ilmiah.
Batasan langsungnya adalah status pembuktian: BixBench3 diidentifikasi sebagai pracetak arXiv yang dikirimkan pada 26 Agustus 2026. Sumber tersebut memberikan desain dan hasil penulis, namun tidak ada replikasi independen, penilaian tinjauan sejawat, atau perbandingan eksternal. Hal-hal yang tidak diketahui ini penting ketika menafsirkan skor yang dilaporkan dan konsumsi sumber daya.
Evaluasi di masa depan harus memperjelas seberapa representatif 20 tugas biologi komputasi. Sumber tersebut mengatakan bahwa tugas tersebut berasal dari penelitian yang dipublikasikan, namun tidak merinci bagaimana studi atau domain biologis tersebut dipilih, seberapa sulit setiap tugas tersebut, atau apakah tolok ukurnya mencakup seluruh jenis data dan alur kerja yang digunakan oleh kelompok penelitian.
Tolok ukur tersebut mungkin juga perlu membedakan kegagalan implementasi dan kegagalan ilmiah. Matriks panggilan puncak atau tabel ekspresi diferensial yang salah secara terprogram menunjukkan bahwa artefak komputasi yang diharapkan tidak direproduksi, namun sumbernya tidak menjelaskan bagaimana kesalahan diklasifikasikan, apakah metode alternatif yang valid dapat menerima kredit, atau apakah kejadian nyaris celaka masih dapat mendukung kesimpulan yang berguna secara ilmiah.
Ketergantungan yang dilaporkan pada ukuran kumpulan data dan jumlah langkah harus diuji dengan perubahan terkendali pada alat, konteks, anggaran komputasi, dan pengawasan manusia. Masih belum diketahui apakah agen dapat mengatasi hambatan ini melalui orkestrasi alur kerja yang lebih baik, perangkat lunak khusus domain, dekomposisi tugas yang lebih kecil, atau tinjauan oleh para ilmuwan. Sumber tersebut juga tidak mengidentifikasi penyebab perbedaan skor model.
Langkah selanjutnya yang berguna adalah menghubungkan kinerja dengan hasil laboratorium atau kelompok penelitian yang sebenarnya: penghematan waktu, deteksi kesalahan, reproduktifitas, dan kualitas kesimpulan. Hingga tautan tersebut diukur, BixBench3 paling baik dibaca sebagai bukti tentang eksekusi agen saat ini pada serangkaian alur kerja biologi komputasi yang ditentukan, bukan sebagai perkiraan umum penelitian ilmiah otonom.