Apa yang berlaku
Pracetak baharu yang disiarkan pada 11 Ogos menamakan mod kegagalan yang diperhatikan dalam repositori pengekodan agen sebagai "pengingatan malapetaka": fail arahan projek terus mengumpul peraturan kerana menambah langkah berjaga-jaga adalah murah, manakala pemadaman peraturan lama dengan selamat menjadi lebih sukar selepas rasional asalnya hilang.
Para penyelidik mengumpulkan 247,694 hayat arahan dan 299,440 peralihan komit-untuk-komit daripada 1,867 repositori awam yang mengandungi fail seperti CLAUDE.md. Mereka menjejaki arahan individu melalui suntingan dan melaporkan bahawa fail meningkat sebanyak 226% sepanjang hayat mereka yang diperhatikan, menambah purata 4.9 arahan bersih setiap komit pengubahsuaian. Kajian itu menganggap angka tersebut sebagai bukti pengumpulan berterusan dalam sampelnya, bukan bukti bahawa setiap arahan tidak diperlukan atau semua projek pengekodan agen berkelakuan dengan cara yang sama.
Mekanisme pusat kertas itu adalah bukti asimetri. Penyelenggara atau ejen pengekodan boleh menambahkan arahan baharu selepas kesilapan tanpa membina semula setiap interaksi antara peraturan yang sedia ada. Pemadaman kemudian lebih berisiko: apabila kegagalan yang mendorong dan konteks sekeliling telah hilang, mengalih keluar satu arahan mungkin memerlukan pemeriksaan sama ada ia masih menghalang regresi di bawah banyak kombinasi arahan yang tinggal. Dalam data repositori, anggaran bahaya pemadaman jatuh apabila arahan berumur, dengan cerun bahaya log yang dilaporkan sebanyak -0.032 setiap komit.
Untuk menguji kemungkinan remedi, pengarang mencipta tugasan mengikut arahan dengan menyongsangkan kekangan IFEval, kemudian membandingkan gesaan yang mengandungi peraturan kosong dengan gesaan yang turut mengekalkan ulasan ringkas yang menjelaskan sebab setiap peraturan wujud. Dalam persediaan terkawal mereka, gesaan yang tidak diulas mengumpul 211.3% lebihan arahan, manakala gesaan yang diulas berakhir pada lebihan 1.4%. Komen itu bukan arahan tambahan untuk model; ia adalah asal yang padat bertujuan untuk membuat keputusan penyingkiran kemudian boleh diaudit.
Pasukan itu juga menilai sama ada gesaan yang lebih kecil dan didokumentasikan dengan lebih baik membantu ejen mengikut arahan. Pada penanda aras terbitan WildIFEval, kertas itu melaporkan keuntungan sebanyak 23.1 mata peratusan apabila rasional dikekalkan dan peraturan usang boleh dialih keluar. Keputusan tersebut adalah tuntutan daripada pracetak yang baru disiarkan dan tidak disemak oleh rakan sebaya. Kerja itu tidak menetapkan bahawa ulasan sahaja akan menambah baik setiap ejen pengekodan, repositori, bahasa atau aliran kerja pengeluaran.
Butiran sumber: Catastrophic remembering research paper on arXiv ↗
Mengapa ia penting
Fail arahan peringkat repositori menjadi ingatan operasi yang tahan lama untuk ejen pengekodan, jadi pertumbuhan yang tidak terkawal boleh meningkatkan kos token, mengekalkan kekangan usang dan menjadikan peraturan yang mengawal perubahan kod automatik lebih sukar untuk difahami oleh orang ramai.
Risiko praktikal bukan sekadar fail yang panjang. Setiap arahan bersaing untuk mendapatkan perhatian model dan boleh berinteraksi dengan peraturan baharu, penerangan alat, konteks kod dan permintaan pengguna. Arahan yang ditulis untuk menghalang satu kegagalan sejarah mungkin menjadi tidak relevan selepas pangkalan kod berubah, bercanggah dengan dasar yang lebih baharu atau terlalu mengekang kerja yang tidak berkaitan. Jika tiada siapa yang boleh membina semula mengapa ia wujud, pilihan tempatan paling selamat selalunya mengekalkannya, yang menggerakkan kos pembersihan ke komitmen masa hadapan.
Corak itu penting di luar CLAUDE.md. Pasukan semakin menyimpan konvensyen, sempadan keselamatan, arahan ujian, keputusan seni bina dan amaran penggunaan dalam panduan projek yang boleh dibaca oleh mesin. Fail ini boleh meningkatkan konsistensi dan mengurangkan kesilapan berulang, tetapi ia juga menjadi permukaan tadbir urus: orang harus dapat mengenal pasti siapa yang memperkenalkan peraturan berbangkit, apakah bukti yang mewajarkannya, dan apakah syarat yang membolehkan ia dibersarakan. Komen rasional ialah versi ringan jejak audit itu.
Hasilnya mencadangkan prinsip reka bentuk yang berguna untuk ingatan ejen: mengingat harus termasuk syarat untuk melupakan. Daripada merekodkan hanya "sentiasa lakukan X", sistem boleh mengekalkan kegagalan yang diperhatikan, skop peraturan, komponen atau ujian yang berkaitan dan pencetus semakan. Itu tidak mengautomasikan pemadaman, tetapi ia memberikan bukti penyelenggara kemudian untuk memutuskan sama ada kekangan itu masih melindungi ketepatan atau hanya mencerminkan persekitaran lama.
Terdapat juga sudut minat awam kerana ejen pengekodan menyentuh lebih banyak perisian berbangkit. Arahan peribadi terkumpul secara senyap boleh membentuk keputusan keselamatan, tingkah laku kebolehaksesan, pengendalian data atau cara ejen bertindak balas terhadap kegagalan. Fail yang lebih kecil tidak secara automatik lebih selamat, dan pembersihan agresif boleh mengalih keluar perlindungan penting. Hasil yang berguna ialah kebolehkesanan: lebih sedikit peraturan yang tidak dapat dijelaskan, pemilikan eksplisit dan amalan semakan yang membenarkan manusia mencabar kedua-dua penambahan dan pemadaman.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').What most distinguishes an AI agent from a basic chatbot?
Apa yang perlu ditonton seterusnya
Ujian seterusnya ialah replikasi bebas merentas bahasa, organisasi, produk ejen dan repositori tahan lama, diikuti dengan percubaan prospektif yang mengukur sama ada pembersihan yang didokumenkan meningkatkan kualiti kod tanpa memadamkan perlindungan penting.
Sampel pemerhatian mempunyai had pemilihan. Repositori awam yang melakukan fail arahan ejen mungkin berbeza daripada pangkalan kod perusahaan persendirian dan sejarah repositori tidak boleh mendedahkan setiap perbincangan atau insiden di luar platform yang mendorong peraturan. Pertumbuhan juga boleh menjadi rasional apabila projek berkembang. Analisis masa depan harus memisahkan liputan berguna komponen baharu daripada arahan pendua, bercanggah atau usang dan melaporkan cara keputusan berbeza mengikut umur repositori, saiz, bahasa, kiraan penyumbang dan platform ejen.
Percubaan terkawal memerlukan pengesahan yang lebih luas. Tugas-tugas itu diperoleh daripada penanda aras mengikut arahan dan bukannya penyelenggaraan perisian secara langsung selama berbulan-bulan, dan saluran paip padanan kertas telah diperiksa pada sampel 50 peralihan. Seorang pengarang menghasilkan anotasi tangan yang digunakan dalam sebahagian daripada pengesahan. Kajian itu tidak meliputi fail arahan bukan bahasa Inggeris, dan ia tidak menyapu setiap ambang yang digunakan untuk memutuskan apabila perubahan dikira sebagai penulisan semula dan bukannya penerusan arahan.
Komen boleh mengekalkan rasional yang salah semudah yang betul. Oleh itu, pasukan harus menguji asal berstruktur terhadap alternatif seperti isu terpaut, ujian regresi yang gagal, tarikh tamat tempoh, medan pemilikan atau semakan automatik yang menandakan arahan pendua dan bercanggah. Aliran kerja paling selamat akan mencadangkan pengalihan keluar, menunjukkan bukti dan ujian yang terjejas, dan memerlukan semakan untuk peraturan berimpak tinggi dan bukannya membenarkan ejen memotong arahan semata-mata untuk menyimpan token.
Bukti susulan yang berguna akan mengukur hasil akhir ke hujung: saiz segera, pematuhan arahan, kejayaan tugasan, regresi, masa semakan dan bilangan peraturan yang dipulihkan selepas pemadaman. Penyelidik juga harus menguji sama ada model benar-benar menggunakan komen rasional seperti yang dimaksudkan atau kadang-kadang tersalah anggap sebagai keperluan tambahan. Sehingga keputusan tersebut tiba, ingatan bencana ialah perihalan yang disokong dengan baik bagi set data dan eksperimen pengarang, bukan undang-undang sejagat atau sebab untuk memadamkan borong panduan projek matang.