Kembali ke Berita
KeselamatanAI Understanding taklimat

Paper memberi amaran bahawa ejen LLM boleh memulihkan pengetahuan yang dipadam melalui alatan

Kertas arXiv baharu mengenal pasti jurang dalam LLM yang tidak belajar: ejen boleh berhenti mengingat maklumat daripada pemberatnya tetapi memulihkannya melalui carian web, dapatkan semula atau alatan pangkalan data. Penulis mencadangkan kaedah dua peringkat untuk mengurangkan kedua-dua bentuk pemulihan sambil mengekalkan penggunaan alat yang sah.

5 min readRead the primary source
Primary-source image accompanying Paper warns that LLM agents can recover deleted knowledge through tools
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.21544
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Pembelajaran Pengukuhan
Latihan melalui isyarat ganjaran di mana ejen mempelajari tindakan yang memaksimumkan pulangan jangka panjang.
Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Uji diri andaKuiz Agen AI

Apa yang berlaku

Kertas arXiv memperkenalkan Agentic Tool Unlearning, rangka kerja yang direka untuk ejen model bahasa yang boleh memanggil alat luaran. Penulis berhujah bahawa unlearning konvensional mungkin menyekat ingatan terus maklumat model tanpa menghalang ejen daripada memulihkan maklumat yang sama melalui carian web, pengambilan semula atau carian pangkalan data.

Kertas itu menerangkan mod kegagalan yang dipanggil pemulihan pengantara alat. Dalam model bahasa konvensional, unlearning biasanya dinilai dengan menguji sama ada model itu masih boleh mengingati secara langsung sasaran yang ditetapkan daripada parameternya. Penulis berpendapat bahawa penilaian ini tidak lengkap untuk ejen yang jawapannya boleh bergantung pada panggilan alat dan pemerhatian luaran. Ejen sedemikian mungkin gagal menyatakan sasaran dari ingatan tetapi mendapatkan maklumat yang sama melalui sumber luaran. Perbezaan ini penting kerana jawapan yang boleh diperhatikan boleh kekal tersedia walaupun tindak balas dalaman model telah berubah. Dalam tetapan itu, menilai model tanpa menilai tindakannya mungkin terlepas laluan di mana sasaran dipulihkan.

Kaedah yang dicadangkan, Agentic Tool Unlearning, mempunyai dua peringkat. Pertama, sistem menggunakan pengetahuan parametrik tanpa pembelajaran bertujuan untuk menyekat ingatan terus. Kedua, ia menggunakan pembelajaran pengukuhan peringkat trajektori dalam persekitaran simulasi alat tambahan. Menurut abstrak kertas itu, peringkat ini menghukum kedua-dua tingkah laku alat mencari sasaran dan kebocoran dalam jawapan akhir. Matlamatnya adalah untuk mengurangkan pemulihan melalui tindakan ejen, bukan hanya melalui perubahan pada berat model. Ini menjadikan urutan keputusan ejen sebahagian daripada masalah yang tidak dapat dipelajari, termasuk pilihan untuk mencari maklumat dan cara bahan yang diambil dimasukkan ke dalam respons.

Pengarang melaporkan percubaan pada penanda aras RWKU dan MUSE yang tidak belajar merentas seni bina model bahasa yang berbeza. Mereka berkata kaedah itu mencapai keseimbangan yang lebih baik antara melupakan sasaran yang ditetapkan dan mengekalkan utiliti biasa untuk pengetahuan yang sepatutnya kekal tersedia. Sumber yang dibekalkan tidak memberikan hasil berangka, nama model, kos latihan, perbandingan garis dasar atau butiran alat simulasi, jadi kekuatan dan skop peningkatan yang dilaporkan tidak boleh dinilai dari abstrak sahaja. Peninggalan tersebut menjadikan keputusan paling baik difahami sebagai cadangan penyelidikan dengan eksperimen yang dilaporkan, dan bukannya sebagai bukti bahawa pendekatan itu telah disahkan merentas sistem yang digunakan.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Makalah ini menyerlahkan masalah keselamatan dan privasi praktikal untuk sistem yang menggabungkan model bahasa dengan alat luaran. Mengalih keluar pengetahuan daripada parameter model mungkin tidak mencukupi jika ejen masih boleh mencari atau membina semula sasaran melalui alat sekelilingnya.

Penemuan itu penting kerana akses alat mengubah maksud sistem AI untuk melupakan sesuatu. Model mungkin tidak lagi mengekod atau mengeluarkan semula sekeping maklumat secara langsung, namun ejen yang lengkap masih boleh menghasilkannya dengan mencari, mendapatkan semula atau menanyakan pangkalan data yang disambungkan. Untuk sistem yang mengendalikan maklumat peribadi, proprietari atau sebaliknya terhad, unit penilaian yang berkaitan mungkin aliran kerja ejen penuh dan bukannya model secara berasingan. Pandangan yang lebih luas ini mengikuti maklumat melalui keseluruhan laluan yang boleh menghasilkan jawapan, dan bukannya menganggap parameter model sebagai satu-satunya sumber yang mungkin.

Perbezaan ini juga mempunyai implikasi untuk cara organisasi mentafsir tuntutan pemadaman atau pengalihan keluar. Jika permintaan bertujuan untuk menghalang ejen daripada menghasilkan sasaran tertentu, mengubah suai parameter model sahaja boleh membiarkan laluan alternatif terbuka. Kertas itu tidak menetapkan bahawa mana-mana sistem yang digunakan pada masa ini gagal dengan cara ini, tetapi ia menawarkan rangka penilaian konkrit untuk menguji sama ada alat ejen menjejaskan prosedur yang tidak dipelajari. Bingkai itu boleh membantu memisahkan perubahan dalam perkara yang diingati oleh model daripada perubahan dalam perkara yang masih boleh diperolehi oleh sistem yang dipasang. Ia juga mengekalkan skop tuntutan pengalihan keluar terikat dengan tingkah laku yang sebenarnya boleh diperhatikan oleh pengguna.

Terdapat pertukaran kejuruteraan yang sukar dalam objektif yang dicadangkan. Penggunaan alat selalunya diperlukan untuk ejen menjawab soalan tentang maklumat yang sepatutnya disimpan. Menghukum terlalu banyak mencari alat boleh merosakkan tingkah laku yang berguna, manakala menghukum terlalu sedikit boleh menyebabkan sasaran yang dilupakan boleh dipulihkan. Matlamat kertas yang dinyatakan untuk mengekalkan pengetahuan yang disimpan menjadikan pertukaran ini jelas, tetapi sumbernya tidak menunjukkan sejauh mana pendekatan itu mengendalikan permintaan samar-samar, pertanyaan tidak langsung atau alatan yang mengandungi maklumat bertindih. Oleh itu, kaedah yang berguna mesti mengekang laluan yang tidak diingini sambil terus menyokong penggunaan alat yang kekal sah, keseimbangan yang tidak boleh disimpulkan daripada abstrak sahaja.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Apa yang perlu ditonton seterusnya

Persoalan utama ialah sama ada kaedah yang dilaporkan melangkaui persekitaran simulasi dan penanda aras kertas itu. Lebih terperinci diperlukan tentang maklumat sasaran, konfigurasi alat, seni bina model, tukar ganti yang diukur dan sama ada pendekatan itu berfungsi dengan pasti tanpa mengganggu penggunaan alat yang sah.

Kertas penuh harus menjelaskan apa yang dikira sebagai berjaya melupakan. Butiran penting termasuk sama ada penilaian menyemak hanya pengeluaran semula sasaran yang tepat atau juga parafrasa, jawapan tidak langsung dan pembinaan semula berbilang langkah. Ia juga harus menunjukkan cara kaedah membezakan pencarian sasaran yang dilarang daripada perolehan sah pengetahuan tersimpan berkaitan, kerana perbezaan itu akan menentukan sama ada pendekatan itu praktikal. Reka bentuk penilaian akan menjadi penting seperti hasil tajuk: ujian sempit mungkin menunjukkan bahawa respons tertentu disekat tanpa menunjukkan bahawa maklumat asas tidak boleh dicapai melalui laluan lain. Takrifan yang jelas akan menjadikan keseimbangan yang dilaporkan antara lupa dan utiliti lebih mudah untuk ditafsirkan.

Replikasi akan menjadi penting kerana eksperimen yang dilaporkan menggunakan RWKU dan MUSE serta persekitaran tambahan alat simulasi. Pembaca harus mencari ujian dengan jenis alat yang berbeza, sistem perolehan semula, pangkalan data dan keluarga model, bersama-sama dengan penilaian yang dijalankan di luar persediaan latihan pengarang. Abstrak tidak menyatakan sama ada kod, persekitaran atau model terlatih tersedia, jadi kebolehulangan tidak diketahui pada masa ini. Ujian bebas juga akan membantu menentukan sama ada kaedah bergantung pada cara tertentu alat simulasi mendedahkan maklumat atau sama ada kekangannya kekal berkesan apabila sistem sekeliling dikonfigurasikan secara berbeza. Tanpa perbandingan itu, keumuman pendekatan itu kekal sebagai persoalan terbuka.

Penilaian masa depan harus mengukur kedua-dua keselamatan dan utiliti berbanding trajektori ejen yang lebih panjang. Sistem yang menyekat kebocoran langsung dalam ujian pendek mungkin berkelakuan berbeza apabila ia boleh merancang, mencuba semula, memanggil beberapa alat atau menggabungkan pemerhatian separa. Sumber itu juga membuka peluang sama ada Agentic Tool Unlearning boleh menangani maklumat yang disalin ke dalam indeks alat atau pangkalan data sendiri, dan sama ada ia boleh digunakan untuk ejen yang digunakan tanpa melatih semula sistem sekeliling mereka. Soalan-soalan ini menghubungkan prosedur peringkat model kepada persekitaran yang lebih luas di mana pemulihan boleh berlaku. Mereka juga menunjukkan mengapa demonstrasi yang berjaya perlu memeriksa kedua-dua perkara yang ejen enggan dedahkan dan maklumat berguna yang terus diperolehinya.

Panduan & kuiz berkaitan

Ejen AIChatGPT & LLMModel AI DiterangkanEtika AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak peraturan AI
Adakah ini berguna?