Kembali ke Berita
KeamananAI Understanding pengarahan

Paper memperingatkan bahwa agen LLM dapat memulihkan pengetahuan yang terhapus melalui alat

Makalah arXiv baru mengidentifikasi kesenjangan dalam pelepasan pembelajaran LLM: agen mungkin berhenti mengingat informasi dari bobotnya tetapi memulihkannya melalui pencarian web, pengambilan, atau alat basis data. Para penulis mengusulkan metode dua tahap untuk mengurangi kedua bentuk pemulihan sambil mempertahankan penggunaan alat yang sah.

5 min readRead the primary source
Primary-source image accompanying Paper warns that LLM agents can recover deleted knowledge through tools
Dokumen sumber utamaSumber direkam
Penerbit
arxiv.org
Tautan sumber
arxiv.orghttps://arxiv.org/abs/2608.21544
Jenis sumber
Dokumen primer — pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

Model Bahasa Besar (LLM)
Model bahasa yang dilatih pada corpora teks besar untuk menghasilkan dan menganalisis teks.
Pembelajaran Penguatan
Pelatihan dengan imbalan memberi sinyal saat agen mempelajari tindakan yang memaksimalkan keuntungan jangka panjang.
Memori (Memori Agen)
Konteks tersimpan yang digunakan agen AI di seluruh langkah atau sesi untuk meningkatkan kontinuitas.
Uji diri Anda sendiriKuis Agen AI

Apa yang terjadi

Makalah arXiv memperkenalkan Agentic Tool Unlearning, sebuah kerangka kerja yang dirancang untuk agen model bahasa yang dapat memanggil alat eksternal. Para penulis berpendapat bahwa penghentian pembelajaran konvensional dapat menekan penarikan kembali informasi secara langsung oleh model tanpa mencegah agen memulihkan informasi yang sama melalui penelusuran web, pengambilan, atau pencarian basis data.

Makalah ini menjelaskan mode kegagalan yang disebut pemulihan yang dimediasi alat. Dalam model bahasa konvensional, unlearning biasanya dievaluasi dengan menguji apakah model masih dapat mengingat target yang ditentukan secara langsung dari parameternya. Penulis berpendapat bahwa evaluasi ini tidak lengkap untuk agen yang jawabannya bergantung pada panggilan alat dan pengamatan eksternal. Agen seperti itu mungkin gagal menyatakan target dari memori tetapi mengambil informasi yang sama melalui sumber eksternal. Pembedaan ini penting karena jawaban yang dapat diamati tetap tersedia meskipun respons internal model telah berubah. Dalam situasi tersebut, mengevaluasi model tanpa mengevaluasi tindakannya mungkin akan kehilangan arah untuk memulihkan target.

Metode yang diusulkan, Agentic Tool Unlearning, memiliki dua tahap. Pertama, sistem menerapkan pelepasan pengetahuan parametrik yang dimaksudkan untuk menekan ingatan langsung. Kedua, ia menggunakan pembelajaran penguatan tingkat lintasan dalam lingkungan simulasi yang dilengkapi alat. Berdasarkan abstrak makalah, tahap ini memberikan sanksi pada perilaku alat pencari target dan kebocoran pada jawaban akhir. Tujuannya adalah untuk mengurangi pemulihan melalui tindakan agen, bukan hanya melalui perubahan bobot model. Hal ini menjadikan rangkaian keputusan agen sebagai bagian dari masalah yang tidak dapat dipelajari, termasuk pilihan untuk mencari informasi dan cara materi yang diambil dimasukkan ke dalam respons.

Para penulis melaporkan eksperimen pada tolok ukur pelepasan pembelajaran RWKU dan MUSE di berbagai arsitektur model bahasa. Mereka mengatakan metode ini mencapai keseimbangan yang lebih baik antara melupakan target yang ditentukan dan mempertahankan kegunaan normal dari pengetahuan yang seharusnya tetap tersedia. Sumber yang disediakan tidak memberikan hasil numerik, nama model, biaya pelatihan, perbandingan dasar atau rincian alat yang disimulasikan, sehingga kekuatan dan cakupan perbaikan yang dilaporkan tidak dapat dinilai dari abstrak saja. Kelalaian tersebut menjadikan hasil lebih baik dipahami sebagai proposal penelitian dengan eksperimen yang dilaporkan, bukan sebagai bukti bahwa pendekatan tersebut telah divalidasi di seluruh sistem yang diterapkan.

Detail sumber: arxiv.org ↗

Mengapa itu penting

Makalah ini menyoroti masalah keamanan dan privasi praktis untuk sistem yang menggabungkan model bahasa dengan alat eksternal. Menghapus pengetahuan dari parameter model mungkin tidak cukup jika agen masih dapat menemukan atau merekonstruksi target melalui alat di sekitarnya.

Temuan ini penting karena akses alat mengubah arti sistem AI jika melupakan sesuatu. Sebuah model mungkin tidak lagi menyandikan atau mereproduksi sepotong informasi secara langsung, namun agen yang lengkap masih dapat memproduksinya dengan mencari, mengambil, atau menanyakan database yang terhubung. Untuk sistem yang menangani informasi pribadi, hak milik, atau informasi terbatas, unit evaluasi yang relevan mungkin merupakan alur kerja agen secara penuh, bukan model yang terisolasi. Pandangan yang lebih luas ini mengikuti informasi melalui seluruh jalur yang dapat menghasilkan jawaban, daripada memperlakukan parameter model sebagai satu-satunya sumber yang mungkin.

Perbedaan ini juga mempunyai implikasi terhadap cara organisasi menafsirkan klaim penghapusan atau penghapusan. Jika permintaan dimaksudkan untuk mencegah agen menghasilkan target tertentu, memodifikasi parameter model saja dapat membuat rute alternatif tetap terbuka. Makalah ini tidak menetapkan bahwa sistem apa pun yang diterapkan saat ini gagal dalam hal ini, namun makalah ini menawarkan kerangka evaluasi konkrit untuk menguji apakah alat agen melemahkan prosedur yang tidak dipelajari. Kerangka tersebut dapat membantu memisahkan perubahan pada apa yang diingat model dari perubahan pada apa yang masih dapat diperoleh oleh sistem rakitan. Hal ini juga menjaga cakupan klaim penghapusan tetap terikat pada perilaku yang benar-benar dapat diamati oleh pengguna.

Ada trade-off rekayasa yang sulit dalam tujuan yang diusulkan. Penggunaan alat sering kali diperlukan bagi agen untuk menjawab pertanyaan tentang informasi yang seharusnya disimpannya. Menghukum terlalu banyak pencarian alat dapat merusak perilaku yang berguna, sementara memberikan hukuman yang terlalu sedikit dapat membuat target yang terlupakan dapat dipulihkan. Tujuan yang dinyatakan dalam makalah ini adalah untuk melestarikan pengetahuan yang tersimpan membuat trade-off ini terlihat jelas, namun sumbernya tidak menunjukkan seberapa baik pendekatan tersebut menangani permintaan yang ambigu, pertanyaan tidak langsung, atau alat yang berisi informasi yang tumpang tindih. Oleh karena itu, metode yang berguna harus membatasi rute yang tidak diinginkan sambil terus mendukung penggunaan alat yang tetap sah, suatu keseimbangan yang tidak dapat disimpulkan dari abstrak saja.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Pemeriksaan Konsep Interaktif+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Apa yang harus ditonton selanjutnya

Pertanyaan utamanya adalah apakah metode yang dilaporkan dapat digeneralisasikan melampaui lingkungan dan tolok ukur yang disimulasikan dalam makalah ini. Diperlukan lebih banyak rincian mengenai informasi target, konfigurasi alat, arsitektur model, trade-off yang terukur, dan apakah pendekatan tersebut dapat diandalkan tanpa mengganggu penggunaan alat yang sah.

Makalah lengkap harus menjelaskan apa yang dianggap berhasil melupakan. Perincian penting mencakup apakah evaluasi hanya memeriksa reproduksi target yang tepat atau juga parafrase, jawaban tidak langsung, dan rekonstruksi multi-langkah. Hal ini juga harus menunjukkan bagaimana metode ini membedakan pencarian target yang dilarang dengan pengambilan kembali pengetahuan terkait yang sah, karena perbedaan tersebut akan menentukan apakah pendekatan tersebut praktis. Rancangan evaluasi akan sama pentingnya dengan hasil utama: pengujian yang sempit mungkin menunjukkan bahwa respons tertentu diblokir tanpa menunjukkan bahwa informasi mendasar tidak dapat dicapai melalui jalur lain. Definisi yang jelas akan membuat keseimbangan antara kelupaan dan kegunaan lebih mudah untuk ditafsirkan.

Replikasi akan menjadi penting karena eksperimen yang dilaporkan menggunakan RWKU dan MUSE serta lingkungan yang dilengkapi alat simulasi. Pembaca harus mencari pengujian dengan jenis alat, sistem pengambilan, database, dan kelompok model yang berbeda, serta evaluasi yang dilakukan di luar pengaturan pelatihan penulis. Abstrak tidak menyebutkan apakah kode, lingkungan, atau model terlatih tersedia, sehingga reproduktifitasnya saat ini tidak diketahui. Pengujian independen juga akan membantu menentukan apakah metode tersebut bergantung pada cara tertentu alat yang disimulasikan memaparkan informasi atau apakah batasannya tetap efektif ketika sistem di sekitarnya dikonfigurasi secara berbeda. Tanpa perbandingan tersebut, keumuman pendekatan ini masih menjadi pertanyaan terbuka.

Penilaian di masa depan harus mengukur keamanan dan utilitas pada lintasan agen yang lebih panjang. Sebuah sistem yang memblokir kebocoran langsung dalam pengujian singkat mungkin berperilaku berbeda ketika sistem tersebut dapat merencanakan, mencoba ulang, memanggil beberapa alat, atau menggabungkan observasi parsial. Sumber tersebut juga tidak mengetahui apakah Agentic Tool Unlearning dapat menangani informasi yang disalin ke dalam indeks alat atau database itu sendiri, dan apakah itu dapat diterapkan pada agen yang diterapkan tanpa melatih ulang sistem di sekitarnya. Pertanyaan-pertanyaan ini menghubungkan prosedur tingkat model dengan lingkungan yang lebih luas di mana pemulihan dapat terjadi. Mereka juga menunjukkan mengapa demonstrasi yang berhasil perlu memeriksa apa yang tidak diungkapkan oleh agen dan informasi berguna apa yang terus diperolehnya.

Panduan & kuis terkait

Agen AIChatGPT & LLMModel AI DijelaskanEtika AIUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak regulasi AI
Apakah ini berguna?