ニュースに戻る
セキュリティAI Understanding ブリーフィング

論文は、LLM エージェントがツールを通じて削除された知識を回復できると警告しています

新しい arXiv 論文では、LLM の未学習におけるギャップを特定しています。つまり、エージェントは重みから情報を呼び出すことを停止する可能性がありますが、Web 検索、取得、またはデータベース ツールを通じて情報を回復する可能性があります。著者らは、正当なツールの使用を維持しながら、両方の形式のリカバリを削減する 2 段階の方法を提案しています。

5 min readRead the primary source
Primary-source image accompanying Paper warns that LLM agents can recover deleted knowledge through tools
一次情報源文書記録されたソース
出版社
arxiv.org
ソースリンク
arxiv.orghttps://arxiv.org/abs/2608.21544
ソースの種類
一次文書 — 私たちが直接読む公式発表、論文、提出書類、またはファーストパーティのページ。
コンテキスト60秒で理解できる

ここから始めましょう

重要な用語

大規模言語モデル (LLM)
テキストを生成および分析するために大規模なテキスト コーパスでトレーニングされた言語モデル。
強化学習
報酬によるトレーニングは、エージェントが長期的な利益を最大化するアクションを学習することを示します。
メモリ (エージェントメモリ)
AI エージェントが継続性を向上させるためにステップまたはセッション全体で使用する保存されたコンテキスト。
自分自身をテストしてくださいAI エージェント クイズ

何が起こったのか

arXiv の論文では、外部ツールを呼び出すことができる言語モデル エージェント向けに設計されたフレームワークである Agentic Tool Unlearning が紹介されています。著者らは、従来のアンラーニングでは、エージェントがWeb検索、取得、データベース検索を通じて同じ情報を回復することを妨げずに、モデルによる情報の直接の想起を抑制できる可能性があると主張している。

この論文では、ツールによる回復と呼ばれる障害モードについて説明しています。従来の言語モデルでは、通常、未学習は、モデルがパラメータから指定されたターゲットを直接呼び出すことができるかどうかをテストすることによって評価されます。著者らは、答えがツールの呼び出しや外部の観察に依存する可能性があるエージェントにとって、この評価は不完全であると主張しています。このようなエージェントは、メモリからターゲットを記述するのに失敗する可能性がありますが、外部ソースを通じて同じ情報を取得します。モデルの内部応答が変化した場合でも、観察可能な答えは利用可能なままである可​​能性があるため、この区別は重要です。その設定では、アクションを評価せずにモデルを評価すると、ターゲットが回復されるルートを見逃す可能性があります。

提案された手法である Agentic Tool Unlearning には 2 つの段階があります。まず、システムは直接想起を抑制することを目的としたパラメトリック知識のアンラーニングを適用します。 2 番目に、シミュレートされたツールで強化された環境で軌道レベルの強化学習を使用します。論文の要約によると、この段階では、ターゲット探索ツールの動作と最終的な答えの漏洩の両方にペナルティが課されます。目標は、単にモデルの重みを変更するだけではなく、エージェントのアクションを通じて回復を減らすことです。これにより、情報を探す選択や、取得した内容を応答に組み込む方法など、エージェントの一連の決定が未学習問題の一部になります。

著者らは、さまざまな言語モデル アーキテクチャにわたる RWKU と MUSE の非学習ベンチマークに関する実験を報告しています。彼らは、この方法は、指定されたターゲットを忘れることと、利用可能なままにしておくべき知識の通常の有用性を維持することの間のより良いバランスを達成すると述べています。提供されたソースには、数値結果、モデル名、トレーニング コスト、ベースラインの比較、またはシミュレートされたツールの詳細が提供されていないため、報告された改善の強度と範囲を要約だけから評価することはできません。これらの省略により、結果は、展開されたシステム全体でアプローチが検証されたという証拠としてではなく、報告された実験を伴う研究提案として最もよく理解されることになります。

ソースの詳細: arxiv.org ↗

なぜそれが重要なのか

この論文では、言語モデルと外部ツールを組み合わせたシステムの実際的なセキュリティとプライバシーの問題を強調しています。エージェントが周囲のツールを通じてターゲットを見つけたり再構築したりできる場合、モデル パラメーターから知識を削除するだけでは十分ではない可能性があります。

ツールへのアクセスにより、AI システムが何かを忘れた場合の意味が変わるため、この発見は重要です。モデルは情報の一部を直接エンコードしたり再現したりすることはできませんが、完全なエージェントは接続されたデータベースを検索、取得、またはクエリすることによって情報を生成できます。したがって、個人情報、専有情報、またはその他の制限された情報を扱うシステムの場合、関連する評価単位は、個別のモデルではなく、エージェントのワークフロー全体になる可能性があります。このより広範なビューでは、モデル パラメーターを唯一の可能なソースとして扱うのではなく、答えを生み出すことができるパス全体を通じて情報を追跡します。

この区別は、組織が削除または削除の要求をどのように解釈するかにも影響します。リクエストがエージェントが特定のターゲットを生成するのを防ぐことを目的としている場合、モデル パラメーターのみを変更すると、代替ルートが開いたままになる可能性があります。この論文は、現在導入されているシステムがこのように失敗することを証明していませんが、エージェントのツールが学習解除手順を損なうかどうかをテストするための具体的な評価フレームを提供しています。このフレームは、モデルが呼び出すものの変更と、組み立てられたシステムが引き続き取得できるものの変更を区別するのに役立ちます。また、ユーザーが実際に観察できる動作に関連付けられた削除要求の範囲も維持されます。

提案された目的には、エンジニアリング上の困難なトレードオフがあります。エージェントが保持すべき情報に関する質問に答えるには、ツールの使用が必要になることがよくあります。ツールシークのペナルティが多すぎると、有用な動作が損なわれる可能性がありますが、ペナルティが少なすぎると、忘れられたターゲットが回復可能なままになる可能性があります。保持された知識を保持するというこの論文の目的は、このトレードオフを明確にしていますが、情報源には、このアプローチが曖昧なリクエスト、間接的なクエリ、または重複する情報を含むツールをどの程度うまく処理するかが示されていません。したがって、有用なメソッドは、正当なツールの使用をサポートし続けながら、望ましくないルートを制限する必要があり、そのバランスは要約だけからは推測できません。

Interactive Mechanism

インタラクティブなメカニズム: 実際にどのように機能するか

この開発の背後にある基盤となるテクノロジーをインタラクティブに探索します。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
インタラクティブコンセプトチェック+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

次に見るべきもの

中心的な疑問は、報告された手法が論文のシミュレートされた環境やベンチマークを超えて一般化できるかどうかです。ターゲット情報、ツール構成、モデル アーキテクチャ、測定されたトレードオフ、および正当なツールの使用を中断することなくアプローチが確実に機能するかどうかについて、より詳細な情報が必要です。

完全な論文では、何が成功した忘却とみなされるのかを明らかにする必要があります。重要な詳細には、評価でターゲットの正確な再現のみをチェックするか、言い換え、間接的な回答、および複数ステップの再構成もチェックするかどうかが含まれます。また、この手法が禁止されたターゲット探索と、関連する保持された知識の正当な検索とをどのように区別するかについても示す必要があります。その区別によってアプローチが実用的かどうかが決まるからです。評価設計は見出しの結果と同じくらい重要です。狭い範囲のテストでは、基礎となる情報に別のパスから到達できないことは示されずに、特定の応答がブロックされていることは示される可能性があります。明確な定義により、報告される忘却と効用のバランスが解釈しやすくなります。

報告された実験では RWKU と MUSE、およびシミュレートされたツール拡張環境が使用されているため、レプリケーションは重要です。読者は、さまざまなツール タイプ、検索システム、データベース、モデル ファミリを使用したテスト、および著者のトレーニング設定の外で実施された評価を探す必要があります。要約には、コード、環境、またはトレーニング済みモデルが利用可能かどうかが記載されていないため、再現性は現時点では不明です。独立したテストは、その方法がシミュレートされたツールが情報を公開する特定の方法に依存しているかどうか、または周囲のシステムが異なる構成になっている場合でもその制約が引き続き有効であるかどうかを判断するのにも役立ちます。この比較がなければ、アプローチの一般性は未解決の問題のままになります。

将来の評価では、より長いエージェントの軌跡にわたるセキュリティとユーティリティの両方を測定する必要があります。短いテストで直接の漏洩をブロックするシステムは、計画、再試行、複数のツールの呼び出し、または部分的な観察の組み合わせが可能な場合には、異なる動作をする可能性があります。また、ソースでは、エージェント ツールの学習解除がツール インデックスやデータベース自体にコピーされた情報に対処できるかどうか、また、周囲のシステムを再トレーニングすることなく展開されたエージェントに適用できるかどうかも不明なままになっています。これらの質問は、モデルレベルの手順を、回復が発生する可能性のあるより広範な環境に結び付けます。また、デモンストレーションを成功させるには、エージェントが公開を拒否した内容と、エージェントが取得し続ける有用な情報の両方を調査する必要がある理由も示しています。

関連ガイドとクイズ

AIエージェントChatGPTとLLMAI モデルの説明AI倫理あなたが知っていることをテストする - 無料の AI クイズに挑戦してください用語集で AI 用語を検索するAI 規制トラッカーをフォローする
これは役に立ちましたか?