社会ガイド

モデルの抽出と盗用攻撃

モデル抽出攻撃では、攻撃者はパブリック API にクエリを実行し、その答えに基づいてコピーキャットをトレーニングするだけで、独自の AI モデルのクローンを作成できます。

2分の読書最終更新日

概要

It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.

ディープダイブ

モデル抽出 (またはモデル盗用) 攻撃は、デプロイされたモデルをオラクルとして扱います。攻撃者は入力を送信し、出力を記録し、動作を模倣する代替モデルをトレーニングします。ターゲット モデル自体は入力を出力にマッピングする学習された関数であるため、十分な入出力ペアをコピーすると、元の重みやトレーニング データを見なくても、近似値を再構築できます。研究者たちは画像分類器の決定境界を盗み、小さなレイヤーの正確な重みさえも回復しました。 2024 年に、チームは、OpenAI および Google 本番モデルの埋め込みレイヤーの一部が数百ドル未満で抽出できることを示しました。コピーが盗まれると、有料サービスが侵害され、安全フィルターがバイパスされ、敵対的な例を作成するなどのさらなるホワイトボックス攻撃が可能になります。

技術的な洞察

API 応答が豊富であればあるほど、盗難は安くなります。完全な確率ベクトルまたはロジットを返すと、単一の上位 1 ラベルよりもクエリごとにはるかに多くの情報が漏洩するため、攻撃者はより少ないクエリで境界を再構築します。アクティブ ラーニング戦略は、意思決定境界付近で最も有益なクエリを選択します。画期的な結果は、出力次元数をクエリすると、最終的な線形射影層を線形代数によって正確に復元できることを示しました。これは、その層が事実上、応答範囲にまたがる行列であるためです。

戦略的影響

リスクと安全性

AI による壊滅的な被害も日常的な被害も、誰がリスクを理解し、誰が行動できるかにかかっています。

より明確な判決

国民と専門家のリテラシーは、強力な安全政策が政治的に可能かどうかを左右します。

誇大広告を打ち破る

明確な説明は、誇大広告、研究室の PR、曖昧な倫理劇場に囚われることを減らします。

モデル抽出と窃盗攻撃の将来

防御はブロックから検出と劣化へと移行しており、レート制限、丸められた出力またはトップ 1 のみの出力の返し、調整されたノイズの追加、盗まれたコピーのフィンガープリントを可能にするモデルの動作の透かし入れ、抽出署名のクエリ パターンの監視などです。抽出を窃盗として扱う規制およびライセンス条項に加え、抽出が困難であることが証明されているアーキテクチャに関する積極的な研究が期待されます。モデルが大きくなるにつれて、完全な抽出には依然としてコストがかかりますが、貴重なコンポーネントの部分的な抽出と蒸留スタイルのクローン作成は、商業的およびセキュリティ上の永続的な脅威であり続けます。

現実世界の実装

あるスタートアップ企業は、競合他社の有料画像認識 API に何千回もクエリを実行し、その精度を再現する無料のクローンをトレーニングします。

セキュリティ研究者は、わずか数百ドルの費用で慎重に作成された API クエリを使用して、運用言語モデルの最後の埋め込み投影層を抽出します。

攻撃者は、スパムまたは不正分類子のクローンをローカルに作成して、オフラインで調査し、検出を確実に回避する入力を作成できるようにします。

クラウド ベンダーは、アクセス パターンがアクティブ ラーニング抽出に一致するアカウントにフラグを立て、その応答を抑制するクエリ レート モニタリングを追加しました。

リスクとガードレール

能力が複雑になる一方で、実存的なリスクを SF として扱います。

高度な自律性の下での調整による表面製品の安全性を混乱させる。

英語以外や専門家ではない聴衆には、低品質の情報源しか提供されません。

実装ロードマップ

1

製品の危害、誤使用、制御不能/調整不良のリスクを分離します。

2

どのような証拠がタイムラインと重大度についてのあなたの見方を変えるかを尋ねてください。

3

マーケティング上の主張よりも、一次情報源と具体的な評価を優先します。

4

意識だけでなく、キャリア、政策、資金、スキルなど、行動経路を 1 つ特定します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Extraction and Stealing Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

メンバーシップ推論攻撃

よくある質問

What is Model Extraction and Stealing Attacks?

モデル抽出攻撃では、攻撃者はパブリック API にクエリを実行し、その答えに基づいてコピーキャットをトレーニングするだけで、独自の AI モデルのクローンを作成できます。企業はモデルのトレーニングに数百万ドルを費やしており、その費用は数千回の API 呼び出しに相当すると見積もることができるため、これは重要です。

モデル抽出攻撃の背後にある中心的なアイデアは何ですか?

抽出では、デプロイされたモデルがオラクルとして扱われます。攻撃者は、元の重みにアクセスすることなく、入力と出力のペアを収集し、その動作を模倣するコピーキャット モデルをトレーニングします。

完全な確率ベクトルを返すと、上位 1 ラベルのみを返すよりも抽出が簡単になるのはなぜですか?

各完全確率ベクトルは、単一のラベルよりもモデルの内部決定面についてはるかに多くの情報を明らかにするため、攻撃者は少ないクエリで境界を再構築できます。

クエリごとに漏洩する情報を直接的に削減する防御手法はどれですか?

出力を粗くする(たとえば、最上位のラベルのみを返す、または丸められた確率を返す)と、各応答が攻撃者に与えるシグナルが減少し、抽出コストが増加します。

2024 年の結果は、攻撃者が製品言語モデルのどの部分を安価に正確に回復できることを示しましたか?

研究者らは、最終的な線形投影層は、その応答が回復可能な行列にまたがっているため、数百ドルで正確に回復できることを実証しました。

盗まれた代替モデルは、収益の損失だけでなく、なぜ危険なのでしょうか?

攻撃者はローカル コピーを取得すると、それを自由に調査して、敵対的な入力や回避攻撃を設計し、元の展開されたシステムも騙すことができます。