何が起こったのか
2026 年 8 月 14 日の説明で、Anthropic 氏は、将来の Claude モデルは、EU AI 法の透明性ルールを満たすために、Google DeepMind の SynthID-Text のバージョンとして実装された統計透かしを含むテキストを生成すると述べました。この投稿では、この手法とその限界について説明していますが、モデルの名前や開始日、検出器の起動については触れられていません。
Anthropic は、2026 年 8 月 14 日にテキスト透かしが将来の Claude モデルでどのように機能するかを説明する説明を公開しました。同社はこの変更をEU AI法への準拠としている。2026年8月2日現在、EU市場にサービスを提供するプロバイダーはAI生成コンテンツにマークを付ける必要があり、Anthropicは2026年7月にAI生成コンテンツの透明性に関するEU実務規範に署名した約190社の中に含まれていると述べている。この投稿は発表発表ではなくアプローチの文書化である。どのモデルにウォーターマークが搭載されるか、マーキングが開始される日付は明らかにされておらず、今日どの製品にもウォーターマークが搭載されているかどうかについては言及されていません。
このメソッドは、2024 年に Nature に掲載された SynthID-Text、スキーム Google DeepMind のバージョンとして説明されており、この投稿では、Scott Aaronson による 2022 年の提案に遡る一連の設計に位置付けられています。言語モデルは、ほぼ同等に優れた候補の中から部分的にランダムに次の各トークンを選択します。透かしを入れると、その任意のランダム ソースが秘密キーとその前の単語から派生した疑似ランダム ソースに置き換えられるため、後で一連の選択がキーとの一貫性についてテストできるようになります。 Anthropic は、テキストには何も挿入されず、隠し文字はなく、追加のトークンは生成されず、価格と速度は変更されないことを示します。また、透かしには個人を特定する情報はなく、人物、組織、または会話を追跡することはできないとも述べています。
Anthropic は制限について明示的に示しています。検出結果は、Claude がパッセージの生成に関与した可能性のみを推定します。テキストが人間によって書かれたものであることを示すことはできず、異なるキーやまったく異なるメソッドを使用する他の AI システムを識別することもできません。短いサンプルでは検出がうまく機能せず、表現が制限されている場合、マークはまばらになります。つまり、正しい補完、算術演算、およびコードが 1 つある事実に基づく記述であり、投稿では、コード自体への影響は無視でき、ウォーターマークは主にコメント内に存在すると述べられています。人間のテキストを簡単に校正すると、登録できる Claude が選択した単語が少なすぎる可能性があります。完全に書き直すとマークが削除されます。同社によれば、軽い編集はおそらく行われないだろうという。この投稿では、ウォーターマークは出力に対する所有権、著作者、法的責任について何も述べていないとも述べています。
Anthropic は、テキストに加えて、.png、.jpg、.svg などのサポートされている形式で生成されるファイル Claude には C2PA コンテンツ資格情報が含まれると述べています。これは、オープン業界標準の一部であるファイル メタデータ内の暗号的に署名されたメモで、ファイル自体を変更することなく Claude が関与したことを記録します。同社は、透かし検出 API が登場する予定であるが、実装の詳細はまだ検討中であるとし、C2PA 資格情報をチェックするための独自のツールを提供する予定であると述べています。 Anthropic によれば、透かしを地域ごとにスコープする永続的な方法がないため、起動時にグローバルに適用されます。 2026 年 8 月 2 日より前にリリースされた Claude モデルは EU 法の移行期間に該当し、今後数か月間適用される予定です。
なぜそれが重要なのか
キーベースの透かしは、スタイルベースの AI 検出器よりも強力な証拠ですが、それは、あるベンダーのモデルが十分に長いパッセージに触れた可能性が高いかどうかという、狭い質問にしか答えません。否定的な結果は何も証明しません。コード、短いテキスト、および軽く編集された人間の文章など、論争が頻繁に起こる場所では、この技術はまさに最も弱いものになります。
来歴は、学校、裁判所、出版社、雇用、プラットフォームのモデレーションにとって実際的な問題となっており、現在使用されているツールのほとんどは、文体から作者を推測する統計検出器であり、誤検知の問題が十分に文書化されているアプローチです。キーベースの透かしは、別の種類の証拠です。キーを保持している側は、スタイルから推測するのではなく、意図的に配置したパターンをテストします。これは原理的には大きな改善ですが、それは狭い質問にのみ答えます。
非対称性は、懲戒や法的な場面でこれを利用しようとする人にとって重要です。肯定的な結果は、Claude の関与を示唆します。否定的な結果は何も確立しません。テキストが別のモデル、まだ移行期間中の古い Claude モデル、大幅に編集された草稿、またはマークを保持するには短すぎるか制約が多すぎる文章から取得された可能性があるためです。 Anthropic は、ウォーターマークでは「Claude がこれを書いた」と「Claude が大幅に編集したこれ」を区別できないと言っています。検出器の出力を不正行為の証拠として扱う機関は、そのメーカーが確率的であると説明する信号に基づいて構築していることになります。
「品質に影響はない」という主張の背後にある証拠は、名前を挙げる価値がある意味で不均等です。 Anthropic は、未公開の内部テストと、SynthID-Text 論文を引用しています。この論文では、DeepMind は、透かし入りのモデルが Gemini トラフィックの一部にサービスを提供した場合に、親指の評価と親指の評価に統計的に有意な差はなく、管理された並列人間による評価調査でも知覚された差はないと報告しました。これは本物の外部証拠ですが、別の会社のモデルとトラフィックに関するものです。 Claude に関しては、透かし強度、偽陽性率、または最小通過長の測定値は特に公開されていません。
規制の仕組みはヨーロッパ以外にも及んでいます。 Anthropic は、ウォーターマークを地域ごとにスコープすることはまだできないと述べているため、世界中のユーザー向けに出力を変更することで EU の透明性義務が満たされています。実践規範は多くのプロバイダーを拘束するため、他の開発者からも同等のマークが期待され、それぞれが独自のキーとおそらく独自のメソッドを持ちます。これは、検証の状況が断片化していることを示しています。すべてのモデルをカバーする単一の検出器は存在せず、ベンダー制御のエンドポイントを介してチェックが実行され、モデルの実行者によってサンプリングが制御されるオープンウェイト モデルは、スキームのほぼ外側に位置しています。
インタラクティブなメカニズム: 実際にどのように機能するか
この開発の背後にある基盤となるテクノロジーをインタラクティブに探索します。
Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?
次に見るべきもの
これが実際に使用できるかどうかは、未リリースの検出 API によって決定されます。アクセス条件、信頼スコア、誤検知調整、および最小テキスト長はすべて未指定です。また、どのモデルが同梱されるのか、2026 年 8 月以前のモデルはどのくらいの速さで改修されるのか、そして世界的な適用が後に EU に限定されるのかどうかも明らかになっています。
検出 API は、これらのいずれかが使用可能かどうかを判断する部分です。未解決: 誰がアクセスするのか、無料か従量制か、どのような信頼度スコアが返されるか、どのような誤検知率に調整されているか、必要な最小テキスト長はどれくらいか。これらの選択によって、透かしが慎重な法医学的支援となるか、教室や人事調査における鈍器となるかが決まります。 Anthropic にはリリース日が記載されていません。
2番目に、カバレッジ。この投稿では、どの次期モデルにウォーターマークが搭載されるのか、またいつ出荷されるのかについては明らかにされておらず、2026 年 8 月 2 日より前にリリースされた改良モデルについては、今後数か月以内に展開されるとのみ説明されています。それが完了するまで、大量の既存の Claude 出力はマークされないままとなり、どの検出器にも、ダウンストリーム ユーザーが簡単に推論できない盲点が存在することになります。
第三に、堅牢性です。研究者らは、言い換え、クロスモデル変換、トークンレベルの編集を使って透かし入れスキームを繰り返し調査しており、Anthropic 氏自身の説明では、完全な書き換えはマークに反することを認めています。公開された攻撃が予想されます。また、検出 API が存在すると、独立した誤検知分析が行われます。ベンダーの文書ではなく、これらの結果により、信号がどれだけの重みに耐えられるかが確立されます。
最後に、グローバル アプリケーションが狭まるかどうかを観察します。 Anthropic は、地域範囲の評価を継続し、最新情報を共有すると述べています。また、追跡する価値があるのは、他の規範署名者が独自のマークをどのように実装しているか、共有検証レイヤーが出現しているかどうか、コード、短い出力、および軽く編集された人間のテキストに対して適切なマークとしてみなされるものについて EU 規制当局がガイダンスを発行しているかどうかです。これらのケースは、この手法が設計上最も弱いケースです。