何が起こったのか
Anthropic は Claude を 8 月 7 日に更新し、ほぼすべての生物学クエリを生物学的能力の低いモデルに再ルーティングしていた分類器を絞り込みました。
分類子がリクエストにフラグを立てると、Anthropic がそのリクエストを Fable 5 から Opus 5 にルーティングします。同社によれば、Opus 5 は一般的な使用には依然として対応していますが、高度な生物学に関する操作上の支援が少なく、有害な作業を追求する人にとってシステムの価値が低下しています。
Anthropic によると、分類器の構成を書き換え、内部および外部の専門家からのフィードバックを収集し、新しいトレーニング データを作成し、分類器を再トレーニングし、依然として一般的に有害な二重用途の研究リクエストに対してトリガーされることを確認したと述べています。同社のテストでは、このアップデートにより、製品全体で生物学関連のフォールバックが約 85% 減少しました。
この変更は、意図的に保守的な立ち上げ姿勢に従って行われます。 Anthropic 氏によると、Fable 5 は当初、ほぼすべての生物学に関するリクエストを Opus 5 にルーティングしていました。これは、同社が健康や教育に関する良性の質問がどこで検出されているかを学習する一方で、広い安全境界線を優先したためでした。 8 月のアップデートでは、モデルの基礎となる生物学的機能を変更するのではなく、別の分類子を通じてその境界を狭めています。そのため、このリリースはポリシーと方針の変更であり、Fable 5 が臨床的に検証された生物学アシスタントになったことを示すものではありません。
この変更は、Fable 5 が日常の健康、臨床、教育に関するより多くの質問に答えられるようにすることを目的としています。 Anthropic によれば、ウイルス学、毒物学、分子設計などの二重用途分野では通常のアクセスが依然としてフォールバックされているため、専門的な生物学研究や医薬品開発にはそのパスを通じてモデルをまだ利用できません。
ソースの詳細: Anthropic's Fable 5 biology safeguards announcement ↗
なぜそれが重要なのか
このアップデートは、広範なアクセスと広範な拒否のどちらかを単に選択することなく、フロンティアモデルの保護手段をより正確にできるかどうかを試す実践的なテストです。
粗いフィルターを使用すると、リスクをすぐに軽減できますが、機密性の高い研究と同じ専門用語を使用した質問をする学生、患者、教育者、医療専門家がブロックされる可能性もあります。 Anthropic は、Fable 5 をリリースしたときにその保守的な出発点を選択し、その後、より詳細なポリシーと新しいトレーニング サンプルを使用して、無害なリクエストの境界を移動しました。
生物学はフォールバックの原因の 1 つにすぎないため、ユーザー エクスペリエンスの変化は製品によって異なります。 Anthropic は、あらゆる種類のフォールバックの合計が、Claude.ai で約 67%、Cowork で 55%、Claude コードで 17%、Claude プラットフォームで 7% 減少すると推定しています。これらは企業の測定値であり、独立した監査結果ではありません。
メカニズムも重要です。フラグが設定されたリクエストは、Fable 5 によって応答されるのではなく、再ルーティングされます。これにより、Anthropic が最も懸念すると考える機能を保留しながら、一般モデルへのアクセスが維持されますが、許可されるすべての健康に関する回答が正確であるか、臨床上の決定に適切であるかは確立されません。
組織にとって実際的な問題は、境界がコンテキスト間でどのように動作するかということです。平易な言葉での説明を求める学生、専門用語を確認する臨床医、実験プロトコールを要求する研究者は、まったく異なるリスクを提示しながら重複する言葉を使用する可能性があります。 Anthropic のルーティング アプローチでは、最初の 2 つのケースに対してより安全な一般的な回答を保存できますが、これは分類子が意図、会話履歴、および要求された操作の詳細を認識し、正当な専門的なワークフローを不透明な拒否に変えることなく場合に限ります。
インタラクティブなメカニズム: 実際にどのように機能するか
この開発の背後にある基盤となるテクノロジーをインタラクティブに探索します。
crm_get_transaction(id='4092').What is 'specification gaming' in AI systems?
次に見るべきもの
フォールバック率の低下は、本当に危険なリクエストの強力な検出と、信頼できる研究アクセスのための明確なルールによって一致するという証拠に注目してください。
Anthropic は、この発表では評価セット、偽陰性率、または独立した複製を公開していません。同社によれば、誤検知は残り、分類器はジェイルブレイクの試みにも耐える必要があるため、85% という数字は完全な安全性のトレードオフではなく、フォールバックの減少を意味します。
次の有用な開示では、言い換え、言語、マルチターン会話、ツール対応ワークフローにわたるパフォーマンスが示される予定です。研究者はまた、有害なリクエストが新しい境界を越える頻度と、新しいバイパスが現れたときに分類子がどのくらいの速さで更新されるかを知る必要もあります。
Anthropic は、フロンティア生物学機能のための信頼されたアクセス経路を開発していると述べています。彼らの信頼性は、誰が資格を得るのか、どのような監視とプライバシー保護が適用されるのか、インシデントがどのようにレビューされるのか、正当な研究者が誤った制限に異議を申し立てられるかどうかによって決まります。
次の開示では、分類器が展開後にどのように評価されるかについても説明する必要があります。フォールバック率を下げるには、誤検知を減らすか、困難なケースを別のモデルに移行するか、より有害なリクエストを見逃すことによって達成できます。それらの結果は安全上の意味が大きく異なります。有用なレポートには、リクエスト タイプ別の偽陽性と偽陰性の推定、複数ターンのエスカレーションと言い換えでのパフォーマンス、言語範囲、ツール呼び出しの処理、ジェイルブレイクまたはインシデント後の境界更新プロセスなどが含まれます。
ユーザー向けの約束は、安全境界と同じ注意を払ってテストする必要があります。 Anthropic は、このアップデートは日常の健康、臨床、教育上の疑問に役立つはずだと述べていますが、フォールバック率が低いということは、医学的な正確さ、適切なトリアージ、または専門的な判断への適合性を確立するものではありません。独立したレビュー担当者は、サポートされていない確実性、安全上のアドバイスの欠如、有害な手順の詳細について許可された回答をサンプリングすると同時に、フォールバック モデルがその限界を明確に伝えているかどうかを確認する必要があります。最も強力な証拠は、分類子の変更前後で一致するリクエストを比較し、外部の研究者が利益と新しい障害モードの両方を理解できるように十分な匿名化された例を公開することです。
同じ分類子の境界には、製品ごとに異なるツール、コンテキスト ウィンドウ、およびユーザーの期待が含まれる可能性があるため、その証拠は消費者チャット、コーディング、エージェント ワークフロー、および API について個別に報告される必要があります。単一のフォールバック パーセンテージをブレンドすると、あるサーフェスの意味のある後退が別のサーフェスの改善の陰に隠れてしまう可能性があります。分母、信頼区間、製品レベルのカウントを公開すると、見出しの 1 つの数値を比較する読者だけでなく、教育者、臨床医、開発者、安全性研究者にとって結果が役立つでしょう。