基本ガイド

トリプレット損失と計量学習

三重項損失は、埋め込み空間内で似たアイテムを近くに配置し、異なるアイテムを遠くに配置するようにニューラル ネットワークに教えます。

2分の読書最終更新日

概要

It is the foundation behind face recognition, image search, and recommendation systems that need to compare things rather than just classify them.

ディープダイブ

メトリクス学習では、距離が類似性を反映するベクトルであるエンベディングを生成するようにモデルをトレーニングします。トリプレット損失では、アンカー、ポジティブ (アンカーと同じクラス)、ネガティブ (異なるクラス) の 3 つの入力を同時に使用してこれを行います。目的は、少なくとも固定マージンだけアンカーをネガティブよりもポジティブに近づけます。正式には、損失は max(0, d(a,p) - d(a,n) + margin) で、d は通常ユークリッド距離です。 Google の 2015 FaceNet はこのアプローチを普及させ、128 次元の顔の埋め込みを直接学習しました。トレーニングが完了すると、距離を計算して任意の 2 つのアイテムを比較するため、新しい ID について再トレーニングする必要はありません。このオープンセット機能が、メトリクスの学習を強化する検証や検索タスクの分類では簡単に処理できない理由です。

技術的な洞察

マージンが三連符の損失を機能させるものです。これがないと、モデルはすべての埋め込みを簡単に 1 点に折りたたんで、すべての距離がゼロになり、順序付けが無意味になる可能性があります。マージンによりバッファが強制されます。損失がゼロに達する前に、負の値は正の値よりも少なくともマージンが大きくなければなりません。通常、埋め込みは単位超球上で L2 正規化されるため、距離は制限され、比較可能なままになります。マージン (多くの場合約 0.2) を選択すると、クラス間の分離に対してクラスがどの程度緊密にクラスター化されるかがトレードオフになります。

戦略的影響

より明確な判決

これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。

費用と予算

お金や時間を費やす前に、実装に関するより良い質問をすることができます。

チームとワークフロー

共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。

トリプレット損失と計量学習の未来

純粋なトリプレット損失は、ステップごとに多くのペアを比較してより速く収束する、多重類似性、プロキシアンカー損失、および対照損失 (InfoNCE) などのバッチ全体の目標に置き換えられることが増えています。 SimCLR などの自己教師あり手法は、拡張ビューを肯定的なものとして扱うことで、ラベルなしでメトリクス学習が機能することを示しています。ベクトル データベースと検索拡張生成が急増するにつれて、学習された埋め込みが 10 億アイテム規模での意味検索を支えているため、特定のトリプレット定式化が薄れても、類似性としての距離という中心的な考え方がより中心的なものになりつつあります。

現実世界の実装

FaceNet スタイルの顔認証: 電話機とパスポート ゲートは、2 つの顔の埋め込みが距離のしきい値内にあるかどうかを確認することで身元を確認します。

視覚的な製品検索: 電子商取引サイトでは、買い物客が写真をアップロードし、最近傍埋め込み検索によって視覚的に類似した商品を取得できます。

話者検証: 音声アシスタントは音声サンプルを埋め込み、それを登録済みのプロファイルと比較して、誰が話しているのかを確認します。

署名と手書きの検証: 銀行は参照署名とクエリ署名を埋め込み、距離が学習されたマージンを超えた場合に偽造にフラグを立てます。

リスクとガードレール

チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。

ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。

データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。

実装ロードマップ

1

必要な結果を平易な言葉で定義することから始めます。

2

テストする前に、成功指標と失敗条件を 1 つ選択します。

3

洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。

4

トリプレット損失とメトリック学習が役立つ場合と、より単純な方法の方が優れている場合を文書化します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Triplet Loss and Metric Learning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

シャムネットワークとトリプレット損失

よくある質問

What is Triplet Loss and Metric Learning?

三重項損失は、埋め込み空間内で似たアイテムを近くに配置し、異なるアイテムを遠くに配置するようにニューラル ネットワークに教えます。これは、顔認識、画像検索、レコメンデーション システムの背後にある基盤であり、物事を単に分類するのではなく比較する必要があります。

トリプレット損失でトリプレットを構成する 3 つの入力はどれですか?

トリプレットは、アンカー、アンカーのクラスを共有するポジティブ、および異なるクラスのネガティブで構成されます。

なぜトリプレットの損失には証拠金期間が含まれるのでしょうか?

マージンがなければ、モデルはすべてを同じ点にマッピングして、すべての距離をゼロにし、損失を簡単に満たすことができます。余白は本当の分離を強制します。

顔認識の三重項損失を普及させた 2015 年の有名なシステムはどれですか?

Google の FaceNet は、三重項損失を使用してコンパクトな顔の埋め込みを学習し、顔検証のベンチマークを設定しました。

トレーニングされたメトリクス学習モデルは各入力に対して何を出力しますか?

モデルは入力を埋め込みベクトルにマッピングします。次に、埋め込み間の距離を測定してアイテムを比較します。

計量学習が新しい面の追加などの開集合問題に適しているのはなぜですか?

認識は埋め込み距離に基づいているため、埋め込みを保存するだけで新しい ID を登録でき、モデルの再トレーニングは必要ありません。