テクニカルガイド

ネガティブサンプリングとノイズ対比推定

ネガティブ サンプリングとノイズ対比推定 (NCE) は、コストのかかる完全なソフトマックスを計算することなく、モデルが膨大な語彙を学習できるようにするトリックです。

2分の読書最終更新日

概要

Instead of scoring every possible output, they teach the model to tell real (positive) examples from a handful of fake (negative) ones.

ディープダイブ

語彙に数十万の単語が含まれる場合、通常のソフトマックスではトレーニング ステップごとにすべての単語を正規化する必要があり、非常に遅すぎます。ノイズ対比推定は、問題をバイナリ分類として再構成します。ターゲットと、既知の分布から抽出されたいくつかの「ノイズ」サンプルが与えられた場合、真のサンプルとノイズを区別する方法を学習します。これにより、明示的な正規化を行わずに、暗黙的に必要な確率が回復されます。 word2vec のスキップグラム モデルによって普及したネガティブ サンプリングは、単純化されたものです。真 (単語、コンテキスト) ペアごとに、k 個のネガティブをサンプリングし、シグモイド目標を使用して、本物のペアに高いスコアを割り当て、偽のペアに低いスコアを割り当てるようにモデルをトレーニングします。どちらも高価なマルチクラス問題を多くの安価なバイナリ問題に変換し、大規模な埋め込みトレーニングを実用的にします。ノイズ分布 (多くの場合、ユニグラムの 3/4 乗) の選択は、品質に大きな影響を与えます。

技術的な洞察

NCE は、データとノイズを分類することによってモデルを推定します。ノイズ サンプルの数が増加すると、適切に正規化されたソフトマックスで最尤に近似することが証明されます。ネガティブ サンプリングでは、NCE の正規化項が完全に削除され、log σ(ポジティブ スコア) + Σ log σ(−ネガティブ スコア) が最適化されます。これにより、速度は向上しますが、一貫した密度推定器ではなくなりました。校正された確率ではなく、適切な埋め込みを学習するように調整されています。平滑化されたユニグラム分布 (頻度 ^ 0.75) からネガティブをサンプリングすると、一般的な単語と珍しい単語のバランスがとれます。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

ネガティブ サンプリングとノイズ対比推定の将来

核となるアイデア、つまりサンプリングされたネガティブな要素とポジティブな要素を対比させて学習するという考え方は、視覚、言語、推奨事項にわたる現代の自己教師あり対比表現学習を支えています。今後の作業は、ハードネガティブマイニング(ランダムなものではなく有益なネガティブを選択する)、偽ネガティブのバイアス除去、大規模なメモリバンクやバッチ内サンプリングを介してネガティブを安価にスケーリングすることに焦点を当てています。モデルが成長しても、検索や大規模なレコメンダーなど、出力スペースや候補セットが巨大な場合には、効率的にサンプリングされた目的が依然として不可欠です。

現実世界の実装

完全なソフトマックスを使用せずに数十億のトークンから単語埋め込みを学習するネガティブサンプリングを使用した word2vec スキップグラム。

言語モデルは歴史的に NCE を使用して、数十万語の語彙を効率的にトレーニングしていました。

2 タワー埋め込みモデルをトレーニングするためにユーザーが操作しなかった「ネガティブ」アイテムをサンプリングする推奨および検索システム。

エンティティの関係を学習するために負のサンプルを使用したグラフおよびナレッジグラフの埋め込み (トリプルの先頭または末尾の破損など)。

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Negative Sampling and Noise Contrastive Estimation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

オンラインおよびハードネガティブマイニング

よくある質問

What is Negative Sampling and Noise Contrastive Estimation?

ネガティブ サンプリングとノイズ対比推定 (NCE) は、コストのかかる完全なソフトマックスを計算することなく、モデルが膨大な語彙を学習できるようにするトリックです。考えられるすべての出力をスコアリングするのではなく、実際の (肯定的な) 例と少数の偽の (否定的な) 例を区別するようにモデルに教えます。

ネガティブ サンプリングと NCE は主にどのような問題を解決しますか?

どちらの方法も、トレーニングを安価な二値弁別として再構成することで、膨大な語彙の正規化を回避します。

ノイズ対比推定は学習タスクをどのように再構成するのでしょうか?

NCE は、実際のサンプルと既知のノイズ分布から抽出されたサンプルを区別するようにモデルをトレーニングします。

単語埋め込みを学習するためのネガティブ サンプリングを普及させたモデルはどれですか?

ネガティブ サンプリングは、word2vec のスキップグラム バリアントによって導入され、普及しました。

ネガティブ サンプリングは完全な NCE とどのように異なりますか?

ネガティブ サンプリングでは、正規化を削除し、確率的な正確性を優先して速度と適切な埋め込みを行うことにより、NCE を簡素化します。

ユニグラム分布の 3/4 乗からネガ値がサンプリングされることが多いのはなぜですか?

0.75 の指数により頻度分布が平滑化されるため、一般的な単語が優勢にならず、まれな単語も表示されます。