マスクされた言語モデリング
マスクされた言語モデリングは、左右両方の周囲のコンテキスト全体を使用して、意図的に隠された単語を埋めるように AI に学習させます。
概要
It's the training trick behind BERT and the reason models can deeply understand sentence meaning rather than just predict what comes next.
ディープダイブ
マスク言語モデリング (MLM) では、文を取得し、そのトークンの約 15% を特別な [MASK] シンボルでランダムに隠し、元の文を推測するようにモデルをトレーニングします。モデルは各空白の両側の単語を認識するため、コンテキストの双方向の理解を構築します。 2018 年に Google によって導入された BERT がこれを普及させました。巧妙な詳細: マスクされた位置のうち、およそ 80% が [MASK] になり、10% がランダムな単語と交換され、10% は変更されません。これにより、モデルが予測時に [MASK] トークンのみを期待することがなくなり、堅牢性が強制されます。この事前トレーニングの後、モデルは、分類、質問応答、固有表現認識などのタスクに合わせて微調整されます。
技術的な洞察
MLM は双方向のセルフアテンションを備えた Transformer エンコーダを使用するため、すべてのトークンが他のすべてのトークンに同時に対応します。損失は、真のトークン ID に対するクロスエントロピーを使用して、マスクされた位置でのみ計算されます。注意は非因果的であるため (将来のマスキングがない)、各単語の表現は左右のコンテキストを 1 つの密なベクトルに融合します。この双方向性は、まさにネクスト トークン モデルが生成機能を放棄するものです。
戦略的影響
速度とスケール
言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。
アクセスと到達範囲
言語やコミュニケーション スタイルを超えてアクセスが拡張されます。
より明確な判決
自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。
マスクされた言語モデリングの将来
純粋な MLM は、チャットボットの生成デコーダー モデルによって部分的に影を潜められていますが、理解が生成に勝る埋め込み、検索、分類では依然として優勢です。 RoBERTa、ELECTRA の置換トークン検出、DeBERTa などの亜種は、精度と効率性を高め続けています。 MLM スタイルのエンコーダは、自由形式のテキストよりも高速で深い理解が重要となる、大規模な検索拡張型マルチモーダル システム内の軽量コンポーネントとして、検索や意味論的な類似性の中心となることが期待されます。
現実世界の実装
Google Search の BERT ベースの会話クエリの理解を強化し、より関連性の高いページを返します。
セマンティック検索およびドキュメント検索システム用の文埋め込みの生成。
製品レビューまたはサポート チケットのセンチメント分析のための BERT の微調整。
法律または医学文書から人物、組織、日付を抽出する固有表現認識。
リスクとガードレール
幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。
迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。
アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。
実装ロードマップ
展開する前に、出力形式、トーン、品質基準を定義します。
正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。
一か八かの成果物については人間によるレビュー チェックポイントを維持します。
失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Language Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
言語モデリング
よくある質問
What is Masked Language Modeling?
マスクされた言語モデリングは、左右両方の周囲のコンテキスト全体を使用して、意図的に隠された単語を埋めるように AI に学習させます。これは BERT の背後にあるトレーニングのトリックであり、モデルが単に次に何が起こるかを予測するのではなく、文の意味を深く理解できる理由です。
マスクされた言語モデリングにおける中心的なトレーニング タスクは何ですか?
MLM はトークンの一部を非表示にし、左右のコンテキストの両方を使用してトークンを回復するようにモデルをトレーニングします。
BERT は通常、事前トレーニング中にトークンのおよそ何パーセントをマスクしますか?
BERT は入力トークンの約 15% をマスクします。これは、十分なシグナルの提供と十分なコンテキストの残すこととの間のバランスです。
MLM がモデルに双方向の理解を与えるのはなぜですか?
Transformer エンコーダは非因果的自己注意を使用するため、すべてのトークンが両側の他のすべてのトークンを認識できます。
BERT のマスキング スキームでは、選択された位置の約 10% が [MASK] にならずにどうなりますか?
堅牢性を向上させるために、マスクされた位置の 10% がランダムなトークンと交換され、10% は変更されません。
MLM 損失はどのポジションで計算されますか?
クロスエントロピー損失はマスクされた位置にのみ適用され、予測を元のトークン ID と比較します。