言語AIガイド

XLNet 順列モデリング

XLNet は、ランダムな単語順序でトレーニングすることにより、BERT の双方向コンテキストと GPT の自己回帰予測をブレンドします。

2分の読書最終更新日

概要

This permutation trick lets it learn from all positions without ever masking tokens.

ディープダイブ

カーネギー メロンと Google Brain によって 2019 年に導入された XLNet は、BERT スタイルの事前トレーニングの欠陥を修正するために設計されました。 BERT はトークンをマスクして予測しますが、人為的な [MASK] シンボルは微調整時に決して表示されないため、トレーニングとテストの不一致が生じ、BERT はマスクされたトークンが独立していると想定します。 XLNet は代わりに「順列言語モデリング」を使用します。これは、シーケンス内の単語のすべての可能な順序に対して予想される対数尤度を最大化します。他のトークンのランダムなサブセットを指定して各トークンを予測することにより、モデルはマスキングのない適切な自己回帰モデルを維持しながら、双方向のコンテキストを効果的に認識します。長距離メモリ用の Transformer-XL バックボーン上に構築された XLNet は、質問応答、感情分析、ドキュメントのランキングなど、約 20 のタスクで BERT を上回りました。

技術的な洞察

XLNet は単語を物理的にシャッフルしません。アテンション マスクを介して因数分解の順序を変更するため、位置情報が保存されます。これを機能させるために、「2 つのストリーム セルフ アテンション」を使用します。トークンとそのコンテキストの両方をエンコードするコンテンツ ストリームと、ターゲットの位置は知っているがコンテンツは知らないクエリ ストリームであり、答えを漏らすことなく予測を可能にします。 Transformer-XL の再帰性と相対位置エンコーディングにより、長いセグメントにわたるメモリが提供され、長いドキュメントの処理が向上します。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

XLNet 順列モデリングの将来

XLNet は、自己回帰目標が双方向のコンテキストをキャプチャできることを証明し、BERT と GPT の区別を曖昧にする影響力のある証明となりました。この分野は主にマスクされたエンコーダまたは大規模な自己回帰デコーダを中心に統合されましたが、XLNet の順列アイデアと Transformer-XL の再発は、その後のロングコンテキスト モデリングと統合された事前トレーニング目標の研究に影響を与えました。その洞察は、研究者が強力なコンテキスト モデリングと効率的でマスクなしの生成を組み合わせたアーキテクチャを模索する中で、依然として重要です。

現実世界の実装

SQuAD などの質問応答ベンチマークで最高の結果を達成

Transformer-XL メモリを介した RACE 読解テストなどの長い文書タスクの処理

ドキュメントのランキングおよび情報検索システムを強化する

BERT ベースラインよりもセンチメント分類とテキスト分類を改善

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the XLNet Permutation Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

トピックモデリング

よくある質問

What is XLNet Permutation Modeling?

XLNet は、ランダムな単語順序でトレーニングすることにより、BERT の双方向コンテキストと GPT の自己回帰予測をブレンドします。この順列トリックにより、トークンをマスクすることなくすべての位置から学習することができます。

XLNet はどのような事前トレーニング目標を使用しますか?

XLNet は、置換言語モデリングと呼ばれる、トークン因数分解順序のすべての置換に対して期待される対数尤度を最大化します。

XLNet は特に対処するために設計された BERT のどの弱点ですか?

BERT の人為的な [MASK] シンボルは微調整中に決して表示されず、マスクされた予測を独立したものとして扱います。 XLNet は両方の問題を回避します。

XLNet の 2 つのストリームの自己注意は何を分離するのでしょうか?

コンテンツ ストリームはトークンとコンテキストをエンコードしますが、クエリ ストリームはターゲットの位置は知っていますが、そのコンテンツは知らないため、漏れのない予測が可能になります。

XLNet は文内の単語を物理的にシャッフルしますか?

XLNet は、アテンション マスクを介して予測 (因数分解) 順序を並べ替えます。元のトークンの位置は、位置エンコーディングによって保存されます。

どのアーキテクチャが長距離コンテキストの XLNet のバックボーンとして機能しますか?

XLNet は、長いシーケンスを処理するためのセグメント反復と相対位置エンコーディングを追加する Transformer-XL をベースに構築されています。