言語AIガイド

エンコーダ/デコーダのアーキテクチャ

エンコーダ/デコーダ アーキテクチャは、モデルを 2 つの部分に分割します。1 つは入力を読み取って豊富な内部表現に圧縮し、もう 1 つはそこから出力を生成します。

2分の読書最終更新日

概要

This design powers translation, summarization, and any task where the input and output are different sequences.

ディープダイブ

エンコーダ/デコーダ モデルは、問題を 2 段階で処理します。エンコーダーは入力シーケンス全体 (英語の文など) を読み取り、それを意味を捉える文脈ベクトルのセットに変換します。次に、デコーダは、自身の以前の出力とエンコーダの表現を振り返りながら、出力シーケンス (たとえばフランス語) を一度に 1 トークンずつ生成します。オリジナルの 2017 Transformer は、翻訳用に構築されたエンコーダー/デコーダーでした。 T5 や BART などのモデルはこの形状を使用し、すべてのタスクをテキスト入力、テキスト出力としてフレーム化します。エンコーダは入力全体を一度に確認でき (双方向コンテキスト)、デコーダは左から右へ生成するため、分割は強力です。これにより、出力の長さと内容が入力と異なるシーケンス間の問題に自然に適合する設計になります。

技術的な洞察

エンコーダーは双方向のセルフアテンションを使用するため、すべての入力トークンが同時に他のすべてのトークンに対応します。デコーダは自己回帰的であり、マスクされた自己注意を使用します。つまり、因果関係の生成を保存するために、各位置は以前の位置のみを見ることができます。それらを接続することはクロスアテンションです。デコーダー層はエンコーダーの最終的な隠れ状態をクエリします。この分離により、エンコーダーは順序に依存しない完全な理解を構築できる一方、デコーダーは一度に 1 つのトークンにコミットします。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

エンコーダ/デコーダ アーキテクチャの未来

GPT のようなデコーダー専用モデルは、単一スタックで簡単に拡張でき、プロンプト経由で多くのタスクを処理できるため、現在汎用チャットの主流となっています。しかし、音声認識 (Whisper)、文書要約、ビジョン エンコーダとテキスト デコーダを組み合わせたマルチモーダル システムなど、入力の理解と出力の生成が真に異なる場合には、エンコーダとデコーダの設計が存続します。特にモデルがテキスト、オーディオ、画像を融合する場合、デコーダの柔軟性を維持しながら、検索とグラウンディングのためにエンコーダの双方向の理解を借用するハイブリッド アーキテクチャが期待されます。

現実世界の実装

Google Translate と DeepL は、エンコーダー/デコーダー トランスフォーマーを使用して、ある言語の文を別の言語にマッピングします。

OpenAI の Whisper はオーディオ スペクトログラムをエンコードし、それを転写または翻訳されたテキストにデコードします。

T5 と BART は抽象的な要約を強化し、長い記事を短い要約に凝縮します。

画像キャプション システムは、ビジョン エンコーダーとテキスト デコーダーを組み合わせて、写真を言葉で説明します。

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Encoder-Decoder Architectures quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

クロスエンコーダーとバイエンコーダー

よくある質問

What is Encoder-Decoder Architectures?

エンコーダ/デコーダ アーキテクチャは、モデルを 2 つの部分に分割します。1 つは入力を読み取って豊富な内部表現に圧縮し、もう 1 つはそこから出力を生成します。この設計は、翻訳、要約、および入力と出力が異なるシーケンスであるあらゆるタスクを強化します。

エンコーダ/デコーダ モデルにおけるエンコーダの主な仕事は何ですか?

エンコーダーは入力シーケンス全体を消費し、その意味を捉えたコンテキスト ベクトルを生成し、デコーダーはそれを使用します。

なぜデコーダはマスクされた (因果的な) 自己注意を使用するのでしょうか?

マスキングにより、各出力位置が以前の位置のみに対応し、左から右への自己回帰生成順序が維持されます。

デコーダとエンコーダの表現を接続するメカニズムは何ですか?

クロスアテンションにより、各デコーダ層がエンコーダの隠れ状態をクエリできるようになり、入力の理解と出力の生成がリンクされます。

次のモデルのうち、エンコーダ/デコーダ (シーケンスツーシーケンス) アーキテクチャはどれですか?

T5 (および BART) は、タスクをテキストからテキストとしてフレーム化する古典的なエンコーダー/デコーダー モデルです。 BERT はエンコーダのみ、GPT-3 はデコーダのみです。

エンコーダとデコーダの設計が翻訳に自然に適合するのはなぜですか?

変換では、あるシーケンスを別のシーケンスにマッピングするため、ソース全体 (エンコーダー) の読み取りと新しいターゲット (デコーダー) の生成が完全に適合します。