語言人工智慧指南

編碼器-解碼器架構

編碼器-解碼器架構將模型分為兩半:一半讀取輸入並將其壓縮為豐富的內部表示,另一半產生輸出。

閱讀時間約2分鐘最後更新

概述

This design powers translation, summarization, and any task where the input and output are different sequences.

深入探討

編碼器-解碼器模型分兩個階段處理問題。編碼器讀取整個輸入序列(例如,英語句子)並將其轉換為一組捕獲含義的上下文向量。然後,解碼器一次產生一個標記的輸出序列(例如,法語),同時回顧其先前的輸出和編碼器的表示。最初的 2017 Transformer 是一個專為翻譯而建構的編碼器-解碼器。 T5 和 BART 等模型使用這種形狀並將每個任務框架為文字輸入、文字輸出。這種分割非常強大,因為編碼器可以立即看到整個輸入(雙向上下文),而解碼器則產生從左到右的輸入。這使得該設計非常適合輸出長度和內容與輸入不同的序列到序列問題。

技術洞察

編碼器使用雙向自註意力,因此每個輸入令牌都會同時關注所有其他令牌。解碼器是自回歸的,並使用屏蔽自註意力,這意味著每個位置只能看到較早的位置以保留因果生成。連接它們的是交叉注意力:解碼器層查詢編碼器的最終隱藏狀態。這種分離使編碼器能夠建構完整的、與順序無關的理解,而解碼器一次提交一個令牌。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

編碼器-解碼器架構的未來

像 GPT 這樣的純解碼器模型現在在通用聊天中佔據主導地位,因為單一堆疊可以簡單地擴展並透過提示處理許多任務。但編碼器-解碼器設計仍然存在於輸入理解和輸出生成真正不同的地方:語音識別(Whisper)、文件摘要以及將視覺編碼器與文字解碼器配對的多模態系統。期望混合架構借用編碼器的雙向理解來進行檢索和基礎,同時保持解碼器的靈活性,特別是當模型融合文字、音訊和圖像時。

現實世界的實施

Google Translate 和 DeepL 使用編碼器-解碼器 Transformer 將一種語言的句子對應到另一種語言。

OpenAI 的 Whisper 對音頻頻譜圖進行編碼並將其解碼為轉錄或翻譯的文本。

T5 和 BART 提供抽象摘要功能,將長文章壓縮為短摘要。

圖像字幕系統將視覺編碼器與文字解碼器配對,以文字描述照片。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Encoder-Decoder Architectures quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

交叉編碼器與雙編碼器

常見問題

What is Encoder-Decoder Architectures?

編碼器-解碼器架構將模型分為兩半:一半讀取輸入並將其壓縮為豐富的內部表示,另一半產生輸出。此設計支援翻譯、摘要以及任何輸入和輸出為不同序列的任務。

編碼器-解碼器模型中編碼器的主要工作是什麼?

編碼器消耗整個輸入序列並產生捕獲其含義的上下文向量,然後解碼器使用這些向量。

為什麼解碼器使用屏蔽(因果)自註意力?

掩蔽確保每個輸出位置僅專注於較早的位置,從而保留從左到右的自回歸生成順序。

什麼機制將解碼器連接到編碼器的表示?

交叉注意力讓每個解碼器層查詢編碼器的隱藏狀態,將輸入的理解與輸出的生成連結起來。

下列哪一個模型是編碼器-解碼器(序列到序列)架構?

T5(和 BART)是經典的編碼器-解碼器模型,將任務建構成文字到文字。 BERT 僅用於編碼器,GPT-3 僅用於解碼器。

為什麼編碼器-解碼器設計非常適合翻譯?

翻譯將一個序列映射到另一個序列,因此讀取整個來源(編碼器)並產生新的目標(解碼器)非常適合。