語言人工智慧指南

交叉注意力

交叉注意力是一種讓一個序列查看另一個序列的機制:產生文字的解碼器可以專注於編碼器的輸入表示。

閱讀時間約2分鐘最後更新

概述

It is how models connect what they are producing to what they read, powering translation, captioning, and modern multimodal systems.

深入探討

自註意力使一個序列中的標記相互關聯;交叉注意力讓一個序列從另一個序列中獲取資訊。在 Transformer 解碼器中,每個生成步驟都會從部分產生的輸出中形成查詢,而鍵和值來自編碼器的輸出。此模型計算每個輸入元素與目前輸出位置的相關程度,並引入輸入資訊的加權混合。這就是讓翻譯解碼器在寫入每個目標單字時專注於正確的來源單字的原因。除了文字之外,交叉注意力是多模態模型中的黏合劑:文字解碼器可以專注於圖像區塊特徵,或者音訊模型可以將聲音與轉錄的單字對齊。每當兩個不同的資訊流需要融合時,交叉注意力通常是結締組織。

技術洞察

從機制上講,交叉注意力重複使用了與自註意力相同的縮放點積公式,但有一點不同:查詢來自一個序列(解碼器),鍵/值來自另一個序列(編碼器)。它將注意力權重計算為查詢鍵相似度上的 softmax,然後傳回值的加權和。由於查詢和密鑰源自不同的來源,因此兩個序列在長度、模式或語言上可能完全不同。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

交叉注意力的未來

交叉注意力越來越成為將模式拼接在一起的標準介面。視覺語言模型使用它,因此文字可以在圖像區域中立足;擴散圖像生成器使用它來調節文字提示上的像素。研究正在推動更有效的交叉注意力(線性和稀疏變體)來處理長文檔、高解析度圖像和視訊。隨著人工智慧系統整合更多的感官,預計交叉注意力層將充當對齊文字、聲音、視覺和結構化資料的通用連接器。

現實世界的實施

在神經機器翻譯中,解碼器交叉處理來源單詞,為每個輸出單字選擇正確的翻譯。

穩定擴散使用交叉注意力來調節文字提示上每個產生的影像區域。

像 Flamingo 這樣的視覺語言模型讓文字標記交叉參與圖像特徵以進行視覺問題回答。

語音到文字解碼器交叉參與編碼的音訊幀,以將聲音與正在轉錄的單字對齊。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Cross-Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

提示到提示交叉注意編輯

常見問題

What is Cross-Attention?

交叉注意力是一種讓一個序列查看另一個序列的機制:產生文字的解碼器可以專注於編碼器的輸入表示。這就是模型如何將它們正在生成的內容與它們所閱讀的內容連接起來,為翻譯、字幕和現代多模式系統提供動力。

自註意力和交叉注意力之間的主要區別是什麼?

交叉注意力從一個序列(例如解碼器)中提取查詢,並從另一個序列(例如編碼器)中提取鍵和值,讓兩者進行互動。

在編碼器-解碼器 Transformer 中,交叉注意力的查詢來自哪裡?

解碼器從其部分產生的輸出中形成查詢,然後使用編碼器輸出作為鍵和值來提取相關的輸入資訊。

為什麼交叉注意力中的兩個序列可以有不同的長度或模式?

由於查詢源自於一個來源而鍵/值來自另一個來源,因此序列是獨立的,並且可能在長度、語言或模式方面有所不同。

穩定擴散如何使用交叉注意力?

交叉注意力讓生成圖像的每個部分都專注於文字提示,將視覺效果紮根於單字。

交叉注意力與自註意力分享什麼數學運算?

兩者都使用相同的縮放點積注意力:查詢和鍵之間的相似度分數,softmax,然後是值的加權和。