語言人工智慧指南

注意力機制

注意力讓模型在解釋每個單字時決定句子中哪些其他單字最重要。

閱讀時間約2分鐘最後更新

概述

It is the core idea that made the transformer — and therefore modern AI like ChatGPT — possible.

深入探討

注意力為每個單字回答了一個簡單的問題:我還應該看哪些其他單字才能理解這個單字? Vaswani 和 Google 的同事在 2017 年發表的論文「Attention Is All You Need」介紹了變壓器,它使用注意力作為其主要引擎,並放棄了舊的循環設計。每個令牌都變成三個向量:一個查詢(我在尋找什麼?)、一個鍵(我提供什麼?)和一個值(我攜帶的資訊)。將令牌的查詢與每個其他令牌的鍵進行比較以產生注意力權重,然後將這些值混合在一起。自註意力在一個序列中執行此操作,因此每個單字都可以直接專注於其他單字。多頭注意力並行運行許多這樣的比較,每個比較都專注於不同的模式。

技術洞察

數學是縮放點積注意力:softmax(QK^T / √d_k) V。查詢和鍵的點積對每對的相關性進行評分;除以關鍵維度的平方根 (√d_k) 可防止這些分數變得太大; softmax 將它們轉化為總和為 1 的權重;乘以 V 會產生加權值的混合。因為每個 token 都會與其他 token 進行比較,所以成本隨著序列長度的平方 - O(n²) 增長 - 這就是為什麼長輸入昂貴以及存在像 FlashAttention 這樣的優化的原因。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

注意力機制的未來

人們的注意力將持續存在,但其二次成本推動了深入的研究。 FlashAttention 透過重新排序計算,讓標準注意力更快、更有效率。較新的方向包括稀疏和線性注意力、分組和多查詢注意力以在生成過程中縮小內存,以及將注意力與狀態空間模型(如 Mamba)混合以處理很長的輸入的混合設計。預計未來的系統將保持注意力的靈活性,同時降低成本曲線,以便處理書籍長度或多文件輸入變得常規且經濟實惠。

現實世界的實施

機器翻譯,模型在產生每個翻譯單字時會專注於相關的來源單字。

摘要,注意力幫助模型專注於長文章中最重要的句子。

程式碼助手在預測下一行時會回到先前的變數定義。

對文件進行問答,注意力將問題詞與包含答案的段落聯繫起來。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Attention Mechanisms quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

滑動視窗注意

常見問題

What is Attention Mechanisms?

注意力讓模型在解釋每個單字時決定句子中哪些其他單字最重要。正是這個核心思想使得變壓器——以及像 ChatGPT 這樣的現代人工智慧——成為可能。

用一句話來說,注意力機制是做什麼的?

注意力計算權重,決定每個標記在形成其表示時應在其他標記上繪製多少。

2017 年哪一篇具有里程碑意義的論文介紹了 Transformer 架構?

「Attention Is All You Need」(Vaswani 等人,2017)提出了 Transformer,它依賴注意力而不是遞歸。

為每個注意力標記計算的三個向量是什麼?

每個令牌都會產生一個查詢、一個鍵和一個值;查詢與鍵進行匹配以對值進行加權。

公式softmax(QK^T / √d_k) V中,為什麼要除以√d_k?

以關鍵維度的平方根進行縮放可以防止大點積將 softmax 推入微小梯度,從而保持訓練穩定。

為什麼標準的自註意力對於很長的輸入會變得昂貴?

每個標記都會涉及其他每個標記,因此比較次數為 n²,這使得長序列在時間和記憶體方面都非常昂貴。