返回新聞
創新AI Understanding 簡報

研究發現注意力架構會降低 LLM 推理的能源成本

一項新的實證研究報告稱,注意力架構強烈影響語言模型推理能量隨上下文長度增長的大小。它發現多頭注意力的增長更加陡峭,分組查詢注意力的增長更加平坦,分組查詢注意力的能量幾乎恆定,並結合......

5 min readRead the primary source
Primary-source image accompanying Study finds attention architecture drives the energy cost of LLM inference
主要來源文件來源記錄
出版商
arxiv.org
來源連結
arxiv.orghttps://arxiv.org/abs/2608.25096
來源類型
主要文件-我們直接閱讀的官方公告、文件、文件或第一方頁面。
背景60 秒內了解這一點

從這裡開始

關鍵術語

大語言模型(LLM)
在海量文本語料庫上訓練來產生和分析文本的語言模型。
推理
經過訓練的模型產生預測或輸出的運行時階段。
記憶體(代理記憶體)
AI 代理程式跨步驟或會話使用儲存的上下文來提高連續性。
測試一下自己AI 模型解釋測驗

發生了什麼事

arXiv 預印本對大型語言模型推理的解碼階段的能源使用進行了系統性的實證研究。研究人員使用多頭注意力、分組查詢注意力和具有滑動視窗注意力的分組查詢注意力在不同的上下文長度、批量大小和生成工作負載上評估了四種開源模型。

本文研究了大型語言模型推理的解碼階段的能耗,該階段是模型在處理其輸入上下文後產生輸出標記的階段。作者將這項工作描述為一項系統性的實證研究,其動機是出於對日益增長的法學碩士使用對能源和環境影響的擔憂。他們比較了四種使用不同註意力設計的代表性開源模型:標準多頭注意力、分組查詢注意力以及分組查詢注意力與滑動視窗注意力相結合。比較的重點是這些設計在生成代幣時的行為方式,環境和工作負載條件發生變化,以便可以觀察到它們的能量模式。

研究人員改變了影響推理的幾個操作條件:上下文長度、批量大小和產生工作負載。他們使用 NVIDIA 硬體計數器測量 GPU 能量,並分別檢查注意力機制、模型​​大小、鍵值快取成長和批次的影響。消息來源沒有識別這四個模型、它們的參數數量、確切的硬體配置、工作負載大小或超出此抽象層級所描述的測量協議。這些測量結果以測試條件之間的比較的形式呈現,可用的描述強調了報告的因素,而不是對周圍服務系統的完整說明。

該論文報告稱,注意力機制是控制解碼能量如何隨著上下文長度增加而變化的主要因素。在比較中,使用多頭注意力的模型比使用分組查詢注意力的模型顯示出更陡峭的能量增長。在報告的實驗中,分組查詢注意力與滑動視窗注意力相結合保持了幾乎恆定的能耗。作者還報告說,模型大小主要決定絕對能耗,而批次處理可將每個生成令牌的能耗​​和請求延遲降低多達 87%。因此,結果區分了絕對值所使用的能量量和該量隨上下文長度變化的方式。

來源詳情: arxiv.org ↗

為什麼這很重要

該研究表明,人工智慧模型的注意力機制的設計可以對產生令牌所需的能量產生重大影響,特別是隨著上下文視窗的增長。其結果可以幫助模型開發人員和營運商根據能源使用、延遲和規模權衡架構和服務選擇。

核心意義是能源效率不僅取決於語言模型的大小。服務於較長上下文的兩個模型可能具有不同的能量擴展行為,因為它們的注意力機制與不斷增長的鍵值快取的交互方式不同。這使得架構成為運作大量推理服務或設計旨在處理長輸入的模型的組織的實際考慮因素。這種差異對於規劃很重要,因為在比較中,上升的上下文視窗不會轉換為跨架構的固定能量軌跡。

關於具有滑動視窗注意力的分組查詢注意力的報告結果可能是有用的,因為它指出了一種限制與較長上下文相關的能量增長的方法。消息來源並沒有聲稱這種組合普遍優越:它報告了在測試條件下四個開源模型的經驗模式。任何部署決策還需要考慮準確性、上下文保留、長文件的品質、實施限制以及在提供的來源中未測量的其他成本。當將結果解釋為測試案例的證據而不是獨立於模型行為或服務要求的建議時,這些資格非常重要。

批次結果將能源使用與營運規劃連結起來。根據該論文,批量處理請求可減少每個生成令牌的能源和請求延遲高達 87%。如果在生產環境中重現,這可能會使調度和工作負載整合與成本和環境管理相關。該消息來源沒有說明是否在每種工作負載下都出現了最大的減少,批次是否會改變輸出質量,或者個人用戶可能會出現哪些響應能力權衡。這使得報告的百分比與系統設計相關,同時其適用性取決於條件。

Interactive Mechanism

互動機制:它實際上是如何運作的

以互動方式探索這項發展背後的基礎技術。

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
互動式概念檢查+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

接下來看什麼

研究結果需要在更多模型、硬體平台、工作負載和完整推理管道上進行測試。該論文測量了解碼過程中的 GPU 能量,因此其結果本身並不能確定總系統能量、更廣泛的環境影響或每個模型架構的效能。

第一個問題是再現性。消息來源確定論文為 2026 年 8 月 25 日提交的 arXiv 預印本,並提供了摘要,但沒有同行評審狀態。後續審查應檢查完整的模型清單、參數大小、上下文長度、批次配置、產生長度、能量計數器校準和運行之間的統計變化。這些細節將有助於確定報告的比較可以在多大程度上重現,以及觀察到的差異有多少不確定性。

硬體測量的範圍也很重要。該研究使用 NVIDIA 硬體計數器測量 GPU 能量,但摘要並未報告 CPU、記憶體、網路、冷卻、儲存或其他基礎設施的能量。因此,它支援有關測量的 GPU 解碼能量的結論,而不是與運行人工智慧服務相關的能量或排放的完整核算。 GPU 計數器提供了研究規定的測量邊界,因此在測量其他組件之前,結論應與該邊界保持聯繫。

進一步的工作應該測試所報告的擴展模式是否適用於更新的和不同設計的模型、其他加速器供應商、更長的上下文和互動式工作負載。它還應該將能量與模型品質和吞吐量進行比較。在一種配置下使用較少能量的機制可能會在其他地方強加能力或延遲權衡,並且所提供的來源不會量化這些權衡。這樣的比較將澄清較低的測量能量是否伴隨著操作員關心的其他結果的變化。

所報告的 87% 的最大減少量值得仔細解釋。摘要將其歸因於批次處理,並表示它適用於每個產生的令牌的能量和請求延遲,但它沒有指定基線、工作負載或相同的百分比是否適用於這兩種度量。讀者應將其視為該研究的較高報告結果,而不是對所有法學碩士部署的普遍期望。如果沒有這些詳細信息,百分比就無法直接從預印本轉移到任意部署。

相關指引和測驗

人工智慧模型解釋變形金剛人工智慧培訓AI 的未來測試你所知道的—嘗試免費的人工智慧測驗在我們的詞彙表中尋找人工智慧術語關注 AI 模型發布追蹤器
覺得有用嗎?