语言人工智能指南

注意力机制

注意力让模型在解释每个单词时决定句子中哪些其他单词最重要。

阅读时间:2分钟最后更新

概述

It is the core idea that made the transformer — and therefore modern AI like ChatGPT — possible.

深入探讨

注意力为每个单词回答了一个简单的问题:我还应该看哪些其他单词才能理解这个单词? Vaswani 和 Google 的同事在 2017 年发表的论文“Attention Is All You Need”介绍了变压器,它使用注意力作为其主要引擎,并放弃了旧的循环设计。每个令牌都变成三个向量:一个查询(我在寻找什么?)、一个键(我提供什么?)和一个值(我携带的信息)。将令牌的查询与每个其他令牌的键进行比较以生成注意力权重,然后将这些值混合在一起。自注意力在一个序列中执行此操作,因此每个单词都可以直接关注其他单词。多头注意力并行运行许多这样的比较,每个比较都关注不同的模式。

技术洞察

数学是缩放点积注意力:softmax(QK^T / √d_k) V。查询和键的点积对每对的相关性进行评分;除以关键维度的平方根 (√d_k) 可防止这些分数变得太大; softmax 将它们转化为总和为 1 的权重;乘以 V 会产生加权值的混合。因为每个 token 都会与其他 token 进行比较,所以成本随着序列长度的平方 - O(n²) 增长 - 这就是为什么长输入昂贵以及存在像 FlashAttention 这样的优化的原因。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

注意力机制的未来

人们的注意力将持续存在,但其二次成本推动了深入的研究。 FlashAttention 通过重新排序计算,使标准注意力变得更快、更高效。较新的方向包括稀疏和线性注意力、分组和多查询注意力以在生成过程中缩小内存,以及将注意力与状态空间模型(如 Mamba)混合以处理很长的输入的混合设计。预计未来的系统将保持注意力的灵活性,同时降低成本曲线,以便处理书籍长度或多文档输入变得常规且经济实惠。

现实世界的实施

机器翻译,模型在生成每个翻译单词时会关注相关的源单词。

摘要,注意力帮助模型专注于长文章中最重要的句子。

代码助手在预测下一行时会返回到先前的变量定义。

对文档进行问答,注意力将问题词与包含答案的段落联系起来。

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Attention Mechanisms quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

滑动窗口注意

常见问题

What is Attention Mechanisms?

注意力让模型在解释每个单词时决定句子中哪些其他单词最重要。正是这个核心思想使得变压器——以及像 ChatGPT 这样的现代人工智能——成为可能。

用一句话来说,注意力机制是做什么的?

注意力计算权重,决定每个标记在形成其表示时应在其他标记上绘制多少。

2017 年哪一篇具有里程碑意义的论文介绍了 Transformer 架构?

“Attention Is All You Need”(Vaswani 等人,2017)提出了 Transformer,它依赖于注意力而不是递归。

为每个注意力标记计算的三个向量是什么?

每个令牌都会生成一个查询、一个键和一个值;查询与键进行匹配以对值进行加权。

公式softmax(QK^T / √d_k) V中,为什么要除以√d_k?

按关键维度的平方根进行缩放可以防止大点积将 softmax 推入微小梯度,从而保持训练稳定。

为什么标准的自注意力对于很长的输入会变得昂贵?

每个标记都会涉及其他每个标记,因此比较次数为 n²,这使得长序列在时间和内存方面都非常昂贵。