上下文窗口
上下文窗口是模型一次可以读取并记住的最大文本量(以标记为单位)。
概述
它对模型实际能使用的对话、文档或指令设定了硬性限制。
深入探讨
模型不直接读取字符或单词;他们读取标记,其中标记是一段文本,大约相当于英语单词的四分之三。上下文窗口计算提示加上模型自己的响应。早期的 GPT-3 处理了大约 2,000 个代币;到 2025-2026 年,前沿模型急剧扩展 - Google 的 Gemini 达到 1 到 200 万个代币,多个 Claude 和 GPT 模型提供 128K 到 100 万个代币,足以容纳整本书或代码库。但越大并不一定越好。因为注意力会将每个标记进行相互比较,所以计算和内存成本随着长度的增加而急剧上升。模型还表现出“迷失在中间”的效果,比埋在中间的材料更可靠地回忆起长输入开始和结束时的信息。
技术洞察
单个请求中的所有内容(系统指令、之前的聊天回合、粘贴的文档以及生成的答案)都必须符合代币预算。当它溢出时,最旧的内容就会被丢弃或必须进行总结,这就是为什么长时间的聊天似乎会“忘记”。较大的窗口成本高昂,因为自注意力大致与令牌计数的平方成正比,并且模型会缓存每个令牌的键/值向量,从而消耗内存。这就是为什么提供商按代币定价的原因,也是为什么检索通常比将所有内容都填充到上下文中更便宜的原因。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
上下文窗口的未来
上下文窗口将继续增长,但重点正从原始大小转向有效使用。更好的长上下文训练、注意力优化和键/值缓存压缩等技术旨在减少“中间丢失”问题和成本曲线。检索增强生成仍将是一个实用的补充,仅获取相关块,而不是每次调用都付费处理数百万个代币。预计“模型使用其窗口的可靠性如何”比标题最大数字更重要。
现实世界的实施
粘贴整个合同或研究论文,以便模型可以回答有关它的问题,而不会丢失前面的部分。
长时间的编码会话中,助理需要同时保留许多文件和之前的更改。
客户支持机器人必须记住对话的完整来回以保持一致。
分析大型日志或文字记录,其中关键细节可能相距很远,并且有“在中间丢失”的风险。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Context Windows quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是上下文窗口?
上下文窗口是模型一次可以读取并记住的最大文本量(以标记为单位)。它对模型实际可以使用的对话、文档或指令的数量设置了硬性限制。
模型的上下文窗口衡量什么?
上下文窗口是单个请求的令牌预算——模型一次可以读取和响应多少文本。
在这种情况下,令牌是什么?
模型将文本处理为标记,即子词块;在英语中,一个记号平均大约占一个单词的四分之三。
哪些项目计入单个请求中的上下文窗口?
整个请求共享一个预算:指令、对话历史记录、任何粘贴的内容以及模型自己的输出都会消耗令牌。
为什么更大的上下文窗口不会自动变得更好?
注意力成本大致随标记数量的平方而增长,“中间丢失”效应意味着文档中间细节的回忆不太可靠。
为什么经常使用检索增强生成(RAG)而不是将所有内容放入上下文窗口中?
RAG 仅检索知识库的相关部分,从而避免了在每次请求时将大量文本输入模型的成本。