语言人工智能指南

并行解码的思想框架

思维骨架 (SoT) 是一种提示和解码技术,它首先要求语言模型勾勒出答案点的简短骨架,然后并行扩展每个点。

阅读时间:2分钟最后更新

概述

It matters because it can cut the wall-clock latency of long answers by roughly 2x without retraining the model.

深入探讨

大型语言模型通常一次生成一个标记,因此很长的答案很慢,因为每个单词都在等待它前面的单词。清华大学和 Microsoft 的研究人员于 2023 年引入的“思想框架”对这项工作进行了重组。第一次调用要求模型提供一个简洁的框架:一个包含 3 到 10 个点标题的编号列表,每个标题只有几个单词。然后,第二批调用独立且同时扩展每个点,因为这些点不相互依赖。这些扩展被重新拼接成最终的答案。由于慢速扩展阶段是并行运行的,因此对于答案自然分解为独立部分的问题(例如列出提示或比较选项),总延迟会急剧下降。

技术洞察

SoT 利用了解码器推理受延迟限制而不总是受计算限制的特点:单个请求通常会使 GPU 得不到充分利用。批量运行点扩展会使硬件繁忙,并与每点生成重叠。对于 API 模型,扩展是作为并发请求发出的;与本地模型一样,他们共享一个批量前向传递。骨架阶段增加了固定的短开销,因此净加速随着答案长度和独立点的数量而增长。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

思想骨架并行解码的未来

期望 SoT 想法融入自适应路由:系统将检测查询何时完全分解并切换到并行扩展,对于数学证明等紧密依赖的任务,回退到顺序推理。具有动态图依赖关系的 SoT 等变体允许点相互引用。随着服务框架添加本机批量子请求支持和推测解码,并行分解策略将成为标准的延迟减少层,而不是手动提示技巧。

现实世界的实施

通过一次扩展所有八个提示,加快回答“给我 8 个降低云成本的提示”的聊天机器人的速度。

客户支持助理生成结构化的多部分故障排除指南,响应延迟较低。

生成一个比较答案(两种产品的优缺点),同时填写每个项目符号。

后端服务系统批处理独立答案部分,以提高长格式生成期间的 GPU 利用率。

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Skeleton-of-Thought Parallel Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

MaskGIT 并行令牌解码

常见问题

What is Skeleton-of-Thought Parallel Decoding?

思维骨架 (SoT) 是一种提示和解码技术,它首先要求语言模型勾勒出答案点的简短骨架,然后并行扩展每个点。这很重要,因为它可以将长答案的挂钟延迟减少大约 2 倍,而无需重新训练模型。

思维骨架的第一阶段会产生什么?

SoT 首先提示模型发出一个简洁的点标题骨架,然后单独展开。

为什么扩点阶段可以并行运行?

骨架点被设计为独立的,因此扩展它们不需要等待兄弟姐妹。

正常 LLM 解码中的主要瓶颈 SoT 目标是什么?

标准解码受到延迟限制,因为每个令牌都会等待前一个令牌; SoT 重叠工作以减少挂钟时间。

SoT 对于哪种类型的问题提供最大的加速?

分解为许多独立部分的答案最受益,因为每个部分同时扩展。

与单个连续生成相比,SoT 增加了哪些开销?

骨架阶段增加了一个小的固定延迟,这被长答案的并行扩展所抵消。