技术指南

思维树推理

思想树让模型可以并行探索许多推理路径,就像树的分支一样,而不是局限于一条思路。

阅读时间:2分钟最后更新

概述

It can look ahead, evaluate partial solutions, and backtrack from dead ends.

深入探讨

由姚等人介绍。 2023年,思想树(ToT)概括了思想链提示。思想链产生推理步骤的单个线性序列,而 ToT 将问题构建为树:每个节点都是部分解决方案(一个“想法”),模型从每个节点生成几个候选的下一个想法。单独的评估步骤对每个分支的前景进行评分,而广度优先或深度优先搜索等搜索算法则决定扩展哪些分支以及修剪哪些分支。这让模型可以有意识地探索,向前看几步,并在路径看起来没有希望时回溯。 ToT 擅长击败贪婪的单路径推理的任务,最著名的是 24 人游戏,其中带有思维链的 GPT-4 解决了大约 4% 的谜题,但 ToT 将成功率提高到了大约 74%。

技术洞察

ToT 包含三个部分:提出候选下一步的思想生成器、状态评估器(通常是同一个法学硕士提示对部分解决方案进行评级或投票为“确定/可能/不可能”)以及导航树的搜索程序(BFS、DFS 或波束搜索)。由于该模型评估部分状态并修剪薄弱分支,因此它将计算分配给解决方案空间的有希望的区域,用额外的推理来换取对难题的更高的准确性。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

思想树推理的未来

思想树正在影响推理时间计算的使用方式:系统不再进行一次大的前向传递,而是越来越多地搜索推理路径并选择最佳路径。未来的工作旨在了解何时分支值得其高令牌成本,使用经过训练的价值函数而不是基于提示的自我评估,并将树搜索折叠到推理模型中,以便审议更加有效。期望与工具和验证器更紧密地集成,因此分支评估依赖于真实的反馈而不是模型的猜测。

现实世界的实施

通过分支首先组合两个数字并修剪不能达到 24 的算术路径来解决 24 游戏。

具有连贯计划的创意写作,模型起草几个情节大纲,对其进行评估,并在撰写散文之前扩展最强的内容。

像迷你填字游戏这样的约束性谜题,其中每个填充的单词都是一个想法,不兼容的分支将被放弃。

多步骤数学或规划问题,其中模型探索替代中间步骤并从违反约束的步骤中回溯。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tree-of-Thoughts Reasoning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常见问题

What is Tree-of-Thoughts Reasoning?

思想树让模型可以并行探索许多推理路径,就像树的分支一样,而不是局限于一条思路。它可以展望未来,评估部分解决方案,并从死胡同中回溯。

思维树与思维链提示有何不同?

思想链产生单个线性序列,而思想树分支成许多可以评估和修剪的候选路径。

在思想树中,单个节点通常代表什么?

每个节点都是一个部分解决方案(一个想法),模型从每个节点扩展出几个候选的下一个想法。

状态评估器在思想树中扮演什么角色?

评估者(通常是同一位法学硕士)对部分状态(例如,确定/也许/不可能)进行评分或投票,以便搜索可以集中在有前途的分支上。

在 Game of 24 基准测试中,ToT 的表现比 Chain-of-Thought 的表现大约高出多少?

具有思维链的 GPT-4 解决了 24 个游戏谜题的大约 4%,而思维树则达到了大约 74%。

哪些搜索策略通常用于导航思想树?

ToT 将思想生成和评估与 BFS、DFS 或波束搜索等经典搜索程序结合起来,以决定扩展哪些分支。