思想之树
思想树 (ToT) 是一个提示框架,它让语言模型可以像树的分支一样并行探索多个推理路径,而不是局限于单一的思维路线。
概述
这很重要,因为它极大地提高了需要规划、搜索或回溯的问题的性能。
深入探讨
标准的思维链提示会引导模型从头到尾执行一系列推理步骤,这适用于许多任务,但当早期的错误注定了整个答案时就会失败。普林斯顿大学和 Google DeepMind 的研究人员于 2023 年推出了“思想之树”,它将推理重新定义为对树的搜索。在每一步,模型都会生成几个候选“想法”(中间步骤或部分解决方案),评估每个想法的前景,然后进一步探索最佳分支,放弃死胡同。这让模型能够向前看、比较选项并回溯,表现得更像是一个深思熟虑的问题解决者,而不是一次性猜测者。在像 24 人游戏这样的任务中,ToT 将思维链的成功率从几个百分点提高到了 74% 左右。
技术洞察
ToT 结合了三个要素:提出多个后续步骤的思想生成器、对每条部分路径成功的可能性进行评分或投票的状态评估器、以及决定扩展或修剪哪些分支的搜索算法(通常是广度优先或深度优先搜索)。模型本身通常会通过提示将状态评级为“确定”、“也许”或“不可能”来执行评估。至关重要的是,这是模型提示的包装,而不是重新训练。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
思想之树的未来
期望树式审议被吸收到代理系统和“推理”模型中,在推理时为难题分配额外的计算。像思维图这样的变体允许合并和重用中间结果的路径,并且学习评估器可以取代基于提示的评分以提高可靠性。更广泛的趋势是将推理时间搜索视为一个可调旋钮:花费更多的计算来探索高风险问题的分支,减少简单问题的计算,从而模糊了提示和计划之间的界限。
现实世界的实施
通过探索和修剪许多候选方程,解决 24 人游戏难题,其中四个数字必须通过算术组合才能达到 24。
创意写作任务中,模型起草几个情节方向,评估连贯性,并制定最强的一个。
数学证明或多步骤应用题,其中从有缺陷的步骤回溯对于得出正确答案至关重要。
像迷你填字游戏这样的约束谜题,模型会测试部分填充并放弃违反线索的分支。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tree of Thoughts quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是思想树?
思想树 (ToT) 是一个提示框架,它让语言模型可以像树的分支一样并行探索多个推理路径,而不是局限于单一的思维路线。这很重要,因为它极大地提高了需要规划、搜索或回溯的问题的性能。
思想树与思想链提示有何根本区别?
在思想链遵循一条线性路径的情况下,思想树分支成几个候选思想,评估它们,并从死胡同回溯。
思想树系统由哪三个组成部分组成?
ToT 将候选想法的生成器、对部分状态进行评分的评估器以及用于决定扩展哪些分支的搜索过程(如 BFS 或 DFS)配对。
在 Game of 24 基准测试中,使用 Tree of Thought 的显着结果是什么?
与思维链相比,ToT 极大地提高了 Game of 24 的成功率,展示了搜索和回溯的价值。
思想树系统通常如何评估部分解决方案?
模型本身通常充当评估器,判断每条部分路径的前景如何,以便搜索可以修剪薄弱分支。
在现有模型上实施思想树的事实是怎样的?
ToT 通过提示和搜索循环来协调模型的现有功能;它不会修改基础权重。