语言人工智能指南

法学硕士的逆转诅咒

逆转诅咒是一种令人惊讶的失败模式,学习“A 是 B”的语言模型无法可靠地回答“B 是 A”。它揭示了法学硕士将事实存储为单向关联,而不是对称知识。

阅读时间:2分钟最后更新

深入探讨

Berglund 及其同事在 2023 年发表的一篇论文中记录了逆转诅咒,表明如果一个模型接受“汤姆·克鲁斯的母亲是玛丽·李·菲佛”的训练,当被问到“谁是玛丽·李·菲佛的儿子?”时,它经常会失败。即使答案在逻辑上是相同的。即使在对数百个此类事实进行微调之后,这种效应仍然存在于不同的模型大小中。这不是记忆间隙:模型已经看到了信息,但只是按照一个顺序。由于训练根据数据中的确切词序优化了下一个标记预测,因此从 A 到 B 的统计链接不会自动创建从 B 到 A 的链接。这一发现挑战了仅靠规模就能对事实进行灵活、类人推理的假设。

技术洞察

Transformer 通过预测给定先验上下文的下一个标记来学习,因此梯度更新加强了方向映射“A 然后 B”,但保持“B 然后 A”不变,除非该顺序也出现在训练中。这两个方向位于不同的重量路径中。研究人员通过测量对数概率证实了这一点:在学习前向事实后,反向陈述的概率保持在基线附近,表明训练期间没有发生隐式逻辑反转。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

法学硕士逆转诅咒的未来

正在研究的缓解措施包括双向数据增强(添加反向短语)、双向预测标记的训练目标以及对称查找事实而不是依赖记忆权重的检索系统。一些较新的架构和反向预训练实验缩小了差距。预计诅咒会缩小但不会消失,因为它暴露了下一个令牌学习与现实世界关系的对称结构之间的深度不匹配。

现实世界的实施

聊天机器人正确地说出了名人的父母,但当被要求说出该父母的著名孩子的名字时却失败了。

一位模特背诵“第九任总统是威廉·亨利·哈里森”,但却偶然发现“威廉·亨利·哈里森是第几任总统”。

学习了函数到描述映射的编码助手无法仅从描述中恢复函数名称。

当被问及什么治疗 Y 病症时,接受过“药物 X 治疗 Y 病症”训练的医疗 QA 系统未能列出药物 X。

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reversal Curse in LLMs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

ChatGPT 与大语言模型

常见问题

What is Reversal Curse in LLMs?

逆转诅咒是一种令人惊讶的失败模式,学习“A 是 B”的语言模型无法可靠地回答“B 是 A”。它揭示了法学硕士将事实存储为单向关联,而不是对称知识。

逆转咒描述了什么?

逆转诅咒是指无法从“A 是 B”的训练中推断出“B 是 A”,尽管两者在逻辑上是等价的。

从机制上讲,为什么会发生逆转诅咒?

由于训练以精确的观察顺序优化了下一个标记的预测,因此反向映射永远不会得到加强,除非它也出现在训练中。

增加模型大小是否能够可靠地解决反转诅咒?

最初的研究发现,该诅咒存在于一系列模型尺寸中,表明仅靠尺寸并不能解决这个问题。

哪种缓解措施直接针对逆转诅咒?

双向数据增强将模型暴露给“A 是 B”和“B 是 A”,从而创建缺失的反向关联。

研究人员如何确认模型没有隐式了解到相反的事实?

在正向训练后,反转语句的概率保持在基线附近,表明没有发生逻辑反转。