語言人工智慧指南

法學碩士的逆轉詛咒

逆轉詛咒是一種令人驚訝的失敗模式,學習「A 是 B」的語言模型無法可靠地回答「B 是 A」。它揭示了法學碩士將事實儲存為單向關聯,而不是對稱知識。

閱讀時間約2分鐘最後更新

深入探討

Berglund 及其同事在 2023 年發表的一篇論文中記錄了逆轉詛咒,表明如果一個模型接受“湯姆·克魯斯的母親是瑪麗·李·菲佛”的訓練,當被問到“誰是瑪麗·李·菲佛的兒子?”時,它經常會失敗。即使答案在邏輯上是相同的。即使在對數百個此類事實進行微調之後,這種效應仍然存在於不同的模型大小中。這不是記憶間隙:模型已經看到了訊息,但只是按照一個順序。由於訓練根據資料中的確切詞序優化了下一個標記預測,因此從 A 到 B 的統計連結不會自動建立從 B 到 A 的連結。這項發現挑戰了僅靠規模就能對事實進行靈活、類人推理的假設。

技術洞察

Transformer 透過預測給定先驗上下文的下一個標記來學習,因此梯度更新加強了方向映射“A 然後 B”,但保持“B 然後 A”不變,除非該順序也出現在訓練中。這兩個方向位於不同的重量路徑。研究人員透過測量對數機率證實了這一點:在學習前向事實後,反向陳述的機率保持在基線附近,表明訓練期間沒有發生隱式邏輯反轉。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

法學碩士逆轉詛咒的未來

正在研究的緩解措施包括雙向資料增強(添加反向短語)、雙向預測標記的訓練目標以及對稱查找事實而不是依賴記憶權重的檢索系統。一些較新的架構和反向預訓練實驗縮小了差距。預計詛咒會縮小但不會消失,因為它暴露了下一個令牌學習與現實世界關係的對稱結構之間的深度不匹配。

現實世界的實施

聊天機器人正確地說出了名人的父母,但當被要求說出該父母的著名孩子的名字時卻失敗了。

一位模特兒背誦“第九任總統是威廉·亨利·哈里森”,但卻偶然發現“威廉·亨利·哈里森是第幾個總統”。

學習了函數到描述映射的編碼助手無法僅從描述中恢復函數名稱。

當被問及什麼治療 Y 病症時,接受過「藥物 X 治療 Y 病症」訓練的醫療 QA 系統未能列出藥物 X。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reversal Curse in LLMs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

ChatGPT 與大型語言模型

常見問題

What is Reversal Curse in LLMs?

逆轉詛咒是一種令人驚訝的失敗模式,學習「A 是 B」的語言模型無法可靠地回答「B 是 A」。它揭示了法學碩士將事實儲存為單向關聯,而不是對稱知識。

逆轉咒描述了什麼?

逆轉詛咒是指無法從“A 是 B”的訓練中推斷“B 是 A”,儘管兩者在邏輯上是等價的。

從機制上講,為什麼會發生逆轉詛咒?

由於訓練以精確的觀察順序優化了下一個標記的預測,因此反向映射永遠不會得到加強,除非它也出現在訓練中。

增加模型大小是否能可靠地解決反轉詛咒?

最初的研究發現,該詛咒存在於一系列模型尺寸中,顯示僅靠尺寸並不能解決這個問題。

哪一種緩解措施直接針對逆轉詛咒?

雙向資料增強將模型暴露給“A 是 B”和“B 是 A”,從而創建缺失的反向關聯。

研究者如何確認模型沒有隱式了解到相反的事實?

在正向訓練後,反轉語句的機率保持在基線附近,表示沒有發生邏輯反轉。