語言人工智慧指南

比較解碼

對比解碼透過從大而強的語言模型的傾向中減去小而弱的語言模型的傾向來產生更高品質的文本。

閱讀時間約2分鐘最後更新

概述

It amplifies what the expert knows and the amateur misses, reducing repetition and bland output.

深入探討

當語言模型選擇下一個單字時,它會產生其詞彙表的機率。對比解碼(由 Li 等人於 2022 年提出)在同一上下文中運行兩個模型:一個大的“專家”和一個小的“業餘”。它不相信專家的原始機率,而是根據專家的對數機率和業餘愛好者的對數機率之間的差異對每個候選標記進行評分。專家青睞的代幣,但業餘愛好者卻得不到提升;兩個模特兒都喜歡的通用詞(例如“the”或重複的短語)會被抑制,因為業餘愛好者也喜歡它們。合理性過濾器首先丟棄專家認為不太可能的標記,因此對比永遠不會促進無意義。與貪婪或核心採樣相比,結果是更流暢、連貫、重複性更少的長文本,並且不需要額外的訓練。

技術洞察

核心分數是 log p_expert(token) 減係數乘以 log p_amateur(token)。因為業餘愛好者共享專家的系統錯誤(偏好高頻標記、循環、簡併重複),所以減去其對數機率可以消除這些共享的故障模式,同時保留真正的專家知識。自適應合理性限制僅使標記高於頂級專家機率的一小部分(α),從而防止對比放大罕見的、不連貫的單字。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

對比解碼的未來

對比解碼啟發了一系列「推理對比」方法,包括 DoLa(對比模型本身的早期層和後期層以減少幻覺)以及與檢索到的文檔和沒有檢索到的文檔進行對比的上下文感知變體。期望與檢索、事實性評分和小業餘愛好者精煉更緊密地集成,再加上與推測性解碼的結合,以便業餘愛好者既可以控製質量,又可以同時加速生成。

現實世界的實施

生成長的、非重複的故事或文章延續,其中核心採樣陷入循環

將 65B 專家與 1.5B 業餘愛好者配對,無需微調即可改進開放式生成

減少摘要和對話輸出中的退化重複

作為 DoLa 式自我對比的基礎,以降低事實幻覺

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Contrastive Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

最小貝葉斯風險解碼

常見問題

What is Contrastive Decoding?

對比解碼透過從大而強的語言模型的傾向中減去小而弱的語言模型的傾向來產生更高品質的文本。它放大了專家知道的和業餘愛好者錯過的東西,減少了重複和乏味的輸出。

在對比解碼中,小型「業餘」模型扮演什麼角色?

業餘愛好者的對數機率從專家的對數機率中減去,從而消除了兩個模型共有的系統錯誤(例如偏向頻繁的標記)。

為什麼減去業餘愛好者的機率會減少重複和乏味的輸出?

兩種模型都傾向於過度偏好高頻和重複的標記;減去業餘愛好者可以消除這種共同的偏見,從而降低乏味的選擇。

自適應合理性約束有什麼作用?

合理性過濾器會丟棄專家下的低機率標記,因此對比不會促進不連貫或無意義的單字。

對比解碼中的評分公式大致是什麼?

每位候選人的評分是專家的對數機率減去加權業餘對數機率,獎勵專家獨特喜歡的代幣。

後面哪一種方法將對比思想擴展到單一模型自己的層?

DoLa 將模型的早期(早期層)和成熟(晚期)預測進行對比,以減少幻覺,在一個模型中應用對比概念。