語言人工智慧指南

指令調優

指令調整是將原始文字預測器轉變為實際遵循「總結」或「寫禮貌回應」等指令的模型的訓練步驟。這就是讓基礎模型感覺有用且可操縱的原因。

閱讀時間約2分鐘最後更新

深入探討

基本語言模型僅經過訓練來預測網路文字上的下一個標記,因此,如果您輸入問題,它可能會繼續提出更多問題,而不是回答。指令調整解決了這個問題。它是一種監督微調的形式:該模型在許多對(指令、理想響應)上進行訓練,涵蓋數千個任務——翻譯、摘要、分類、問答、編碼等等。透過重複查看相同的指令然後提供有用的答案模式,該模型可以學習「按照使用者要求執行操作」的一般行為,並且這可以推廣到它在訓練中從未見過的指令。該方法是在 2021 年左右由 FLAN、T0 和 Natural instructions 等工作建立的,並且是 OpenAI 的 InstructGPT 的核心,該方法根據一組精選的指令提示對 GPT-3 進行了微調。它是大多數聊天助理建構的基礎。

技術洞察

從機制上講,指令調整是標準的監督學習:透過梯度更新權重,最小化模型預測標記與參考答案之間的差異。它與 RLHF(基於人類回饋的強化學習)不同,後者是使用獎勵模型針對人類偏好進行最佳化的。通常的方法是分層的:預訓練,然後指令調整(SFT)來教授任務跟踪,然後可選的 RLHF 來改進語氣、幫助性和安全性。數據多樣性比純粹的數量更重要——廣泛的任務覆蓋範圍推動了泛化。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

指令調優的未來

在發現資料品質可以勝過數量之後,該領域正在從巨大的手寫資料集轉向更高品質的、部分合成的資料——有時只是數千個精心挑選的例子。預計會有更多特定領域的指令調整(醫學、法律、編碼)、多語言和多模式指令集,以及產生和過濾指令資料的自動化管道。指令調整將仍然是原始預訓練模型和可用助手之間的重要橋樑,並且越來越多地與偏好優化相結合以進行對齊。

現實世界的實施

將基本的 GPT 風格模型轉變為回答問題而不是回應問題的聊天助手

FLAN-T5,在許多任務中進行了微調,因此它可以遵循從未明確訓練過的指示

InstructGPT,其中 GPT-3 根據策劃的提示進行指令調整,以產生更有幫助的回應

透過微調支援和法律團隊編寫的指令響應對來建立公司內部助理

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Instruction Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Instruction Tuning?

指令調整是將原始文字預測器轉變為實際遵循「總結」或「寫禮貌回應」等指令的模型的訓練步驟。這就是讓基礎模型感覺有用且可操縱的原因。

指令調整與 RLHF 有何不同?

指令調整是對目標反應的監督學習。 RLHF 隨後出現,根據學習到的人類偏好來優化模型。

指令調整資料的什麼屬性最能驅動模型遵循新的、看不見的指令的能力?

涵蓋各種各樣的任務,教授遵循指令的一般行為,這可以概括為訓練中從未見過的指令。

現代聊天助理的典型訓練階段順序是什麼?

模型首先根據原始文字進行預訓練,然後根據任務進行指令調整,並且通常使用 RLHF 進行改進以提高語氣和安全性。