語言人工智慧指南

語言建模

語言建模是一項看似簡單的任務,即在給定當前文本的情況下預測接下來會出現什麼單字或標記。

閱讀時間約2分鐘最後更新

概述

This single objective, scaled up massively, is what produces today's powerful chatbots and writing assistants.

深入探討

語言模型的核心是將機率分配給文字序列。給出提示“法國的首都是”,它會估計下一個標記的可能性,“巴黎”應該得分很高。早期的語言模型是統計 n 元語法,僅計算單字序列出現的頻率,但它們在處理長上下文和看不見的短語時遇到了困難。神經語言模型以學習的表示取代了計數,2017 年的 Transformer 架構讓模型能夠有效地處理長文本。像 GPT 系列這樣的現代大型語言模型是在巨大的文本語料庫上進行訓練的,其目標只有一個:預測下一個標記。值得注意的是,做得好會迫使模型吸收語法、事實、推理模式和風格,因為準確預測文本需要理解它。產生的工作原理是反覆預測下一個標記並將其回饋回來。

技術洞察

大多數現代語言模型都是自回歸的:它們將句子的機率分解為下一個標記機率的乘積,從左到右一次預測一個標記。訓練最大限度地減少交叉熵損失,這會獎勵將高機率分配給訓練文本中的實際下一個標記。這是自我監督的,標籤不受文字本身的影響,因此不需要人工註釋。在生成時,溫度、top-k 和 top-p(核)等採樣策略控制著可預測輸出和創造性輸出之間的權衡。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

語言建模的未來

事實證明,下一個代幣的預測具有驚人的強大功能,並且縮放定律表明,更大的模型和更多的數據不斷提高能力,儘管收益正在放緩,高品質的數據變得稀缺。前沿正在轉向推理、更長的上下文視窗和訓練後方法,例如根據人類回饋進行強化學習,在基本模型建構後塑造行為。預計語言建模與工具、檢索和多模式輸入將繼續混合,而預測下一個標記的基本目標仍然是其他一切的基礎。

現實世界的實施

當您鍵入時,手機鍵盤或電子郵件會自動完成建議下一個單字

像 ChatGPT 這樣的聊天機器人透過重複預測下一個標記來產生流暢的答案

程式碼編輯器(例如 GitHub Copilot)可根據周圍上下文預測下一行程式碼

語音辨識系統使用語言模型在相似的選項中選擇最合理的轉錄

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Language Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

掩碼語言建模

常見問題

What is Language Modeling?

語言建模是一項看似簡單的任務,即在給定當前文本的情況下預測接下來會出現什麼單字或標記。這單一目標的大規模擴展,造就了當今強大的聊天機器人和寫作助理。

語言模型執行的核心任務是什麼?

語言模型估計序列中接下來發生的事情的機率,並且產生透過重複預測和附加下一個標記來工作。

早期 n-gram 語言模型的主要限制是什麼?

N-gram 模型依賴於對短單字序列進行計數,因此它們無法很好地處理長範圍上下文,並且無法處理從未見過的短語。

為什麼語言模型訓練被稱為「自監督」?

正確的下一個標記已存在於文字中,因此模型無需手動註釋即可建立自己的目標。

「自回歸」對於語言模型意味著什麼?

自迴歸模型逐一產生文字標記,根據迄今為止產生的所有內容調整每個新預測。

哪一種損失函數通常用於訓練語言模型?

訓練最小化交叉熵,獎勵模型為訓練文本中觀察到的實際下一個標記分配高機率。