掩碼語言建模
蒙面語言模型教導人工智慧使用完整的周圍上下文(左右)來填充故意隱藏的單字。
概述
這是 BERT 背後的訓練技巧,也是模型能夠深入理解句子含義而不僅僅是預測接下來會發生什麼的原因。
深入探討
在掩碼語言模型 (MLM) 中,您取一個句子,用特殊的 [MASK] 符號隨機隱藏其約 15% 的標記,並訓練模型猜測原文。由於該模型可以看到每個空白兩側的單詞,因此它可以建立對上下文的雙向理解。 Google 在 2018 年推出的 BERT 讓這一點得以普及。一個巧妙的細節:在被屏蔽的位置中,大約 80% 變成了 [MASK],10% 被交換為隨機單詞,10% 保持不變。這可以防止模型在預測時只期望 [MASK] 令牌並增強穩健性。經過預訓練後,模型將針對分類、問答和命名實體辨識等任務進行微調。
技術洞察
MLM 使用具有雙向自註意力的 Transformer 編碼器,因此每個令牌都會同時關注所有其他令牌。僅使用相對於真實令牌 ID 的交叉熵在屏蔽位置上計算損失。因為注意力是非因果的(沒有未來的屏蔽),所以每個單字的表示將左右上下文融合成一個密集向量。這種雙向性正是下一代代幣模式為了生成能力而放棄的東西。
戰略影響
速度與規模
語言工作流程可以在不犧牲一致性的情況下更快地移動。
交通與覆蓋範圍
它擴展了跨語言和溝通方式的訪問。
更明確的決策
團隊可以花更多時間進行判斷,而自動化則可以處理重複。
掩碼語言建模的未來
純傳銷在一定程度上被聊天機器人的生成解碼器模型所掩蓋,但它在嵌入、檢索和分類方面仍然占主導地位,其中理解勝過生成。 RoBERTa、ELECTRA 的替換令牌檢測和 DeBERTa 等變體不斷提高準確性和效率。預計 MLM 式編碼器將繼續成為搜尋、語義相似性的核心,並作為大型檢索增強和多模態系統中的輕量級組件,在這些系統中,快速、深入的理解比自由格式的文本更重要。
現實世界的實施
支援 Google 搜尋對話查詢的基於 BERT 的理解,以傳回更多相關頁面。
為語意搜尋和文件檢索系統產生句子嵌入。
微調 BERT,以進行產品評論或支援請求的情感分析。
命名實體識別,從法律或醫學文本中提取人員、組織和日期。
風險與防護欄
幻覺的事實可以悄悄地進入報告、支持流程或研究成果。
及時的敏感性可能會在類似的請求中產生不一致的結果。
如果存取控制薄弱,敏感文字資料可能會暴露。
實施路線圖
在推出之前定義輸出格式、語氣和品質標準。
當準確性很重要時,請使用可信任來源進行地面回應。
為高風險輸出保留人工審查檢查點。
追蹤故障模式並定期重新訓練提示或工作流程。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Language Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
什麼是掩碼語言建模?
蒙面語言模型教導人工智慧使用完整的周圍上下文(左右)來填充故意隱藏的單字。這是 BERT 背後的訓練技巧,也是模型能夠深入理解句子含義而不僅僅是預測接下來會發生什麼的原因。
掩碼語言建模的核心訓練任務是什麼?
MLM 隱藏了一小部分令牌,並訓練模型以使用左右上下文來恢復它們。
BERT 在預訓練期間通常會屏蔽大約百分之多少的標記?
BERT 屏蔽了大約 15% 的輸入標記,在提供足夠的訊號和留下足夠的上下文之間取得平衡。
為什麼MLM給予模型雙向理解?
Transformer 編碼器使用非因果自註意力,因此每個令牌都可以看到兩側的所有其他令牌。
在 BERT 的遮罩方案中,大約 10% 的選定位置會發生什麼而不是變成 [MASK]?
為了提高穩健性,10% 的屏蔽位置被交換為隨機標記,10% 保持不變。
傳銷損失是在哪些部位計算的?
交叉熵損失僅應用於屏蔽位置,將預測與原始令牌 ID 進行比較。