語言人工智慧指南

XLNet 排列建模

XLNet 透過隨機詞序訓練,將 BERT 的雙向情境與 GPT 的自迴歸預測融合在一起。

閱讀時間約2分鐘最後更新

概述

This permutation trick lets it learn from all positions without ever masking tokens.

深入探討

XLNet 由卡內基美隆大學和 Google Brain 於 2019 年推出,旨在修復 BERT 式預訓練中的缺陷。 BERT 屏蔽標記並預測它們,但人工 [MASK] 符號在微調時永遠不會出現,從而造成訓練/測試不匹配,並且 BERT 假設屏蔽標記是獨立的。相反,XLNet 使用「排列語言建模」:它最大化序列中單字的所有可能排序的預期對數似然。透過在給定其他標記的隨機子集的情況下預測每個標記,該模型可以有效地看到雙向上下文,同時保持適當的自回歸模型,無需屏蔽。 XLNet 建立在用於遠端記憶的 Transformer-XL 主幹之上,在大約 20 項任務上的表現優於 BERT,包括問答、情緒分析和文件排名。

技術洞察

XLNet 不會物理地打亂單字;它透過注意掩碼排列分解順序,因此位置資訊被保留。為了實現這項工作,它使用「雙流自註意力」:一個對令牌及其上下文進行編碼的內容流,以及一個知道目標位置但不知道其內容的查詢流,從而能夠在不洩露答案的情況下進行預測。 Transformer-XL 的循環和相對位置編碼使其能夠跨長段進行記憶,從而改善對長文件的處理。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

XLNet 排列建模的未來

XLNet 是一個有影響力的證明,證明自回歸目標可以捕捉雙向上下文,模糊了 BERT 與 GPT 的分歧。雖然該領域主要圍繞屏蔽編碼器或大型自回歸解碼器進行鞏固,但 XLNet 的排列思想和 Transformer-XL 遞歸為後來的長上下文建模和統一預訓練目標的工作提供了資訊。當研究人員尋求將強大的上下文建模與高效、無掩模生成相結合的架構時,它的見解仍然具有相關性。

現實世界的實施

在 SQuAD 等問答基準測試中取得最高成績

透過 Transformer-XL 記憶體處理長文件任務,例如 RACE 閱讀理解測試

為文件排名和資訊檢索系統提供支持

在 BERT 基線上改進情緒分類和文本分類

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the XLNet Permutation Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is XLNet Permutation Modeling?

XLNet 透過隨機詞序訓練,將 BERT 的雙向情境與 GPT 的自迴歸預測融合在一起。這種排列技巧讓它可以從所有位置學習,而無需屏蔽標記。

XLNet 使用什麼預訓練目標?

XLNet 最大化令牌分解順序的所有排列的預期對數似然,稱為排列語言建模。

XLNet 是專門為了解決哪些 BERT 弱點而設計的?

BERT 的人工 [MASK] 符號在微調期間不會出現,並且它將屏蔽預測視為獨立的; XLNet 避免了這兩個問題。

XLNet的兩流self-attention分離了什麼?

內容流對令牌和上下文進行編碼,而查詢流知道目標的位置但不知道其內容,從而實現無洩漏的預測。

XLNet 是否會物理地打亂句子中的單字?

XLNet 透過注意力遮罩排列預測(分解)順序;原始標記位置透過位置編碼保留。

哪種架構作為 XLNet 的遠端上下文骨幹網路?

XLNet 建立在 Transformer-XL 的基礎上,它添加了分段循環和相對位置編碼來處理長序列。