語言人工智慧指南

ELMo 上下文嵌入

ELMo(語言模型嵌入)是 2018 年的一項突破,它為每個單字提供了由其句子形成的表示,因此「河岸」中的「銀行」與「儲蓄銀行」中的「銀行」不同。它標誌著從靜態字向量到上下文感知 NLP 的轉變。

閱讀時間約2分鐘最後更新

深入探討

ELMo 由艾倫人工智慧研究所 (Peters et al., 2018) 推出,透過在十億單字語料庫上訓練的深度雙向 LSTM 語言模型運行句子來產生單字表示。與 Word2Vec 或 GloVe 為每個單字分配一個固定向量不同,ELMo 會根據周圍的上下文為每個單字計算一個新的向量。至關重要的是,ELMo 透過學習的、特定於任務的權重結合了所有內部 LSTM 層,而不是只使用頂層。較低層傾向於捕獲語法(詞性、結構),而較高層則捕獲語義和詞義。將 ELMo 添加到現有模型中,在六個基準任務中產生了巨大的收益,包括問答、情緒分析和命名實體識別。

技術洞察

ELMo 堆疊了兩個 LSTM:一個預測下一個單字的前向語言模型和一個預測前一個單字的後向語言模型,每個模型都基於字元級 CNN 輸入(因此它可以處理未見過的單字)。對於下游任務,ELMo 使用 softmax 歸一化權重和標量來折疊層表示,所有這些都是在微調期間學習的。這意味著每個任務都可以決定需要從凍結的預訓練 biLM 中獲得多少句法訊號和語義訊號。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

ELMo 上下文嵌入的未來

ELMo 的核心思想,即來自語言模型預訓練的上下文表示,已成為基礎,但其循環 LSTM 架構很快就被基於 Transformer 的模型(例如 2018 年底的 BERT)所掩蓋,BERT 可以並行讀取整個句子,並且擴展性更好。如今,ELMo 主要具有歷史和教育意義,儘管字元 CNN 輸入處理和層加權思想仍然影響著資源匱乏和形態豐富的語言中的專門嵌入工作。

現實世界的實施

改進命名實體識別系統,該系統必須根據周圍的單字判斷「華盛頓」是指個人、州還是城市

透過捕捉「生病」在「我感覺不舒服」中表示消極但在俚語「那生病了」中表示積極來促進情緒分析

透過將上下文相關的標記向量輸入閱讀器來增強 SQuAD 基準的問答系統

在機器翻譯中消除詞義歧義,以便像“植物”這樣的多義詞可以在給定的上下文中正確翻譯

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the ELMo Contextual Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is ELMo Contextual Embeddings?

ELMo(語言模型嵌入)是 2018 年的一項突破,它為每個單字提供了由其句子形成的表示,因此「河岸」中的「銀行」與「儲蓄銀行」中的「銀行」不同。它標誌著從靜態字向量到上下文感知 NLP 的轉變。

ELMo 和 Word2Vec 等早期嵌入之间的主要区别是什么?

ELMo 产生上下文嵌入:单词的向量根据周围的句子而变化,这与 Word2Vec 每个单词的单个固定向量不同。

ELMo 使用什麼神經架構來閱讀文字?

ELMo 建立在作为语言模型进行训练的深度双向 LSTM 之上,循环处理序列。

ELMo 如何结合其内部层来执行下游任务?

ELMo 学习特定于任务的 softmax 归一化权重来组合所有 biLM 层,让每个任务根据需要强调语法或语义。

ELMo 使用什么作为输入单元来处理未见过的单词?

ELMo 从字符级 CNN 构建单词输入,因此它可以表示训练期间从未见过的单词。

ELMo 大約是什麼時候由誰引進的?

ELMo 由 Peters 等人於 2018 年發行。艾倫人工智慧研究所 (AI2)。