ELMo 上下文嵌入
ELMo(语言模型嵌入)是 2018 年的一项突破,它为每个单词提供了由其句子形成的表示,因此“河岸”中的“银行”与“储蓄银行”中的“银行”不同。它标志着从静态词向量到上下文感知 NLP 的转变。
深入探讨
ELMo 由艾伦人工智能研究所 (Peters et al., 2018) 推出,通过在十亿单词语料库上训练的深度双向 LSTM 语言模型运行句子来生成单词表示。与 Word2Vec 或 GloVe 为每个单词分配一个固定向量不同,ELMo 会根据周围的上下文为每个单词计算一个新的向量。至关重要的是,ELMo 通过学习的、特定于任务的权重结合了所有内部 LSTM 层,而不是仅使用顶层。较低层倾向于捕获语法(词性、结构),而较高层则捕获语义和词义。将 ELMo 添加到现有模型中,在六个基准任务中产生了巨大的收益,包括问答、情感分析和命名实体识别。
技术洞察
ELMo 堆叠了两个 LSTM:一个预测下一个单词的前向语言模型和一个预测前一个单词的后向语言模型,每个模型都基于字符级 CNN 输入(因此它可以处理未见过的单词)。对于下游任务,ELMo 使用 softmax 归一化权重和标量来折叠层表示,所有这些都是在微调期间学习的。这意味着每个任务都可以决定需要从冻结的预训练 biLM 中获得多少句法信号和语义信号。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
ELMo 上下文嵌入的未来
ELMo 的核心思想,即来自语言模型预训练的上下文表示,已成为基础,但其循环 LSTM 架构很快就被基于 Transformer 的模型(例如 2018 年底的 BERT)所掩盖,BERT 可以并行读取整个句子,并且扩展性更好。如今,ELMo 主要具有历史和教育意义,尽管字符 CNN 输入处理和层加权思想仍然影响着资源匮乏和形态丰富的语言中的专门嵌入工作。
现实世界的实施
改进命名实体识别系统,该系统必须根据周围的单词判断“华盛顿”是指个人、州还是城市
通过捕获“生病”在“我感觉不舒服”中表示消极但在俚语“那生病了”中表示积极来促进情绪分析
通过将上下文相关的标记向量输入阅读器来增强 SQuAD 基准的问答系统
在机器翻译中消除词义歧义,以便像“植物”这样的多义词可以在给定的上下文中正确翻译
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the ELMo Contextual Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is ELMo Contextual Embeddings?
ELMo(语言模型嵌入)是 2018 年的一项突破,它为每个单词提供了由其句子形成的表示,因此“河岸”中的“银行”与“储蓄银行”中的“银行”不同。它标志着从静态词向量到上下文感知 NLP 的转变。
ELMo 和 Word2Vec 等早期嵌入之间的主要区别是什么?
ELMo 产生上下文嵌入:单词的向量根据周围的句子而变化,这与 Word2Vec 每个单词的单个固定向量不同。
ELMo 使用什么神经架构来阅读文本?
ELMo 建立在作为语言模型进行训练的深度双向 LSTM 之上,循环处理序列。
ELMo 如何结合其内部层来执行下游任务?
ELMo 学习特定于任务的 softmax 归一化权重来组合所有 biLM 层,让每个任务根据需要强调语法或语义。
ELMo 使用什么作为输入单元来处理未见过的单词?
ELMo 从字符级 CNN 构建单词输入,因此它可以表示训练期间从未见过的单词。
ELMo 大约是什么时候由谁引入的?
ELMo 由 Peters 等人于 2018 年发布。艾伦人工智能研究所 (AI2)。