掩码语言建模
蒙面语言模型教导人工智能使用完整的周围上下文(左右)来填充故意隐藏的单词。
概述
It's the training trick behind BERT and the reason models can deeply understand sentence meaning rather than just predict what comes next.
深入探讨
在掩码语言模型 (MLM) 中,您取一个句子,用特殊的 [MASK] 符号随机隐藏其约 15% 的标记,并训练模型猜测原文。由于该模型可以看到每个空白两侧的单词,因此它可以建立对上下文的双向理解。 Google 在 2018 年推出的 BERT 使这一点得以普及。一个巧妙的细节:在被屏蔽的位置中,大约 80% 变成了 [MASK],10% 被交换为随机单词,10% 保持不变。这可以防止模型在预测时只期望 [MASK] 令牌并增强鲁棒性。经过预训练后,模型将针对分类、问答和命名实体识别等任务进行微调。
技术洞察
MLM 使用具有双向自注意力的 Transformer 编码器,因此每个令牌都会同时关注所有其他令牌。仅使用相对于真实令牌 ID 的交叉熵在屏蔽位置上计算损失。因为注意力是非因果的(没有未来的屏蔽),所以每个单词的表示将左右上下文融合成一个密集向量。这种双向性正是下一代代币模型为了生成能力而放弃的东西。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
掩码语言建模的未来
纯传销在一定程度上被聊天机器人的生成解码器模型所掩盖,但它在嵌入、检索和分类方面仍然占主导地位,其中理解胜过生成。 RoBERTa、ELECTRA 的替换令牌检测和 DeBERTa 等变体不断提高准确性和效率。预计 MLM 式编码器将继续成为搜索、语义相似性的核心,并作为大型检索增强和多模态系统中的轻量级组件,在这些系统中,快速、深入的理解比自由格式的文本更重要。
现实世界的实施
支持 Google 搜索对对话查询的基于 BERT 的理解,以返回更多相关页面。
为语义搜索和文档检索系统生成句子嵌入。
微调 BERT,以进行产品评论或支持请求的情感分析。
命名实体识别,从法律或医学文本中提取人员、组织和日期。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Language Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Masked Language Modeling?
蒙面语言模型教导人工智能使用完整的周围上下文(左右)来填充故意隐藏的单词。这是 BERT 背后的训练技巧,也是模型能够深入理解句子含义而不仅仅是预测接下来会发生什么的原因。
掩码语言建模的核心训练任务是什么?
MLM 隐藏了一小部分令牌,并训练模型以使用左右上下文来恢复它们。
BERT 在预训练期间通常会屏蔽大约百分之多少的标记?
BERT 屏蔽了大约 15% 的输入标记,在提供足够的信号和留下足够的上下文之间取得平衡。
为什么MLM给予模型双向理解?
Transformer 编码器使用非因果自注意力,因此每个令牌都可以看到两侧的所有其他令牌。
在 BERT 的掩码方案中,大约 10% 的选定位置会发生什么而不是变成 [MASK]?
为了提高鲁棒性,10% 的屏蔽位置被交换为随机标记,10% 保持不变。
传销损失是在哪些头寸上计算的?
交叉熵损失仅应用于屏蔽位置,将预测与原始令牌 ID 进行比较。