为 LLM 生成的文本添加水印
当语言模型生成文本时,水印将隐藏的、统计上可检测的信号嵌入到文本中,因此输出随后可以被识别为机器编写的。
概述
It matters for tracing misinformation, academic dishonesty, and AI-generated spam without changing how the text reads to a human.
深入探讨
Kirchenbauer 及其同事提出的最著名的方法适用于采样步骤。先前令牌的散列将词汇表伪随机分割为“绿色列表”和“红色列表”,并且通过向其逻辑添加一个小的偏差来推动模型更喜欢绿色令牌。在整个段落中,带水印的文本包含的绿色标记比机会预测的要多得多,知道秘密哈希的检测器可以运行统计测试(z 分数)来标记它,而无需看到原始提示或模型。 Google DeepMind 的 SynthID-Text 在 Gemini 上大规模部署了相关的锦标赛采样方案。水印权衡三件事:检测强度、文本质量以及编辑或释义的稳健性。
技术洞察
检测不需要访问模型,只需要访问共享秘密和候选文本。检测器重新计算每个位置上哪些标记是“绿色”的,并计算实际出现的数量。在无水印文本的零假设下,绿色标记计数遵循已知的分布,因此高 z 分数会给出可信的、假阳性有界的判决。强度与段落长度相关:短片段很难识别,而长文档则留下清晰的统计指纹。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
法学硕士生成文本水印的未来
随着 SynthID 和政策压力(例如欧盟人工智能法案的透明度规则)的加速采用,水印技术正在从研究转向部署。军备竞赛是真实存在的:释义、翻译和标记级编辑可以削弱或去除水印,因此未来的方案旨在实现与含义而不是表面标记相关的鲁棒性和语义水印。悬而未决的问题包括标准化跨供应商的检测器、防止伪造或欺骗,以及水印是否能够在顽固的对手面前幸存下来。
现实世界的实施
模型提供商在其 API 输出上标记,以便稍后可以检测病毒文本是否来自其自己的系统
学校和出版商检查提交的人工智能生成统计绿名单签名
大规模标记由人工智能生成的协调垃圾邮件或 astroturfing 活动的平台
Google DeepMind 的 SynthID-Text 标记 Gemini 响应,以便下游可以识别它们
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Watermarking LLM-Generated Text quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Watermarking LLM-Generated Text?
当语言模型生成文本时,水印将隐藏的、统计上可检测的信号嵌入到文本中,因此输出随后可以被识别为机器编写的。在不改变人类阅读文本的方式的情况下,追踪错误信息、学术不诚实和人工智能生成的垃圾邮件非常重要。
在绿名单/红名单方案中,水印是如何嵌入的?
创建词汇表的伪随机绿色/红色分割,并且模型的逻辑被推动以支持绿色标记,留下统计信号。
检测器需要什么才能测试水印?
检测仅需要用于导出绿色列表的秘密和文本本身,而不需要模型或提示。
为什么短文本片段比长文档更难标记?
绿色代币盈余是一种统计效应;更多的标记会产生更强的 z 分数和更自信的判断。
哪个现实世界的系统大规模地为 LLM 文本添加水印?
SynthID-Text 使用锦标赛采样水印方法,并已部署在 Gemini 上。
削弱或删除文本水印的已知方法是什么?
由于许多水印存在于表面标记选择中,释义、翻译或编辑可能会破坏绿色标记模式。