译自英文

AI水印技术将可检测信号嵌入AI生成的文本、图像、音频或视频中,以便日后识别该内容为机器生成,通常对人类不可感知。

AI水印技术指的是将可检测信号嵌入由AI系统生成的内容(如文本、图像、音频或视频)中的技术,以便日后识别该内容为机器生成。与叠加在图像上的可见水印不同,大多数AI水印方案旨在对人类不可感知,同时仍可通过匹配算法进行统计检测,并且在某些设计中,对裁剪、压缩或改写等常见编辑操作具有鲁棒性。

自2022年起,随着更广泛的生成式AI热潮,AI水印技术引起了广泛关注,这主要源于对低质量合成内容充斥互联网、与选举相关的深度伪造以及学术和新闻诚信的担忧。相关政策讨论中也提到了AI水印,包括2023年白宫关于AI的自愿承诺,以及欧盟人工智能法案中对合成内容的透明度要求。

技术方法

对于文本,水印方案通常通过对大型语言模型的下一个词元采样进行微妙的偏置来实现,例如在每一步生成时,偏向于从相似概率的标记中伪随机选择的子集,这种模式对读者不可见,但在使用相同伪随机密钥的情况下,可以通过统计算法检测出来。对于由文本到图像文本到视频模型生成的图像和视频,谷歌深度思维于2023年推出的SynthID在生成过程中或生成后将信号直接嵌入像素值中,该信号能够抵抗缩放或压缩等常见变换,而不会明显改变图像。音频水印类似地将信号嵌入到人类通常感知不到的频率范围内。

局限性

水印技术面临着重大的技术和应用挑战。文本水印通常可以通过改写、翻译或要求另一个模型重写内容来去除,并且检测可能会对人类撰写的、恰好符合统计模式的文本产生误报。水印只有在生成系统选择应用时才有效,这意味着开源或修改过的模型可以直接省略水印步骤,并且没有任何方案能够证明对试图去除水印的顽固攻击者具有鲁棒性。截至2025年,各提供商对水印的采用仍不一致,包括谷歌和Meta在内的一些公司将其部署在自家的图像和视频生成器中,而整个行业范围内的广泛互操作标准仍在制定中。

相关方法

AI水印经常与内容来源标准(如C2PA框架)一起讨论,有时也会混淆。C2PA框架附加了描述图像编辑历史的加密签名元数据,这是一种互补而非竞争的方法,因为元数据可以通过重新保存文件来去除,而强大的像素级水印可能会在重新保存后保留下来。随着模型越来越多地使用从网络抓取的数据进行训练,区分真实的训练数据合成AI输出对于防止未来模型性能下降也变得越来越重要,这也是除虚假信息之外,来源认证和水印工作的另一个动机。

分类:ai-safety·content-provenance
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史