重画一遍,水印就没了:AI 编辑器的「重建瓶颈」正在洗掉隐形水印

🧠 大模型影像论文精读 · 2026-09-02 · Watermarking · Image Editing · Foundation Models · Provenance · Image Forensics
arXiv 2026-09 · 隐形水印鲁棒性评测与生成图像溯源
图片来源:Yang et al., arXiv:2609.01249

这篇论文的结论一句话就能说完:把一张带隐形水印的图丢给商用 AI 编辑器,只说一句「照着这张图重建一下」,水印就再也解不出来了——提示词里甚至不需要出现「水印」两个字。

考纲之外的一道工序

先说隐形水印是什么。它是藏在像素里的一串「条形码」:人眼看不出痕迹,检测端拿着密钥就能读出一串比特,用来证明这张图出自哪家模型、有没有被动过。平台拿它识别 AI 内容,新闻机构拿它追图源。

所以水印研究的第一要务一直是「扛折腾」:图被压缩、截图、缩放、加噪之后,码还得读得出来。二十多年下来,评测考纲基本固定——压缩、模糊、噪声、裁剪、去噪。这套考纲有个共同前提:不管怎么折腾,图还是「同一张图」,没有人重新画它。

卡点就在这。现在真实的图像工作流里多了一道高频工序:图片进大模型编辑器过一遍——修图、扩图、风格化,或者干脆就是「帮我照着画一张」。这道工序既不是压缩也不是噪声,旧考纲里没有对应科目。

一句重建提示,码就没了

这篇论文(arXiv:2609.01249)把这道工序做成了正式测试:三种公开的学术水印方案(从经典的 DCT 域方法 DwtDct 到学习型解码器 RivaGAN),六个商用编辑模型(OpenAI 的 GPT Image 系列与 Google 的 Nano Banana 系列),一百张 MS-COCO 图,共一千八百个输出。提示词只要求保持物体、布局、尺寸、亮度和色彩统计,然后重建这张图。

结果分两层。第一层不出意料:攻击性强的模型直接把水印打到接近瞎猜——GPT Image 1 的误码率(BER:把藏进去的比特串读出来时读错的比例,0 是完好无损,0.5 等于扔硬币)达到 0.48。第二层才是论文真正的发现:Nano Banana 2 重建的图保真度非常高,画面几乎没动,DwtDct 的水印照样读不出来(BER 0.41)。这不是「图被改糊了所以码丢了」,而是重画这个动作本身把码洗掉了。提示词消融给了旁证:把所有涉及隐藏信息的措辞全删掉,BER 变化不超过 0.0023。

作者把机制概括成「重建瓶颈」(reconstruction bottleneck):编辑器内部会把图压成一个中间表示,这个表示对「看懂这张图」是够用的,对「恢复水印比特」是不够用的——模型看着原图生成新图时,水印载体根本没进入生成过程。信息论的上限摆在那里:瓶颈处丢掉的信息,后面无论怎么优化都救不回来,误码率必然滑向 0.5。

https://arxiv.org/html/2609.01249v1/Figures/attack_grid.png

谁该紧张

水印研究者:评测协议该加一条必测项——过一遍基础模型。今天所有水印论文的鲁棒性表格里都缺这一列。

平台与标准组织:C2PA 这类内容凭证(给图片附一张可验证「出厂证明」的标准)在论文采样的两百个输出里都还在,但它救不回已经被洗掉的原始水印。作者的建议是把授权与溯源跨变换绑定,而不是指望每个环节重新盖章。

相机与手机影像:夜景融合、AI 消除这类内置生成处理正在成为出厂标配。测试清单里该多一行:自家管线过一遍自家水印,码还在不在。图库与新闻审核同理——既然重画一遍就能洗掉标记,审核侧就不能只押注像素级水印这一层。

局限与存疑

一百张图的规模不算大,且只测了学术开源方案——商用闭源水印拿不到解码器,未测。所有调用固定在 1024×1024 分辨率,这一步重采样本身会引入多少「尺寸效应」,论文分不干净。防御部分只给了方向,没有可跑的方案。

水印社区过去二十年把「扛压缩」练到了极致。这篇论文提醒的是:考纲换了。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读