← 研究笔记English
技术研究 · 2026-08-20 · 13 分钟阅读 · 精研

重新压一遍查得出,重新生成一遍就查不出

2003 年,Shazam 那篇算法论文里作者自己写了一句限定:这套方法「不指望推广到现场录音」。同一个歌手换一场演出,人耳分不出,它能分出来。二十三年过去,这句限定仍然是整个内容查重体系的地基,也是它最大的缺口——所有指纹认的都是那一次具体的实现,不是内容本身。

研究声明

本文查的是内容搬运在技术层怎么运作,以及每一道检测防线的失效边界在哪。数字全部带实验条件:数据集、参考库规模、变换类型、评测口径——脱离条件的单一数字在这个领域没有意义。来源尽量取一手:arXiv 论文原文、开源仓库源码、平台工程博客、标准文本。每条结论标了证据档:【论文实证】【开源可复核】【厂商自述】【机制推理】。本文写机制与公开基准,不写可照做的规避步骤。

一、Shazam 在 2003 年写下的那句限定

Shazam 的构造不复杂:把谱图的局部极大点连成星座图,锚点与目标区内的点两两配对,压成 32 位哈希;判定只看哈希命中之后,相对时偏能不能聚成一条对角线。【论文实证】在 1 万曲测试库、250 次查询、8kHz 单声道的条件下,15 秒样本的 50% 识别率落在 −9 dB 信噪比;整段再过一遍 GSM 编解码,退到 −3 dB。重度失真下只要约 1% 到 2% 的哈希存活就能判定。

耐受度这么高,作者却在同一篇里划了边界:这套方法针对的是「已经在库里的那些声音文件」,「不指望推广到现场录音」,而且「对采样的是哪一个版本非常敏感」。

二十年后的神经指纹换了实现,没换前提。【论文实证】Chang 等在 10 万首、约 5600 万片段的库上,1 秒查询 top-1 命中 62.2%,10 秒 95.6%。但把数据增强从训练里去掉,所有查询长度全部掉到 0.0%。不变性是拿噪声、混响、时偏喂出来的,而增强分布里从来没有「重新演一遍」这一类。

整族信号方法共享同一个前提:待检副本是原信号经过降质之后的产物。重新编码满足这个前提,残差还在;重新生成不满足,输出的像素和频谱不再是原信号的函数。

这一条决定了过去两年的全部技术走向。成本账也算得出来:语音转写 $0.006 一分钟,带唇同步的整片翻译约 $0.24 一分钟,对照本地化厂商公布的人工配音报价 $50 到 200 一个成品分钟。换声加换嘴的边际成本远低于整段重新生成,而在检测口径上两者等价——音轨和嘴部像素一旦被换掉,原声纹指纹和原帧哈希都不再命中。

二、哪些变换查得出,哪些查不出

2023 年 Meta 办了一届视频相似挑战赛,把这件事第一次量清楚了。【论文实证】数据集里测试集 8,015 条查询打 40,318 条参考库,其中 77% 的查询根本没有对应副本,用来制造大海捞针的条件。自监督描述子基线 μAP 60.5%,冠军做到 87.2%

但组织者在论文里加了一句很少见的话:冠军那个「编辑检测」模块是在利用数据集偏置,因为该数据集里所有被复制的查询都含时序编辑,换成更难检测的小幅空间与时间裁剪它就会失效,不是可迁移到生产的方案。冠军自己的成绩也印证了这点,从第一阶段的 0.9176 掉到第二阶段的 0.8717。

难易排序是清楚的。最容易被抓的是变速和插入重复片段这类纯时序变换,因为所有参赛方案都建立在帧级描述子上,时间轴怎么动都不影响单帧长什么样。最难的是把多个视频画面混在一起、以及叠到截图上和裁剪这类增删画面的几何变换。

更硬的边界在泛化。【论文实证】AnyPattern 用 90 个基础变换模式训练、10 个新模式测试,在 100 万图的参考库上,主流描述子的 μAP 从同分布的 72 到 77 掉到 13.7 到 16.2。把训练模式堆到 90 个也只回到 39.79,再加上下文提示到 56.65,仍然远低于同分布。靠一次训练把变换空间封死,在数学上不成立。

2025 年初一篇复核论文发现了另一类问题:采样策略本身就是攻击面【论文实证】主流方案每秒取一帧,采样点确定且公开,于是针对「每秒中间帧」涂黑就能把 μAP 从 0.9343 打到 0.3705,而这个改动人眼几乎看不出来。作者的修复是把采样从固定时间栅格改成按帧间差分曲线的极值取帧,同一攻击下回到 0.8835。同一篇还独立复核出,冠军那个编辑检测模块会把完全没编辑过的原样搬运判成非拷贝。

真实剪辑分布上的成绩更低。【论文实证】蚂蚁集团的 VCSL 收了 16 万对真实侵权视频、28 万条标注片段,四种帧特征乘五种时序对齐算法全排列跑下来,2022 年最好的片段级 F1 是 61.46,到 2024 年提到 71.6——仍有近三成误差。其中动态时间规整的召回只有 29.34%,因为它要求时间轴单调一一对齐,而真实搬运常常是多段不连续拼接、顺序打乱。论文点名的困难样本是综艺画中画和大幅裁剪的鬼畜。

感知哈希这一族的边界,厂商自己写在文档里。【开源可复核】Meta 开源的 TMK+PDQF 文档直言它「对片段匹配弱」,并列出不检测的情形:裁剪、加边框、较重的 logo、把两分钟片段嵌进一小时长视频。它的定位写得很老实,是全片近似匹配,或者更贵算法的前置过滤。

三、水印本该接住重生成,结果被证否了

指纹认的是那一次实现,水印认的是生成端。按理说,水印是唯一对重新生成还成立的一类信号。

理论侧先给了答案。【论文实证】2024 年的一篇工作在「攻击者能访问质量预言机与扰动预言机」这个自然假设下,证明了强水印不可能,并在三种现有方案上实测移除、质量损失轻微。

工程侧的数字更直接。【论文实证】W-Bench 在 512×512、1 万张编辑图上测 11 种水印方案,过一遍 Stable Video Diffusion 之后 TPR@0.1%FPR 全部跌破四成:MBRS 13.55%、StegaStamp 30.85%、TrustMark 39.60%,专门为抗编辑训练的 VINE-Robust 也只有 36.33%。而同一张表里,VINE-Robust 抗随机再生成还有 99.66%

抗噪和抗重新生成是两个能力,前者不蕴含后者。

部署最广的那一族更难看。【论文实证】Stable Diffusion 1.x 到 SDXL 默认调用的频域水印,在 TrustMark 论文的三个基准上,干净图的比特准确率 1.00,过一遍常规噪声组合掉到 0.52——随机猜是 0.50

厂商数字和攻击数字是两把尺,都要看清口径。【厂商自述】Google 的 SynthID-Image 在 30 类非对抗变换上聚合 TPR@0.1%FPR 达 99.98%,组合最坏 98.06%,论文自称已给超过 100 亿张图和视频帧打了水印。同一篇把目标写得很清楚,不是完美安全,是「让黑盒攻击在规模上不划算」。【论文实证】而 2026 年 8 月一篇攻击工作用潜空间操纵,把多种水印方案的比特准确率压到 53.14%,无可见画质损失,明确点名攻破了它。

另一条路是内容凭证。【开源可复核】C2PA 的硬绑定是资产字节的哈希,规范自己写明再编码即产生新的呈现版本、硬绑定必然断开;补救层叫持久内容凭证,用指纹或水印做软绑定去仓库把清单捞回来。所以它的抗搬运能力上限,就是软绑定那一层的抗搬运能力,而软绑定正是上面被打穿的东西。实测层面,一份 2026 年的推特图像数据集报告,X 的 CDN 在上传时系统性剥掉内容凭证。

还有一个方向比移除更麻烦。【论文实证】2024 年之后出现了成熟的伪造攻击:只需要一张带水印的参考图,就能用与目标系统无关的另一个扩散模型把水印印到任意图上。有理论工作把鲁棒性、不可伪造性、公开可验证性放在同一框架里,指出现有方案没有一个三者兼得。含义很实际:检出水印只能当作疑似,不能单独作为来源判定——放过一次搬运和把生成责任按到别人头上,代价不对称。

四、还有两处结构性的限制

第一处在索引侧,是算术问题。【开源可复核】按挑战赛的合规预算,每秒一个 512 维描述子,100 万小时的库就是 36 亿个向量。原始存储 7.37 TB;图索引按公开内存公式要 8.29 TB;压到 64 字节一个向量能降到约 259 GB,但压缩直接吃召回。救命的是时序冗余:判定分取的是帧对的最大内积,所以单帧召回率 30%、拷贝段长 10 秒时,段级召回的上界能到 97%。这解释了为什么激进压缩在长拷贝上仍然可用,也解释了为什么短片段永远最先漏掉。

第二处是跨模态。【开源可复核】视频转图文、语音转文本再改写这类搬运,三层基础设施都接不住:Content ID 匹配的是音视频文件,ISCC 的内容码按模态分别生成,C2PA 的软绑定只覆盖同一资产的派生与再渲染。没有一层定义了跨模态派生。公开评测的水平也对不上需求——端到端视频文字识别在 2023 年的评测里冠军 MOTA 只有 22.44%,而语音转写这条桥虽然已经便宜到 0.04 美元一个音频小时,转写之后仍然要面对改写,那正是下一段的问题。

顺带一提广播场景。【论文实证】BAF 基准专门测「视频里的背景音乐」,74 小时素材音乐配 57 小时电视录音,约八成标注时长是背景音乐,公开系统的秒级 F1 全部低于 0.47。判断「这段视频用没用这首歌」,比判断「用户举着手机在听什么歌」难一个量级。

五、没有终局,只有形态变化

把上面的结果连起来看,这场对抗没有稳定均衡,但均衡的形态在变。早期的目标是做一层打不破的防线,现在的目标改成了两件事:让攻击成本随规模上升,以及让清洗动作本身留下痕迹。

【论文实证】2026 年的取证工作发现,六种主流去水印方法实际上是把水印换成了另一种可检测的信号,独立取证检测器能以超过 98% 的真阳性率区分出「这张图被去水印处理过」。原始标识可能已经不可恢复,但「动过手」这件事在基准上可判。另一条路是跨层审计,用内容凭证声称的信息与像素里的水印互相矛盾来反查,在 3,500 张图上报了 100% 准确——前提是清单还在,对已经被 CDN 剥干净的图无效。

这两条都是 2026 年的预印本,都是离线基准,第三方复现和跨生成器泛化都还没定。攻防节奏按月走,「能检出」通常只领先攻击一个版本。

对做内容的人,这套技术事实指向一个不太舒服的结论:能被自动查出来的,是那些懒得改的搬运。原样重传、简单变速、加个边框,指纹都还认得出。而一旦对方愿意付几美元的模型调用成本重新生成一遍,现有的整族信号方法在结构上就没有理由还能命中。剩下能接住的只有语义级检索,而它在 10 万级库上的成绩是 70% 到 87%,只够做候选召回,支撑不了自动处置。

主要来源(均取一手):Wang, An Industrial-Strength Audio Search Algorithm (ISMIR 2003);Chang et al., Neural Audio Fingerprint for High-Specific Audio Retrieval (arXiv:2010.11910);Pizzi et al., The 2023 Video Similarity Dataset and Challenge (arXiv:2306.09489) 与 A Self-Supervised Descriptor for Image Copy Detection (arXiv:2202.10261);Wang, Sun, Yang, AnyPattern (arXiv:2404.13788);Fojcik & Syga, Counteracting temporal attacks in Video Copy Detection (arXiv:2501.11171);He et al., VCSL (arXiv:2203.02654) 与 Self-Supervised Video Copy Localization (ECCV 2024);Meta ThreatExchange 的 TMK+PDQF 与 PDQ 文档;Zhao et al., Invisible Image Watermarks Are Provably Removable (NeurIPS 2024) 与 Watermarks in the Sand (ICML 2024);W-Bench / VINE (arXiv:2410.18775, ICLR 2025);TrustMark (arXiv:2311.18297);SynthID-Image (arXiv:2510.09263);MarkNull (arXiv:2608.10166, USENIX Security 2026);C2PA Specification 2.2/2.4 与 c2pa-rs 仓库;Black-Box Forgery Attacks on Semantic Watermarks (CVPR 2025);On the Difficulty of Constructing a Robust and Publicly-Detectable Watermark (arXiv:2502.04901);Faiss library (arXiv:2401.08281) 与 Faiss wiki 选型指南;BAF: An Audio Fingerprinting Dataset for Broadcast Monitoring (ISMIR 2022);ICDAR 2023 DSText;Removing the Watermark Is Not Enough (arXiv:2605.09203);Authenticated Contradictions from Desynchronized Provenance and Watermarking (arXiv:2603.02378)。全部载重结论经独立复核;数字均标注实验条件,脱离条件不可外推。

Amos · research.xishe.ai · 转载注明出处