ACM Multimedia 2026 Oral|从「转述痕迹」到「看见证据」:ForgeryVCR用视觉中心推理重塑图像取证范式

栏目:互联网 | 来源:机器之心Pro | 2026-09-21 20:06

随着编辑工具与生成模型的快速普及,「改图」正在变得越来越容易,篡改者可以在几乎不改变画面观感的前提下完成内容伪造,给内容真实性核验、平台治理与数字媒体信任带来新的风险。因此,图像取证与可信鉴伪证据,成为了内容安全中尤为重要的一环。

近年来,多模态大模型凭借视觉理解与推理能力,逐渐成为图像取证的重要技术路线。现有主流方法采用文本中心的推理范式:先用自然语言描述异常,再根据这些描述判断图像是否被篡改。然而,图像篡改的关键证据通常隐藏在细微的低层视觉痕迹中,既难以被偏重高层语义的视觉编码器准确感知,也难以通过语言完整表达。当模型被迫先把「看到了什么」转述成文字、再据此判别图像真伪时,信息损失与语义偏见便可能使描述偏离真实痕迹,甚至将无关的场景内容误认成伪造证据。

针对这一问题,腾讯优图实验室深圳大学的研究者提出了ForgeryVCR:一个将取证工具箱、视觉中心推理与策略性工具学习统一到同一闭环的取证智能体框架,推动图像篡改检测与定位从「依赖文本描述取证痕迹」转向「基于显式视觉证据推理」的新范式。相关论文已被ACM Multimedia 2026录用,并入选Oral Presentation

  • 论文标题:ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization
  • 论文链接:https://arxiv.org/abs/2602.14098
  • 项目主页:https://youqiwong.github.io/projects/ForgeryVCR
  • 代码链接:https://github.com/youqiwong/ForgeryVCR
  • 论文机构:腾讯优图、深圳大学

一、研究背景

从「文本推理」到「视觉推理」

在图像取证任务中,SAFIRE、TruFor 等传统深度取证网络擅长捕捉频域、噪声残差中的低层统计异常。不过,真假分数或掩码本身很难解释「为什么假」,对固定特征分布的依赖,也限制了它们对未见篡改方式的泛化。FakeShield、SIDA 等方法尝试借助多模态大模型改善这些问题,但采用的仍是文本中心的 Chain-of-Thought(CoT):模型需要先用自然语言写出推理过程。对于像素级的细微不一致,文字很难保留完整的低层信号。再加上现有 MLLM 架构更关注高层语义,对低层取证特征不敏感,模型便可能依赖场景内容做判断,出现把无关上下文误认作伪造证据的语义幻觉。

四种推理范式对比 :(a) 取证特征驱动缺乏可解释性与泛化性、(b) 文本中心 CoT 易产生语义幻觉、(c) 视觉 - 文本混合描述仍模糊、(d) ForgeryVCR 的视觉中心范式同时得到显式视觉证据与无幻觉判决

因此,ForgeryVCR 通过「视觉中心推理」的范式将低层取证感知能力引入到鉴伪智能体框架里,具体包括三个方面:

(1)痕迹可见化。把不可见痕迹物化为显式视觉证据:模型执行轻量代码,调用空间域、频域、噪声域算子以及局部裁剪工具。压缩历史、噪声残差和频域能量中原本难以察觉的不一致,由此变成视觉编码器能够处理的中间图像。

(2)判决可溯源。让结论直接建立在视觉证据之上:工具生成的证据以图像形式返回模型,直接参与后续判断,减少低层信号转述为文字时的信息损失。读者也可以查看这些中间图像,核验结论所依据的痕迹。

(3)调用自适应。只在能带来决定性证据时才调用工具:增益驱动的轨迹合成为 SFT 冷启动提供训练数据,GRPO 阶段再通过工具效用奖励训练调用策略。模型据此学习按样本复杂度安排工具链:简单样本直接判断,需要更多证据时再调用有帮助的工具,减少冗余操作。

二、方法设计

1. 取证工具箱:

现有 MLLM 视觉编码器的预训练与对齐主要关注物体、场景及其语义关系,篡改留下的细粒度异常并不容易被识别。为弥补这一缺口,ForgeryVCR 引入混合取证工具箱,将难以被视觉编码器直接捕捉的隐蔽取证线索转化为显式视觉中间表征,并将其重新输入 MLLM,为后续取证推理提供可感知、可核验的视觉证据。

在工具选择上,我们同时考虑取证线索的覆盖性、视觉响应的可感知性以及不同工具间的互补性。候选工具包括 ELA、NPP、PSCC、SRM、CFA、FFT、DCT、VAE 重建残差和 Zoom-In。我们通过轻量级 SFT 分别评估单个工具和工具组合的收益,最终保留 ELA、FFT、NPP 与 Zoom-In,形成覆盖压缩、频率、噪声与局部细节信息的必要且具有较强正交性的工具组合。

候选取证工具在多类篡改与真实图像上的可视化对比

2. 轨迹合成:增益驱动的工具选择与多样化推理路径

要让模型学会「该不该调工具、调哪个、按什么顺序调」,关键在于训练轨迹如何构造。我们在冷启动训练集上设计了如下流程:

(1)Gain-Driven Tool Selection(增益驱动的工具选择):先在冷启动训练集上分别训练「无工具基线」和 ELA / NPP / FFT / Zoom-In 对应的「单工具专家」,再逐个样本比较表现。工具结果只有同时超过基线性能与固有质量下限,才会被保留,并按性能增益从高到低排成工具链。没有工具满足条件时,工具链为空,模型直接用原始图像进行判别。

(2)Multi-Trajectory Synthesis(多轨迹合成,MTS):为给模型提供不同的调用选择,我们从排序后的工具链中保留 top-K,构造不调用工具、调用单个工具和通过多个工具累积证据的推理路径,并平衡 SFT 阶段各类路径的数据。

(3)Intractable Sample Removal(难解样本剔除,ISR):剔掉所有模型都判不对的疑难样本,提升冷启动数据质量。

轨迹合成 Pipeline:增益驱动的工具选择 → 多轨迹生成

3. 策略性工具学习:让模型自己决定「该用哪个工具」

ForgeryVCR 采用两阶段训练策略:

(1)阶段一(SFT 冷启动):以上述增益驱动得到的工具链与多轨迹合成数据做监督微调,让模型学会按样本复杂度选择「不调工具 / 单工具 / 多工具累积证据」的推理路径。

(2)阶段二(GRPO + 工具效用奖励):继续在 GRPO 框架下进行强化学习。奖励包括分类奖励 Rcls、定位奖励 Rloc 和工具效用奖励 Rtool。工具效用奖励针对工具提取有效痕迹、帮助模型正确判断的调用给予正向反馈,以减少冗余调用。

ForgeryVCR 整体框架:SFT 冷启动 → GRPO 强化学习 → 工具调用推理链

RL 训练初期,模型会尝试较多工具。随着训练推进,模型从早期「盲目尝试工具」快速收敛到「按需调用关键工具」,工具调用轮数逐渐下降,检测与定位精度则继续提高,模型开始更有选择地调用工具。

RL 训练动态:奖励持续上升,工具调用轮数同步下降,工具调用策略从「盲目尝试」收敛到「按需调用」。

三、实验结果

1. 主流基准泛化性测试

我们在 9 个图像取证公开基准上对比了 ForgeryVCR与专用取证网络、其他 MLLM 取证方法的性能,评估图像级检测(F1 / ACC)、区域级定位(B-IoU)与像素级定位(P-IoU)。按加权平均计算,ForgeryVCR 在这些对比方法中表现最好:相对于各项指标中此前表现最优的对比方法,图像级检测 F1 0.7985(4.91%↑)/ ACC 0.8237(10.00%↑),区域级 B-IoU 0.3386(23.58%↑)/ 像素级 P-IoU 0.3380(15.24%↑)。

在 9 个公开基准上的图像级检测性能对比,覆盖图像级 F1 / ACC 两类指标

在 9 个公开基准上的定位性能对比,覆盖区域级与像素级两类定位指标

2. 消融与深度分析

2.1 推理模态消融

推理模态消融中,引入视觉中间证据后,检测与定位效果都有提升。结果最好的是不包含文本描述的纯视觉 CoT,加入文本推理反而使性能下降。这组实验支持了我们的设计选择:只保留低层痕迹的视觉形式,让模型直接据此判断。

不同推理模态下的检测与定位性能对比,纯视觉 CoT 取得最佳结果

2.2 工具策略消融

此外,我们比较了固定调用全部工具、使用预设顺序和随机选择工具等策略,它们的整体效果都不及 ForgeryVCR。学习得到的策略会按当前图像选择和排列工具,在减少冗余调用的同时取得更好的检测与定位结果。增加工具数量本身,并不能保证这些收益。

不同工具选择策略下的检测与定位性能对比,自适应选择与排序取得最佳结果

2.3 语义幻觉抑制

在语义幻觉出现的子集上(无关场景上下文被误判为伪造证据):

(1)ForgeryVCR*(带文本 CoT):图像级 F1 = 0.6718 / ACC = 0.5107,像素级 F1 = 0.2844 / IoU = 0.2504

(2)ForgeryVCR(纯视觉 CoT):图像级 F1 = 0.7416 / ACC = 0.6138,像素级 F1 = 0.3234 / IoU = 0.2857

纯视觉 CoT 的四个指标均高于带文本 CoT 的版本:图像级 F1 提升 10.4%、ACC 提升 20.2%,像素级 F1 提升 13.7%、IoU 提升 14.1%。在这组容易受无关场景上下文干扰的样本上,省去语言中间环节后,真假判断和定位都有改善。

ForgeryVCR 在幻觉子集上的提升

2.4 视觉中心推理轨迹

ForgeryVCR 可根据取证线索与样本复杂度构建不同的视觉中心推理轨迹:调用取证工具提取低层异常,通过 Zoom-In 细化可疑区域,或交替执行二者以逐步汇聚多视角证据,最终完成真假判定与篡改定位。

ForgeryVCR 的三类视觉中心推理轨迹

Demo 展示了实际执行过程。模型接收图像后,选择并调用 ELA、FFT、NPP 和 Zoom-In 等工具,查看各工具生成的视觉证据,再给出真假判断、可疑区域的位置和像素级篡改掩码。

视频链接:https://mp.weixin.qq.com/s/BTjB2jbrrVLV-NaapwG-jw

ForgeryVCR 在线 Demo:自主调用取证工具,汇聚多工具视觉证据并输出判别结果与像素级掩码。

四、总结与展望

ForgeryVCR 将图像取证从「依赖文本解释视觉痕迹」推进到「直接基于显式视觉证据进行推理」:通过统一建模痕迹可见化、视觉证据推理与工具调用自适应,ForgeryVCR 不仅能够判断图像是否被篡改,还能指出可疑区域,并减少不必要的工具调用,获得更准确的定位结果。

我们希望这项工作能够为图像取证、内容审核与可信生成系统研究提供新的思路——让模型的判决建立在看得见的证据之上,而不是说得出的描述之上。

主要作者简介

王友琪(Youqi Wang):深圳大学硕士生,在腾讯优图实验室实习期间完成本工作。主要研究方向为 Agent 鉴伪、多模态大模型、图像篡改定位检测。

陈燊(Shen Chen):腾讯优图实验室研究员,本项目负责人。

谭舜泉(Shunquan Tan)、丁守鸿(Shouhong Ding):通讯作者,分别来自深圳大学与腾讯优图实验室。

了解更多

猜你想看

← 返回首页