Sida:社交媒体图像深度伪造检测、定位与解释

2026.03.24

Sida:社交媒体图像深度伪造检测、定位与解释

1. 任务简介

本次汇报介绍 CVPR 2025 论文《Sida: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal Model》。工作面向社交媒体图像,尝试在一个统一框架中完成图像真伪与类别识别、篡改区域定位和自然语言解释。

2. 研究动机

高质量生成模型降低了合成图像的辨别难度,社交媒体又为虚假内容传播提供了高频场景。已有研究常聚焦人脸伪造,或只提供真伪二分类、区域定位中的单一能力,难覆盖多样的非人脸社交媒体内容。现有数据集也可能依赖较旧的生成技术和简单场景,无法充分反映真实传播环境中的鉴伪需求。

3. 方法设计

Sida 构建 SID-Set 数据集,包含真实、合成和篡改图像,并为多类别检测、定位和文本解释提供支持。模型以大型视觉语言模型为基础,联合图像内容与语言描述,利用统一任务建模完成不同粒度的鉴伪输出。检测模块判断图像类别,定位模块给出可疑区域,解释模块将判断依据转化为可读文本。

4. 实施细节

报告重点分析了社交媒体图像与传统人脸数据的差异,包括对象类别更开放、编辑方式更多样以及图像传播链路更复杂。SID-Set 的构建通过平衡真实、合成和篡改样本,使模型能够学习不同伪造类型的视觉线索。多模态框架将视觉表示、任务指令和解释生成相结合,避免把检测结果局限为缺乏依据的二元标签。

5. 实验与结论

实验表明,Sida 在 SID-Set 上能够兼顾检测、定位和解释,并在其他基准上展示一定泛化能力。报告认为,面向真实社交媒体的鉴伪系统需要同时回答“是否伪造”“哪里伪造”与“为何判断为伪造”。未来挑战包括对新型生成模型的适应、跨平台数据偏移、解释的真实性以及大模型推理成本。

本次组会演示文稿下载