媒体取证评测指标解读:如何谨慎看待检测结果
NIST 的 OpenMFC 到底在评测什么
美国国家标准与技术研究院(NIST)运营着一个名为 Open Media Forensics Challenge(OpenMFC)的公开评测系列,用来评估和衡量媒体取证算法与系统的能力。NIST 在 2020 年为 OpenMFC 启动了排行榜评测平台,这项工作延续自 DARPA MediFor 项目下 2017 至 2020 年间的 Media Forensics Challenge(MFC)评测。项目目标包括公开挑战赛、基准数据集和评测基础设施,用来衡量自动化工具在图像和视频篡改检测与定位上的表现——不只是判断一个文件是否被篡改,还要判断篡改发生在哪里、属于哪种类型。该项目也涵盖 GAN(生成对抗网络)篡改检测任务。
该页面介绍了评测框架及其目标。需要最新排名或近期分数时,应直接核对 NIST 当前资料,不要从这份页面中推断。
一个评测指标,不等于对你这份文件的判决
像 OpenMFC 这样的评测项目,目的是在基准数据集上衡量算法整体表现。这和「我手上这一个文件是不是被篡改过」是两个不同的问题。基准结果能告诉你某一类方法在测试集上通常表现如何,但它本身并不能告诉你眼前这张图片或这段视频到底发生了什么。
这个区别之所以重要,是因为包括 DeepFakeCheck 这类给出概率性风险信号的检测工具在内,任何自动检测器都可能出现误报(把真实内容标记为篡改)和漏报(放过实际被篡改的内容)。基准测试上的整体准确率数字,并不能保证某一次具体的检测结果是对的;任何工具给出的单一分数,都应该被当作需要进一步核查的线索,而不是已经写好的结论。
读懂一份检测结果:来源、语境、原始文件和其他证据
检测分数只是众多依据之一,不是全部证据。在把一份结果当真之前,值得先核对几件事。
文件从哪里来? 一个来自陌生账号转发的副本,可信度低于能追溯到拍摄者或发布机构本人的文件。如果手中只有截图、二次上传或压缩副本,应记录这一限制,并尽量寻找原始文件。
周围的语境是否成立? 声称的日期、地点或事件,能否与其他独立报道或记录对上。文件本身即使真实,附带说法仍可能有误,因此需要单独核对。
能不能拿到原始文件? 条件允许时,先设法找到或索要原始文件;如果只能拿到下游转发的副本,也要在核查中注明这一点。
其他信号说了什么? 元数据、内容凭证一类的来源信息、最早发布该素材的媒体的报道,以及检测工具给出的结果,各自覆盖的是不同的一块拼图,单独任何一项都不足以下定论。
把文件上传到 DeepFakeCheck,能拿到其中一项信号:针对图片、视频、音频或文本的概率性判断。它是这套综合核查的一部分,不是用来替代上面这些来源和语境工作的。
这份记录仍然值得参考
OpenMFC 是一个有参考价值的样本,说明一个正式的媒体取证评测项目实际衡量的是什么:检测表现、篡改定位能力,以及对包括 GAN 生成在内的多种篡改方式的覆盖,测试都在专门搭建的评测基础设施和基准数据集上完成。它不能告诉你今天收到的这一个具体文件是不是真的。每当有人拿一个单一分数当作最终答案时,记住这一层差距。
来源
- NIST,Open Media Forensics Challenge(OpenMFC):https://www.nist.gov/itl/iad/mltg/open-media-forensics-challenge