如何解读深度伪造基准测试:它能说明什么,不能说明什么
先确认基准测试回答的是什么问题
看到基准测试结果,人们很容易直接下结论:某个系统分数更高,所以它判断任何图片或视频真假的能力都更强。这个结论超出了证据范围。基准测试衡量的是系统在特定评测中的表现。使用结果前,应先确认评测要求系统完成什么任务。
NIST 将 Open Media Forensics Challenge Evaluation(OpenMFC)描述为一项开放评测,用于评估和衡量媒体取证算法与系统的能力。其公开页面说明,评测重点包括自动检测图像与视频是否被篡改,以及定位篡改区域、识别篡改类型。OpenMFC 也支持 GAN 篡改检测任务。
这些信息界定了评测对象,却没有给出适用于所有检测器、所有篡改手法和所有文件的统一准确率。阅读结果时,问题需要收窄到:这项评测通过哪个任务衡量了什么能力?
先读任务范围,再看结果
先确认任务名称和输出内容。篡改检测、区域定位与篡改类型识别回答的是不同问题,不能把其中一项的结果直接当成另一项的证据。如果表格或排行榜按任务划分,自己的记录也应保留这种区分。
然后查找定义评测的材料。NIST 说明 OpenMFC 提供基准数据集和评测基础设施,并引导参与者访问项目网站。公开页面还写明,申请 NIST 发布的数据集需要注册网站并完成许可协议。正在阅读的结果如果引用了其他说明文件,就从文件中核对数据、任务和结果的适用范围。无法读取这些细节时,应把它记为信息缺口,不要自行补全。
还要确认结果属于 OpenMFC,还是此前的其他项目。NIST 说明,OpenMFC 建立在为 DARPA MediFor 项目开发的 Media Forensic Challenge 评测经验之上。名称相近不代表不同评测可以混用,引用结果时应保留对应的项目名称。
以上阅读顺序是本文提出的操作建议。NIST 负责说明项目与任务,但没有提供本文的判断流程,也没有声称某项基准结果能够裁决单个文件的真伪。
把系统表现与单个文件判断分开
基准测试结果描述系统在该评测中报告的表现。检查单个文件时,需要回答另一个问题:这张图片或这段视频有哪些证据,目前可以据此采取什么行动?基准结果可以作为了解系统的背景资料,不能直接写成该文件的鉴定结论。
检查可疑文件时,尽量保留原文件,并记录文件从哪里获得、由谁提供、与什么说法一起传播。核对可信发布者或原始账号是否提供了同一份材料及其上下文,再查看文件现有的来源凭证。这些动作不需要猜测文件对应排行榜里的哪一行。
如果使用检测器,把输出结果与文件及其他证据放在一起。自动检测会出现误报和漏报:真实材料可能被标成可疑,篡改材料也可能没有被识别。高风险信号意味着需要继续核查;低风险信号不能证明文件真实。
留下一份别人可以复核的记录
准备引用某项基准结果时,记录项目名称、任务、来源 URL 和正在讨论的具体结果,并注明查阅日期。如果结果依赖自己无法读取的表格或文件,应明确写出限制。范围清楚的短记录,比无法复核的笼统结论更有用。
单个文件的核查记录应另行保存,包括原文件或现有最佳副本、来源和相关说法、可用的来源证据、检测输出以及最终人工判断。分开记录可以避免系统层面的结果在不知不觉中变成单个文件的证明。
DeepFakeCheck 可以分析保存下来的图片、视频、音频或文本文件,并返回概率性风险信号。它不会复现 OpenMFC 评测,不能确认文件提供者身份,也不能证明画面中的事件真实发生。应把检测结果作为文件核查的一项材料,而不是用它替代来源验证。
使用基准结果,但不把决定交给它
只在评测注明的任务范围内比较,基准测试才有明确用途。它可以帮助读者了解评测了什么任务,并找到报告结果所依据的项目资料。把排名或分数扩大成对无关文件、任务或条件的保证,就越过了证据边界。
行动前,先判断眼前证据说的是受评系统,还是某个具体文件。说明系统时,引用准确的项目与任务;判断文件时,记录来源、上下文、来源凭证和检测输出。如果现有证据无法回答面前的问题,就暂不下结论,继续核实。
实际使用时可以守住一条边界:基准证据可以帮助选择工具、安排复核,但对某个文件作出的决定必须依据该文件自身的证据。
来源
- NIST,Open Media Forensics Challenge Evaluation:https://www.nist.gov/itl/iad/mltg/open-media-forensics-challenge