AI 生成的新闻媒体:以来源优先的核查流程
先追来源,再谈检测
一段新闻视频到你手里时,往往已经被剥掉了原始语境。它被截屏、被转发、被加上字幕、经过好几个应用的压缩,才出现在你的信息流里。把这段传播路径还原出来,比追问画面是否由模型生成更靠前。
来源优先的核查,是把文件从哪里来、经过哪些渠道、中途被改动了什么,当作独立的证据来对待,排在任何自动分数之前。一段真实拍摄的视频,如果被套上错误的日期或地点,同样是虚假信息;只看像素真假,拦不住这类问题。
NIST OpenMFC 说明了什么
美国国家标准与技术研究院(NIST)运行着一个面向公众研究者的公开评估系列 OpenMFC(Open Media Forensics Challenge),用来测量图像和视频篡改检测与定位技术的能力。它的公开目标包括推动媒体取证技术的前沿发展,并以基准数据集、评估基础设施和交流论坛支持相关研究。
有两个细节值得带进日常核查。其一,OpenMFC 要求系统不仅判断媒体是否被篡改,还要在可能时指出篡改的区域和类型,这说明非真即假的二分法本身是个粗糙的问题。其二,相关的 MFC 任务包含构建描述图像篡改历史的系谱图(phylogeny graph),以及验证媒体传感器来源。来源与编辑历史被当作取证问题的一部分,而不是附属信息。
OpenMFC 建立在 DARPA 媒体取证(MediFor)项目下 MFC 评估所积累的经验之上,NIST 于 2020 年启动了 OpenMFC 排行榜评估平台。这个项目以能力测量、基准数据集、评估基础设施和反复评估为主要组成。有一点直接关系到新闻核查:NIST 表述该项目聚焦于图像和视频,并未把音频列为评估对象,因此声音轨道需要另做核查。
来源优先的核查步骤
第一步:找到最早出现的时间。 对代表性画面或视频本身做反向搜索,看看是否有更早、用着不同日期或字幕的版本。核对旧视频是否被套上了新事件的日期或字幕;这一步应与合成检测分开进行。
第二步:核对发布账号。 查账号注册时间、历史内容、是否有可追溯的身份。没有任何历史的匿名账号,是放慢判断的理由。
第三步:保存原件和元数据。 保存原始文件,而不是二次截屏的副本。记录可见的元数据,再与最早可追溯的来源交叉核对,不把它单独当作证明。
第四步:独立重建语境。 视频声称的地点、日期、招牌、语言,是否与该事件的其他记录一致?自行核验素材的媒体给出的确认,比转发数量更有分量。
第五步:到这一步再上检测工具。 把媒体上传到 DeepFakeCheck 这类概率性工具,把得到的分数放在你已经做完的来源核查旁边,作为其中一个输入。初次使用无需注册,并提供有限的免费额度。
如何读检测分数:它是概率,不是判决
自动检测器给出的是概率,不是裁定。它会产生误报(把真实内容标记为被篡改)和漏报(漏掉真实存在的篡改)。分数高,是继续调查的提示;分数低,也不等于给文件盖上真实的印章。
要让分数保持诚实,守住两条。让工具匹配媒介:NIST 的项目评测的是图像和视频,而一条新闻里还可能包含音频和文字,这两类内容需要另行核查。再权衡每种错误对你这次决定的代价:把被篡改的片段当真发出去,和把真实片段错骂成假的,是后果不同的两种失败。
证据不足时该怎么做
有时候来源查不到,语境没法确认,分数又卡在模棱两可的中间。这个结果本身就是信息:它意味着你还没有足够依据去扩散这条内容。暂缓转发、标注为未经核实、或把高风险的个案交给专业审核者,都是合理的落点。举证责任在主张这段媒体为真的一方,而不在你的怀疑上。
来源
- NIST 开放媒体取证挑战(OpenMFC):https://www.nist.gov/itl/iad/mltg/open-media-forensics-challenge