NeurIPS DeepFake 检测公平性竞赛复盘:现有指标可被“全部判假”策略钻空子
学术圈重大事件 · 发布 2026-06-23T15:10:00+08:00 · 更新 2026-06-24T13:29:16+08:00
Newswise 6 月 22 日发布中国科学院供稿,介绍 Machine Intelligence Research 论文对 NeurIPS 2025 AI 生成脸检测公平性竞赛的系统复盘。竞赛使用 120 万张由 37 种生成方法产生的假脸和 40 万张真实人脸,并按性别、肤色交叉群体评估公平性。最值得警惕的结果是,排名靠前团队可通过把所有图像都判为假,获得近乎完美公平分数,却牺牲实用检测能力。
Newswise 6 月 22 日发布的中国科学院供稿介绍,Machine Intelligence Research 发表论文,复盘 NeurIPS 2025 期间围绕 AI 生成脸检测公平性的国际竞赛,DOI 为 10.1007/s11633-026-1637-x。竞赛由 Purdue University、University at Buffalo、中国科学院等机构研究者组织,目标是让 DeepFake 检测模型在保持准确率的同时,减少对不同性别和肤色群体的差异化误判。
新闻稿配图展示 DeepFake 检测公平性挑战中错误预测位置。(图源:Newswise / Chinese Academy of Sciences)
背景是,生成式模型让合成面孔越来越难以肉眼识别,社交平台、新闻机构和公共部门也更依赖自动检测工具。但已有研究显示,部分 DeepFake 检测系统对浅肤色人脸准确率更高,对深肤色人脸更容易产生误报。这种偏差如果进入内容审核、身份核验或执法辅助流程,可能放大不公平的监控、下架和错误指控。
竞赛提供 AI-Face 数据集,包含超过 120 万张由 GAN、扩散模型等 37 种方法生成的假图像,以及 40 万张真实人脸。评估维度包括 demographic parity、equalized odds、max equalized odds 和 overall accuracy equality,并在性别和肤色定义的六个交叉群体上比较。公开复盘显示,表现较好的技术路线包括数据清洗、ConvNeXt 与 EfficientNet 混合专家架构、测试时增强、CLIP 与 DINOv3 特征、双分支融合和提示式去偏。
真正的风险信号在评价协议。论文复盘指出,排名前两位团队可以通过简单地把每张图像都判为“假”,得到近乎完美的公平分数;这种策略利用固定 0.5 阈值和指标缺陷,实际准确率只有约 50%,且真实人脸假阳性率达到 100%。这说明单独优化公平指标并不能保证系统可用,甚至可能奖励没有现实价值的检测器。
对 AI 安全和科研评测的启示很直接:公平性需要和效用共同度量。作者建议采用 Pareto frontier 分析,让团队报告多组效用和公平权衡点,而不是只提交单一阈值下的公平分数。后续值得关注的是,DeepFake 检测基准能否纳入新生成模型、跨域数据、真实部署成本和人工复核流程,否则评测分数仍可能和真实风险脱节。
信息来源
可信度说明
来源为 Newswise 上的中国科学院机构供稿,并给出 Machine Intelligence Research DOI、数据集规模、竞赛组织方和关键评估结果。该文是竞赛复盘论文而非生产系统审计,能说明当前评测协议缺陷,但不能直接代表所有 DeepFake 检测产品的实际公平表现。