基于频率域掩码的自然场景图像伪造检测

2026-05 个人 已完成

双分支网络 (MobileNet-V2 + 频率分支) + 分层差异化频率掩码 + 改进门控融合的轻量级深度伪造检测模型

情境

生成式 AI 与大模型技术的快速演进使深度伪造图像逼真度不断提升,对数字媒体安全与网络信息可信性构成严重威胁。自然场景伪造检测普遍存在泛化能力不足、频率特征利用不充分、多模态特征融合策略粗糙三大核心问题,传统方法难以有效捕获微弱分散的伪造痕迹。

任务

在北京邮电大学本科毕业设计中,设计并实现一个高效、鲁棒、轻量级的自然场景图像伪造检测模型(DualBranchWithMaskNet):通过频率域掩码增强放大伪造痕迹差异,以双分支结构融合空间与频率特征,在不依赖像素级标注、资源受限条件下获得高精度的伪造图像判别能力。

行动

提出分层差异化频率掩码策略,依频率物理含义将频谱划分为低/中/高频并设置差异化掩码比例(低频 0.30 / 中频 0.25 / 高频 0.15),保留语义信息的同时最大程度放大伪造痕迹差异。模型采用双分支架构:空间分支以 MobileNet-V2 提取语义特征,频率分支用 5 层卷积网络(仅 4.16M 参数)结合 SE 注意力挖掘频谱异常,并通过改进门控融合(可学习加权 + Sigmoid 软权重 + 残差连接)完成特征自适应融合。训练上使用差异化学习率微调预训练权重、Focal Loss 应对困难样本、数据增强与早停抑制过拟合。

结果

  • 模型在测试集上获得 Accuracy 84.62%、Precision 87.57%、Recall 80.53%、F1 0.8390、AUC 0.9203
  • 相对仅空间分支基线,Accuracy 提升 6.00%(78.62%→84.62%)、AUC 提升 6.18%(0.8585→0.9203)
  • 分层差异化掩码优于均匀掩码(Accuracy +1.90%),门控融合优于直接拼接(Precision +2.15%),验证各模块独立贡献度
  • 仅用 4.16M 参数达到与 ResNet-50 版 CNNSpot(25.6M)相当的性能,参数效率提升 6.2 倍,Precision 更高 3.77%

反思

这次毕业设计让我完整经历了一个视觉感知任务的选题、建模、实验与工程权衡全流程。最有价值的不是最终的精度数字,而是意识到'判断一个技术方案好坏要看它解决的问题与代价'——比如频率分支单独作用几乎无效、必须在掩码配合下才能发挥价值,而轻量化所带来的参数效率提升在真实部署中的意义往往被低估。这些理解远超出课本所能传授的范围。

架构

模型流程:输入自然场景图像 → 分层差异化频率掩码(低/中/高频差异化掩码)→ 双分支并行特征提取(空间分支 MobileNet-V2 + 频率分支 CNN-SE)→ 改进门控融合 → 真实 / 伪造分类
模型流程:输入自然场景图像 → 分层差异化频率掩码(低/中/高频差异化掩码)→ 双分支并行特征提取(空间分支 MobileNet-V2 + 频率分支 CNN-SE)→ 改进门控融合 → 真实 / 伪造分类

技术栈

PythonPyTorchMobileNet-V2SE 注意力机制频率域分析Focal LossCUDA

关键权衡

  • 使用频率域掩码而非仅空间域:陷阱——单纯引入频率分支而不同时配合掩码,对性能提升微弱(Accuracy 仅 +0.38%),只有通过差异化频率掩码放大真实/伪造图像在频域的响应差异,才能显著提升判别能力(+2.25%)
  • 分层差异化掩码而非均匀掩码:均匀掩码易过度破坏高频(伪造痕迹常集中于此),分层策略高频仅掩码 0.15 以最大程度保留伪造痕迹,Accuracy 再提升 1.90%
  • 用改进门控融合替代复杂 MLP/注意力门控:以可学习加权 + Sigmoid 软权重替代 Softmax 零和竞争,让双分支互补协同,同时降低优化难度,Precision 提升 2.15%
  • 选用 MobileNet-V2 + 频率分支的轻量组合而非 NFA-ViT 等大模型:NFA-ViT 虽 F1 达 97.2% 但参数 86.0M(为本方法 20.7 倍)且需像素级标注,本方法仅需图像级标签、更适应资源受限的真实部署