面向视频微小无人机目标检测的时序运动感知双分支网络TMAD-Net
作者:Li Zhe, 西安理工大学计算机科学与工程学院,西安 710048 Hei Xinhong, Jing Luo, Liu Yu, Shi Weiwei, Binzhi Gao, Wang Xiaofan, 黑新宏 · 发表于:Journal of Image and Graphics · 年份:2026 · DOI:10.11834/jig.260209 · 研究领域:AI and Multimedia in Education、Human Pose and Action Recognition、Advanced Data and IoT Technologies
目的针对实际视频监控场景中,无人机目标像素占比小、外观特征微弱,易被复杂动态背景掩盖,传统单帧目标检测算法无法有效利用帧间时序运动信息,导致微小目标漏检、误检频发的核心问题,开展视频微小无人机目标检测方法研究,为低空安防系统提供可靠的视觉检测方案。方法提出时序运动感知双分支网络(Temporal Motion-Aware Dual-Branch Network, TMAD-Net)。具体地,空间语义提取分支提取多帧堆叠图像的空间语义特征,显式运动先验分支通过去噪帧差图像捕捉目标高频运动特征,并使用运动-空间自适应融合模块融合双分支特征,从运动与空间维度自适应增强目标信号、抑制背景噪声,后输入主干网络完成微小无人机目标检测。结果在公开的ARD-MAV数据集以及真实场景采集的Phone与DJI两个无人机数据集上开展对比实验,结果表明,在ARD-MAV数据集中,mAP50从基线的0.264提升至0.588,mAP50-95从0.155提升至0.334;在Phone数据集中,mAP50从基线的0.802提升至0.887,mAP50-95从0.590提升至0.638;在DJI数据集中,mAP50从0.316提升至0.822,mAP50-95从0.083提升至0.266;推理速度达122FPS,满足实时检测需求。结论所提时序运动感知双分支网络模型通过显式分离并深度融合多帧空间与运动特征,结合运动-空间自适应融合模块精准校准,有效弥补了传统单帧算法对微小目标特征表征能力不足的缺陷,突破了复杂背景下视频微小目标检测的性能瓶颈,显著提升了微小无人机目标检测的准确率与鲁棒性。