Scholay

学术搜索 · AI 审稿 · LaTeX 协作

具身智能视角下无人机视觉语言技术研究进展

作者:Zheng Zhouyi, Guo Chenrui, Shan Chun, Zhang Lei, Wei Wei · 发表于:Journal of Image and Graphics · 年份:2026 · DOI:10.11834/jig.260203 · 研究领域:Multimodal Machine Learning Applications、Artificial Intelligence Applications、Domain Adaptation and Few-Shot Learning

无人机视觉语言导航(aerial vision-language navigation, AVLN)是融合计算机视觉、自然语言处理与无人机控制的空中具身智能前沿方向,旨在使无人机依据自然语言指令在非结构化三维环境中实现自主导航。针对传统导航难以理解高层语义、无法适应复杂空间约束的局限,本文系统梳理无人机视觉语言导航的研究脉络与技术体系。首先归纳通用仿真、真实场景重建、虚拟场景建模三类仿真平台的特点,对比主流数据集在场景复杂度、指令语义与动作表征上的差异;其次从感知表征、推理范式、记忆存储、具身控制四个核心模块,剖析跨模态对齐、大模型推理、长程记忆与连续控制的关键技术;最后总结该技术在城市巡检、灾害救援、智能物流与精准农业中的落地应用,指出仿真到现实迁移、多机协同、长程鲁棒性等挑战。本文全面呈现领域研究现状,为空中具身智能的进一步发展提供参考。