Scholay

学术搜索 · AI 审稿 · LaTeX 协作

Advancements in 3D vision understanding using multimodal large language models

作者:Mingtao Feng, Junhao Shen, Zijie Wu, Weixing Peng, Hang Zhong, Yulan Guo, Xiangbo Shu, Hui Zhang, Dong Weisheng, Yaonan Wang · 发表于:Journal of Image and Graphics · 年份:2025 · DOI:10.11834/jig.240588 · 被引用次数:1 · 研究领域:Multimodal Machine Learning Applications、Natural Language Processing Techniques

三维(3D)视觉感知和理解在机器人导航、自动驾驶以及智能人机交互等众多领域广泛应用,是计算机视觉领域备受瞩目的研究方向。随着多模态大模型的发展,它们与3D视觉数据的融合取得快速进展,为理解和与3D物理世界交互提供了前所未有的能力,并展现了独特优势,如上下文学习、逐步推理、开放词汇能力和丰富的世界知识。本文涵盖3D视觉数据基本表示,从点云到3D高斯泼溅;梳理主流多模态大模型的发展脉络;对联合多模态大模型的3D视觉数据表征方法进行归纳总结;梳理基于多模态大模型的3D理解任务,如3D生成与重建、3D目标检测、3D语义分割、3D场景描述、语言引导的3D目标定位和3D场景问答等;提炼基于多模态大模型的机器人具身智能系统中空间理解能力的提升策略;最后梳理了核心数据集和对未来前景的深刻讨论,以期促进该领域的深入研究与广泛应用。本文全面分析揭示了本领域的重大进展,强调利用多模态大模型进行3D视觉理解的潜力和必要性。因此,本综述目标是为未来的研究绘制一条路线,探索和扩展多模态大模型在理解和与复杂3D世界的互动能力,为空间智能领域的进一步发展铺平道路。