Scholay

学术搜索 · AI 审稿 · LaTeX 协作

Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision

作者:Xiaofeng Han, Shunpeng Chen, Zheng Qing Fu, Zhe Feng, Lue Fan, Dong An, Changwei Wang, Li Guo, Weiliang Meng, Xiaopeng Zhang, Rongtao Xu, Shibiao Xu · 发表于:SSRN Electronic Journal · 年份:2025 · DOI:10.2139/ssrn.5206098 · 被引用次数:7 · 研究领域:Advanced Image and Video Retrieval Techniques