X-InstructBLIP: A Framework for Aligning Image, 3D, Audio, Video to LLMs and its Emergent Cross-Modal Reasoning
作者:Artemis Panagopoulou, Le Xue, Ning Yu, Junnan Li, Dongxu Li, Shafiq Joty, Ran Xu, Silvio Savarese, Caiming Xiong, Juan Carlos Niebles · 发表于:Lecture notes in computer science · 年份:2024 · DOI:10.1007/978-3-031-72995-9_11 · 被引用次数:12 · 研究领域:Multimodal Machine Learning Applications、Video Analysis and Summarization、Music and Audio Processing