LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models
作者:Yanwei Li, Chengyao Wang, Jiaya Jia · 发表于:Lecture notes in computer science · 年份:2024 · DOI:10.1007/978-3-031-72952-2_19 · 被引用次数:111 · 研究领域:Multimodal Machine Learning Applications、Topic Modeling、Natural Language Processing Techniques