Scholay

学术搜索 · AI 审稿 · LaTeX 协作

LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models

作者:Yanwei Li, Chengyao Wang, Jiaya Jia · 发表于:Lecture notes in computer science · 年份:2024 · DOI:10.1007/978-3-031-72952-2_19 · 被引用次数:111 · 研究领域:Multimodal Machine Learning Applications、Topic Modeling、Natural Language Processing Techniques