SPHINX: A Mixer of Weights, Visual Embeddings and Image Scales for Multi-modal Large Language Models
作者:Ziyi Lin, Dongyang Liu, Renrui Zhang, Peng Gao, Longtian Qiu, Han Xiao, Han Qiu, Wenqi Shao, Keqin Chen, Jiaming Han, Siyuan Huang, Yichi Zhang, Xuming He, Yu Qiao, Hongsheng Li · 发表于:Lecture notes in computer science · 年份:2024 · DOI:10.1007/978-3-031-73033-7_3 · 被引用次数:20 · 研究领域:Multimodal Machine Learning Applications、Topic Modeling、Natural Language Processing Techniques