Scholay

学术搜索 · AI 审稿 · LaTeX 协作

DocPedia: unleashing the power of large multimodal model in the frequency domain for versatile document understanding

作者:Hao Feng, Qi Liu, Hao Liu, Jingqun Tang, Wengang Zhou, Houqiang Li, Can Huang · 发表于:Science China Information Sciences · 年份:2024 · DOI:10.1007/s11432-024-4250-y · 被引用次数:28 · 研究领域:Natural Language Processing Techniques、Handwritten Text Recognition Techniques、Topic Modeling