基于大语言模型的中文电子病历命名实体识别
作者:洁 程, 独玉 刘, 思旭 陈, 姝妤 钱 · 发表于:元宇宙医学. · 年份:2025 · DOI:10.61189/502047ilpumd · 研究领域:Machine Learning in Healthcare、Machine Learning in Bioinformatics、Biomedical Text Mining and Ontologies
命名实体识别(NER)作为自然语言处理(NLP)的核心任务,在电子病历(EMRs)中识别疾病、症状等医学实体,对临床辅助决策和医学知识库构建意义重大。但传统方法依赖大量标注数据与复杂模型,训练及推理成本较高。本文提出一种融合语义检索与提示学习的大语言模型生成式医学NER方法。首先,构建句子级向量数据库,对电子病历进行语义编码以实现可检索表示;然后,基于输入语句进行语义相似度检索,将相似示例动态注入提示模板,引导模型完成实体抽取;最后,通过结构化特殊标记生成实体类型标注结果,实现直接解码输出。实验表明,该方法在自建电子病历数据集和瑞金医院糖尿病数据集上均表现良好,尤其在低资源场景下具备较强的鲁棒性与迁移能力。