npj Gut and Liver:LLM 可把肝病系统综述筛选时间压缩九成,但撰写仍卡在结果和讨论
学术圈重大事件 · 发布 2026-06-22T15:49:32+08:00 · 更新 2026-06-22T15:55:16+08:00
npj Gut and Liver 6 月 22 日发表 UCSF 等团队论文,比较 LLM 辅助肝病系统综述筛选和 RAG 生成综述初稿的表现。模型在两项主题中以 86-93% 敏感性、96-99% 特异性接近人工筛选,并把筛选时间从 62/30 小时降至 3/2 小时;但自动初稿在结果、摘要和讨论部分表现明显不稳,仍需人工把关。
npj Gut and Liver 6 月 22 日发表 UCSF、Montefiore Medical Center 等团队论文,题为 “Closing the screening gap but not the writing gap: a two-topic evaluation of LLMs for systematic reviews and meta-analyses in hepatology”,DOI 为 10.1038/s44355-026-00068-w。研究把 LLM 放进两个肝病系统综述场景:代偿期肝硬化中 carvedilol 研究,以及肝硬化门静脉血栓中抗凝治疗研究。
npj Gut and Liver:LLM 可把肝病系统综述筛选时间压缩九成,但撰写仍卡在结果和讨论(图源:npj Gut and Liver 论文页面)
这条新闻的重点不是“AI 能写论文”,而是把系统综述拆成两个环节分别测量。研究团队先检索 PubMed、Cochrane 和 EMBASE,用带有明确纳入/排除标准的 few-shot prompt 筛选标题和摘要,并与人工筛选比较;随后把纳入研究交给检索增强 LLM,每个主题生成 10 份系统综述和 Meta 分析草稿,再用另一个 LLM 按 PRISMA 2020 合规性评分,并与人工评价对照。
可核验的结果显示,去重后两个主题分别有 703 条和 370 条记录。LLM 辅助筛选的敏感性为 86-93%,特异性为 96-99%,筛选时间约为 3 小时和 2 小时,而人工估算分别需 62 小时和 30 小时。真正的边界出现在撰写:RAG 生成稿在标题、引言、方法和结果部分表现差异较大,标题合规率可达 100%,引言约 91%,方法约 75-80%,结果约 68-75%,摘要和讨论等下游部分低于 65%。论文还指出,结果部分会出现样本量、效应值、置信区间提取错误,以及看似合理但不存在的发现。
对科研工作流的影响在于,LLM 可能先在“高重复、规则明确、人工成本高”的筛选环节落地,而不是直接替代综述作者。对医学证据生产者、期刊和指南团队来说,它提供了节省初筛时间的现实路径,也提醒不能把 RAG 初稿当成已验证证据综合。后续更值得观察的是,不同专业、非英文文献、全文 PDF 解析、冲突研究识别和统计复核能否被标准化;否则模型越能快速生成结构化稿件,越需要审稿和团队内部复核保留明确责任链。
信息来源
可信度说明
来源为 Nature Portfolio 旗下开放获取论文页,可核验发表日期、DOI、研究主题、筛选样本量和性能指标;但研究只覆盖两个肝病主题,且部分评估使用 LLM-as-a-judge,不能外推为所有医学系统综述或自动撰写场景已可靠。