Scholay

学术搜索 · AI 审稿 · LaTeX 协作

AI 写作为什么会"幻觉"?编造文献、伪造 DOI 的真相与一套可落地的核验流程

张薇 · 首席研究员 · 发布 2026-06-25 · 更新 2026-08-11

AI 编造文献不是偶发 bug,而是大语言模型"按概率续写"机制的必然产物。本文从原理讲清它为何敢一本正经伪造作者、年份和 DOI,用实测幻觉率数据击穿"形式完美最难辨"的盲区,分析换更强模型为何也无法归零,并给出科研人可直接照做的投稿前识别与核验工作流,兼谈数据幻觉与责任归属。

AI 编造文献不是偶发故障,而是大语言模型工作原理的必然结果:它本质是按概率预测下一个词,而非去数据库查证。因此它会拼出格式完美、作者年份齐全、甚至带 DOI 的"文献",但这些条目可能根本不存在。实测数据显示 GPT-3.5 约 55% 引用纯属虚构,GPT-4 仍有 18%-28%,冷门主题更飙到 35%-55%。唯一可靠的应对是:不信任任何 AI 直接给出的引用,先在真实学术数据库逐条核验 DOI、作者与全文,不可验证的立即删除。

AI 为什么会一本正经地编造文献?

理解幻觉的关键,是放弃"AI 在查资料"这个错觉。大语言模型的核心机制是 next-token prediction——基于海量文本训练出的概率分布,逐词预测"最像下一个该出现的词"。当你让它给参考文献时,它并没有去连接知网、PubMed 或 CrossRef,而是在生成一段"看起来像参考文献的字符串"。它在续写一个统计上最合理的句子,而不是检索一条被证实的事实。

参考文献在训练数据里有极其稳定的格式特征:作者名、年份、期刊名、卷期页码、DOI 前缀 10.xxxx。模型学会的是这套"形状",于是它能流畅地填出一个姓张的作者、一个 2021 年、一本听起来很对口的期刊、一串符合规则的 DOI。每个零件都符合统计规律,但组合起来指向的那篇论文,现实中并不存在。这正是为什么伪造文献往往"形式完美"——格式正确恰恰是模型最擅长的部分,真实性才是它无从保证的部分。

实测数据:幻觉率有多高,有多难发现

很多人觉得"我多看几眼就能看出假的",但量化研究戳破了这种自信。不同模型、不同主题下,虚构引用的比例高得惊人,而且越是冷门、新兴的研究方向,幻觉越严重——因为训练语料里相关真实文献本就稀疏,模型只能靠"想象补全"。

场景 / 模型引用虚构或错误情况
GPT-3.5 生成文献约 55% 完全虚构
GPT-4 / 4o 生成文献约 18%-28% 虚构,过半引用存在错误
心理学子领域伪造引用率 6%-60% 不等
冷门 / 新兴主题幻觉率飙升至 35%-55%

更值得警惕的是顶会层面的"翻车"案例:有报道指出 NeurIPS 2025 中约 100 条幻觉引用通过了 3-5 位专家的评审;ICLR 2026 抽样显示约 20% 的论文至少含有一处幻觉。连受过专业训练的同行评审都未能当场识别,说明伪造引用"肉眼难辨"绝非外行的借口,而是结构性难题。它流畅、自信、格式标准,恰好踩中了人类"形式正确即可信"的认知弱点。

换个更强的模型能解决吗?

国外社区反复讨论"GPT-4o / Claude / Gemini 哪个幻觉最少",答案是:横评确实有差异,更强的模型虚构率更低,但没有任何纯语言模型能把幻觉降到零。因为问题出在机制本身——只要它仍是"按概率续写而不查库",编造就只是概率高低,而非有无。把希望寄托在"换个模型"上,等于把结构性风险当成可调参数。

真正能从根上规避的,是改变信息来源:让工具先去真实学术数据库检索,再基于检索到的真实文献作答,也就是 RAG(检索增强生成)思路。区别在于,纯大模型是"凭记忆背",而接入真实检索的工具是"先查到再引用",每一条引用都能回溯到一个可点开的真实条目。这也是 Scholay 把智能检索接入真实学术数据库、并让结果可逐条溯源的核心原因——AI 分析与综述建立在查得到的文献之上,而不是模型脑补出来的字符串之上。

投稿前的核验工作流:科研人可直接照做

无论用国内还是国外的模型,人工逐条核验都不可替代。下面这套流程在国内外学界已基本形成共识,可以直接套用到你的写作环节里。

  1. 只把 AI 当"头脑风暴"用:让它帮你梳理思路、提取关键词、生成检索式,不要直接采纳它给的任何具体文献条目。
  2. 去真实数据库重新检索:拿着关键词在知网、维普、PubMed、Scopus、Web of Science 或 Scholay 智能检索里找真文献,以数据库结果为准,而不是以 AI 给的列表为准。
  3. 逐条核 DOI、作者与元数据:把每条 DOI 拿到 CrossRef / 数据库里查,确认能解析、作者署名与年份卷期页码完全一致;DOI 查不到、PMID 与标题对不上,基本可判定为伪造。
  4. 打开全文确认确实支持论点:即便文献真实存在,也要点进全文,确认它的结论真的支撑你引用它的那句话,而非"标题像就拿来用"。
  5. 不可验证立即删除:任何无法在权威数据库找到、或内容对不上的引用,不要"先留着再说",直接删掉换成真实文献。

国内视角:DOI 查不到、学术不端与责任归属

国内用户的痛点更偏"实操救命":DeepSeek 或国产大模型给的 DOI 在知网、CrossRef 上查不到,PMID 和标题对不上,这几乎都是伪造的信号,不必怀疑是自己检索方式不对。正确做法是把这些条目当作"不存在"处理,回到知网、维普做真实检索去匹配可公开验证的文献。

在提示词层面,可以明确约束模型"只允许引用真实存在、可在权威数据库公开查证的文献,不确定就明说没有,而不要编造",但要清楚:提示词只能降低概率、提醒模型不要硬编,无法消除幻觉,它绝不能替代人工核验。更现实的选择是用能接入真实文献检索的工具,从源头让引用可查。

不只是引用:数据与事实幻觉同样要查

幻觉不限于参考文献。AI 还会编造统计数字、实验结论、人物观点甚至定义,且同样说得流畅自信。发现这类内容幻觉的方法是一致的:凡是涉及具体数据、断言、归因的句子,都要找到原始可靠来源逐一核对,而不是因为"读起来很顺、很专业"就采信。越是关键、越是会被读者引用的结论,越要回到原始文献和数据去验证。

DeepSeek 给的 DOI 在知网和 CrossRef 都查不到,PMID 和标题也对不上,怎么办?

这几乎可以判定为伪造,不必怀疑是自己检索方式有问题。正确做法是把该条目当作不存在,直接删除,然后回到知网、维普、PubMed 等真实数据库重新检索可公开验证的文献来替换。

用什么提示词能让 AI 只引用真实存在的文献?

可以明确要求"只引用可在权威数据库公开查证的文献,不确定就说没有而不要编造"。但提示词只能降低虚构概率,无法消除幻觉,仍须人工逐条核验,或改用能接入真实学术检索的可溯源工具。

换成 GPT-4o、Claude 或 Gemini 这类更强的模型,幻觉会消失吗?

不会。横评显示更强的模型虚构率更低,但只要它仍是按概率续写而不查数据库,编造就只是概率高低而非有无。真正从根上规避要靠接入真实检索(RAG 思路),让引用可逐条溯源。

为什么冷门或新兴研究方向 AI 幻觉率更高?

因为这些方向在训练语料里相关真实文献本就稀疏,模型缺乏可依据的真实信息,只能靠概率"想象补全",于是虚构率明显上升,实测可飙到 35%-55%。冷门主题尤其需要回到数据库核验。

引用了 AI 编造的假文献被发现,会算学术不端吗?

风险很高。投稿和交稿时签署的是作者本人的原创声明,审稿、答辩或查重发现假引用,责任归属是作者而非模型。因此务必把逐条核验当作必经工序,任何不可验证的引用都应在提交前删除。

作者:张薇 —— 信息科学博士,专注于学术信息检索和知识图谱研究,主持多项国家级科研项目。