Scholay

学术搜索 · AI 审稿 · LaTeX 协作

AI 生成的参考文献是假的?一篇讲清为什么会编造、四类错误、以及如何逐条核对真伪

陈晓 · 内容编辑 · 发布 2026-06-25

大模型不是从数据库查文献,而是预测下一个最像真的 token,因此会生成格式完美却根本不存在的参考文献。本文讲清三件事:为什么 AI 会编造、AI 引用错误的四种类型、以及一套可复制的逐条核对 SOP,并区分国内外语境给出可信工作流。

AI 生成的参考文献确实常常是假的,根源在于大语言模型不会从数据库检索文献,而是在预测「下一个最像真实文献的 token」,因此能拼出格式完美却根本不存在的条目。研究显示 GPT-3.5 的文献伪造率约 55%、GPT-4 约 18%,且真实引用中仍有 24%-43% 存在实质性元数据错误。可靠做法是:Google Scholar 加引号搜标题、用 doi.org 或 CrossRef 验 DOI、逐字段比对作者年份期刊,并且绝不让 AI 自查。真正安全的工作流是先人工喂入已验证的真实文献,再让 AI 提炼,而非凭空生成。

为什么大模型会凭空编造参考文献

没有联网检索能力的大模型(如默认的 ChatGPT、豆包等)生成文本的方式是统计预测:根据上文不断输出概率最高的下一个词。它见过海量「论文标题 + 作者 + 期刊 + 年份 + DOID」的格式,因此能完美复刻参考文献的外观,但它并不在某个文献数据库里查证这条记录是否真实存在。换句话说,模型优化的目标是「看起来像真的」,而不是「是真的」。当训练语料里缺少某个具体引用时,模型会用最像真的片段把空缺填上,于是真作者配上假标题、真期刊配上假卷期、再补一个格式合法但解析不到任何东西的 DOI。

幻觉率在不同模型与场景下差异巨大,但都不容忽视。在 Nature 旗下 Scientific Reports 等研究中,GPT-3.5 生成参考文献的伪造率约为 55%、GPT-4 降到约 18%;即便是那些真实存在的引用,仍有 24%-43% 含有实质性元数据错误。心理学综述场景的伪造率被测出 6%-60% 的大幅波动,而某些医学问答场景甚至高达 69%。规律很清晰:越是冷门、细分、近期或需要精确数字的引用,模型越容易编造;开启了真实检索(RAG / 联网)的工具伪造率显著下降,但并非归零。

AI 引用错误的四种类型,从好查到最隐蔽

把 AI 的引用错误分成四类,有助于你判断该花多大力气核对、以及错误有多隐蔽。第一类最容易识别,最后一类几乎需要逐句读原文才能发现。理解这个谱系,才知道为什么「标题能搜到」远不等于「引用是对的」。

类型表现隐蔽程度如何发现
完全编造论文压根不存在,作者/标题/期刊/DOI 整条虚构Google Scholar 加引号搜标题 0 结果,DOI 解析失败
元数据错位论文真实存在,但年份/卷期/页码/作者/DOI 有错找到原文后逐字段比对,DOI 与标题对不上
张冠李戴(嵌合体)真作者 + 真期刊 + 假标题拼成一条,或真 DOI 指向另一篇论文DOI 解析出的标题与引用标题不一致,需交叉核对
曲解原意 / 编造引文引用的论文真实存在,但原文根本不支持该论点,或直接引号里的话是编的极高必须打开原文读相关段落,核对论点与引文是否真在文中

第三类「嵌合体引用」特别危险:它把真实存在的零件重新组装,标题能在搜索引擎里部分命中、作者是真实学者、期刊也真实存在,审稿人粗看很难起疑。真正的破绽在 DOI——把 DOI 粘到 doi.org 解析,如果跳转出的标题和你引用的标题不是同一篇,这条就是嵌合体。第四类「曲解原意」则是 AI 时代最难防的一类:论文真实、DOI 正确、元数据全对,唯独 AI 替它「说了它没说过的话」。这种错误任何元数据核对都查不出来,只能回到原文逐段确认论点和直接引文是否真的存在于文中。曾有 RAG 类工具把脚注指向并不包含该论点的来源,正是这一类的典型。

一套可复制的核对 SOP

无论你用的是哪款 AI,提交前都应对每一条参考文献跑一遍固定流程。下面这套 SOP 跨国通用,核心是「用独立的真实数据库去验证,而不是相信 AI 的自述」。

  1. 标题精确搜:把论文标题加英文双引号放进 Google Scholar 或学术库精确检索,0 结果或只搜到自己这篇引用,基本可判定为编造。
  2. DOI 解析验:把 DOI 粘到 https://doi.org/ 或用 CrossRef 查询,看解析出的标题、作者是否与引用完全一致;解析失败或指向另一篇,即为问题条目。
  3. 逐字段比对:找到真实原文后,逐一核对作者(全部姓名与顺序)、年份、期刊名、卷期、页码,任一不符都要修正而非保留。
  4. 回原文核论点:对支撑关键结论的引用,打开原文读相关段落,确认论文确实支持你引用它时所说的论点,直接引号里的话必须逐字在文中找到。
  5. 绝不让 AI 自查:不要问 AI「这些引用是真的吗」——会产生幻觉的系统无法可靠地自我纠错,它会自信地告诉你全是真的。
  6. 批量复核留痕:对照参考文献清单逐条打勾,保留你验证过的检索截图或链接,以应对盲审或答辩时的质询。

为什么强调「绝不让 AI 自查」?因为产生幻觉的根因——统计预测而非事实检索——同样作用于「自查」这个动作。你问它「这条引用真实吗」,它依然是在预测一个最像「是的,真实」的回答,而不是去数据库核实。现实中已有反面教材:美国有律师因在法律文书中引用 ChatGPT 编造的判例而被法院处罚;也有正式发表的论文里残留「Regenerate response」字样被 PubPeer 揪出,说明连最终校样都没人真正核对。这些案例的共同点都是——信任了一个无法自证的系统。

国内语境:合规后果与三库交叉检索

国内用户面对的不只是「引用对不对」,还有更直接的合规后果。多所高校(如湖北大学、南京工业大学、福州大学等)已在毕业季上线 AIGC 检测,新《学位法》也明确 AI 代写可作为撤销学位的依据。盲审不过、导师当场拆穿、被判学术不端,是悬在头上的现实风险。因此国内核对文献时,除了 CrossRef 验 DOI,更要用知网、万方、维普三库交叉检索中文文献——一篇真实的中文核心期刊论文,理应能在至少一个主流库里被精确检索到。

一个高频困惑是:「查不到 DOI 就是假的吗?」答案是否定的。DOI 缺失有很多正常原因:纯纸质刊物、2000 年前的老文献、以及部分国内期刊从未向 DOI 注册机构申请编号。判断真伪的关键不是「有没有 DOI」,而是「能否在权威库中按标题与作者精确检索到这篇论文本身」。所以对中文文献,先在知网/万方/维普按标题精确检索;搜到了、作者年份卷期都对得上,即便没有 DOI 也是真实文献。反过来,有一个格式合法的 DOI 却解析失败或指向别篇,才是真正的危险信号。

国外语境:方法论共识与工具差异

国外讨论更偏方法论与工具评测。Reddit 的 r/PhD、r/AskAcademia、r/labrats,以及 Academia StackExchange、多所大学图书馆的 LibGuide,沉淀了大量「如何 spot 假引用」的实操问答,方法论高度一致:加引号搜标题、解析 DOI、逐字段比对、绝不问 AI 自查。工具层面差异明显:Elicit、Consensus 这类直接在真实论文库上检索的工具几乎不伪造文献;而 ChatGPT、Bing、Perplexity 等生成式或检索增强工具仍会出现幻觉,Perplexity 还被发现会把脚注指向不含该论点的错误来源。arXiv 等平台已开始收紧政策,也有论文呼吁「全文引用存档」来对抗幻觉。

工具类型代表文献是否可信原因
纯生成式 LLM(无检索)默认 ChatGPT、豆包不可信预测 token 而非检索数据库,易整条编造
检索增强 / 联网Perplexity、Bing部分可信有真实来源但仍会幻觉、来源与论点错配
真实论文库检索Elicit、Consensus、Scholay高可信答案直接来自真实文献库,可逐条溯源

正确的工作流:先喂真文献,再让 AI 提炼

最稳妥的做法,是把「生成」和「检索」分开:让真实数据库负责找文献,让 AI 只负责在你已验证的文献基础上做提炼、归纳与表达。这本质上就是 RAG(检索增强生成)的思路,但由你来掌控检索这一步,确保每条引用都有据可查。具体流程是先用基于真实学术库的检索工具找到并核实文献,把它们整理进文献集,再把这批可信文献作为上下文交给 AI 去写综述、做对比或生成初稿。

  1. 用智能检索从真实学术库找到候选文献,而不是让通用大模型凭记忆列清单。
  2. 对候选文献跑一遍核对 SOP,把验证通过的论文加入文献集统一管理。
  3. 把已验证文献作为上下文,让 AI 做摘要、对比、观点归纳与初稿撰写。
  4. 在智能写作中引用时,只引用文献集里已核实的条目,引用即可溯源。
  5. 成稿后再过一遍逐字段核对与原文论点核对,确保 AI 没有曲解任何一条。

这正是基于真实学术库的检索与写作平台的价值所在。在 Scholay 中,智能检索返回的是真实学术库里的论文,可以直接加入文献集长期管理;AI 分析与智能写作 Prism 在引用时基于这些已核实的条目工作,而非凭空生成;需要严格把关时,还可用 AI 审稿对引文与论点逐项交叉检查。把检索交给真实数据库、把表达交给 AI、把核对留给固定 SOP,才能既享受 AI 的效率,又守住学术诚信的底线。

ChatGPT 给的参考文献为什么是假的?是凭空编的吗?

是的,无联网的 ChatGPT 不查数据库,而是预测「最像真实文献的 token」,因此会拼出格式完美却不存在的条目。研究测得 GPT-3.5 伪造率约 55%、GPT-4 约 18%,越冷门细分的引用越容易被编造。

文献查不到 DOI 就一定是假的吗?

不一定。纯纸质刊物、2000 年前的老文献、部分国内期刊从未申请 DOI,都会导致无 DOI。判断真伪的关键是能否在知网、Google Scholar 等权威库按标题与作者精确检索到论文本身,而非有没有 DOI。

可以直接问 AI「这些引用是真的吗」来核实吗?

绝对不可以。产生幻觉的根因是统计预测而非事实检索,这个缺陷同样作用于自查。AI 会自信地说全是真的。必须用 Google Scholar 搜标题、doi.org 验 DOI 等独立手段人工核实。

真作者真期刊但查不到那篇论文,是被编造了吗?

很可能是「嵌合体引用」——真零件拼出假条目。验证方法是把 DOI 粘到 doi.org 解析,若解析出的标题与你的引用不是同一篇,即可确认编造,需替换为真实文献。

哪类 AI 工具的参考文献相对可信?

直接在真实论文库上检索的工具(如 Elicit、Consensus、Scholay)几乎不伪造文献;纯生成式 LLM 最易编造;联网/RAG 工具居中,仍可能出现来源与论点错配,引用前都需逐条核对。

作者:陈晓 —— 学术出版行业从业 10 年,熟悉同行评审、期刊投稿和开放获取出版流程。