Scholay

学术搜索 · AI 审稿 · LaTeX 协作

用AI做科研的正确姿势:从提示词到工作流,90%的人都在这3步踩坑

张薇 · 首席研究员 · 发布 2026-06-25

用AI做科研,真正拖垮你的不是模型不够强,而是三个反复出现的坑:引用幻觉、用错环节、提示词太粗。本文把这三步拆成一套可落地的工作流,明确"能交给AI"与"必须自己来"的边界,给出任务拆解式提示词模板和逐环节验证清单,并分国内外两种语境给建议。

用AI做科研真正的瓶颈不是模型能力,而是三个反复出现的踩坑:一是引用幻觉——AI生成的参考文献可能近半数完全虚构却格式逼真;二是用错环节——把找事实、找研究空白、写引用这类AI最容易编造的活儿交给它;三是提示词太粗——一句帮我写篇综述必然产出又空又假。正确姿势是先划清AI与人的分工边界,再用任务拆解式提示词配合逐环节核验,把AI当成放大思考的工具而非代写大脑。这篇文章把这三步拆成一套可以照做的工作流。

踩坑一:引用幻觉,头号杀手

这是最致命也最隐蔽的坑。当你让通用大模型直接给出十篇相关文献时,它并不在检索真实数据库,而是在按语言概率编一篇看起来该存在的论文:作者像真的、期刊像真的、年份像真的、DOI格式也对,但整条记录可能根本不存在。多项观察显示,这类裸生成的参考文献中相当比例完全虚构,有人原样交给导师当场被识破,也有医学生在查房时被主治追问出处而无言以对。

为什么越是最新研究越容易被编造?因为模型的训练语料对近期成果覆盖稀疏,它越缺乏真实记忆,就越倾向用流畅的语言把空白填满。所以根治幻觉的关键不在换个更聪明的模型,而在改变信息来源:让答案来自可核验的真实文献库,而不是模型的语言记忆。

踩坑二:用错环节,把AI放到它最会犯错的位置

第二个普遍误区是不分环节地一步到位。新手最爱的指令是帮我写一篇关于X的综述,指望AI从找文献到下结论一条龙搞定,结果往往空洞、套话连篇且夹带虚构引用。问题不在AI不努力,而在你把它放进了它结构性不擅长的环节。

一个稳妥的判断标准是:凡是生成型、发散型、改写型的任务可以放心交给AI;凡是事实型、判断型、署名负责型的任务必须自己来。下面这张表把常见科研环节做了归位,照着对号入座就能避开大半误用。

科研环节能放心交给AI必须自己来
选题与头脑风暴让AI发散方向、提批判性问题拍板研究问题、判断价值
文献检索用检索工具找真实文献核实每条引用真实存在
读长文档摘要、提炼要点、做对比核对关键数据与原文一致
搭框架列大纲、设计目录与小标题确定论证逻辑主线
写作改写、润色、调整语气写出原创观点与结论
数据解释生成可能的解读供参考对数据下最终结论
找研究空白提示可能方向判断空白是否真实存在
写引用按已核实文献排版格式保证引用真实、对应正确

读透这张表你会发现,AI擅长的是降低体力成本(读、改、列、搜),而你不可外包的是判断与署名责任(信什么、留什么、对什么负责)。把综述拆成设计目录、设计问题、文献调研、内容填充四个子步骤,在每一步分别约束AI,产出质量会比一次成稿高出一个量级。这也是为什么 Scholay 把检索、智能助手、AI审稿、智能写作 Prism 做成相互独立又能衔接的环节,而不是一个万能黑箱按钮——让你在每一步都看得见、改得动、可核验。

踩坑三:提示词太粗,高质量输出源于高质量输入

第三个坑是把AI当许愿池。一句帮我写篇综述之所以产出又空又假,是因为它没有上下文、没有角色约束、没有格式要求,模型只能往最平庸的方向回归。真正有效的提示词遵循一个朴素原则:你给的输入越结构化,AI的输出越可用。

把一次性大指令拆成可控的小步骤,是提示词进阶的核心。下面这套任务拆解式模板,适合用在综述、引言、方法部分等需要严谨性的写作上,可以直接套用。

  1. 设定角色与上下文:你是某领域的资深研究者,我正在写一篇关于X的综述,读者是同行评审,语气需严谨克制。
  2. 拆解结构:先不要写正文,只列出这篇综述应包含的章节目录与每节要回答的核心问题。
  3. 受控检索:针对第N节的问题,基于我提供的(经核实的)文献列表,总结各文献的观点与分歧,不要引入列表之外的文献。
  4. 分版本产出:就这一节给出三个不同切入角度的草稿,标注各自侧重,我来选择再综合。
  5. 多轮迭代:在选定草稿上,只做润色与逻辑衔接,保留我标记的原创判断,不要替我下新结论。

把三步拼成一套可落地的工作流

避开三个坑之后,真正的价值在于把它们串成一条可重复的流水线。下面是一条经得起核验的AI辅助科研工作流,每一步都内置了把关动作,让AI干活、你把关。

  1. 检索:用连接真实文献库的工具搜集候选文献,逐条点开核实存在(对应根治幻觉)。
  2. 精读:把核实过的文献喂给AI做摘要与对比,自己核对关键数据与原文一致。
  3. 搭架:让AI基于已读文献列出大纲与目录,你确定论证主线。
  4. 填充:按章节分步生成草稿,每节限定只用已核实文献,产出多版本再综合。
  5. 自审:切换审稿人角色让AI批判方法与结论,自己判断哪些意见采纳。
  6. 终检:逐条回检全部引用,确认每一条真实且对应正确,再定稿署名。

分国内外语境:不同战场,不同打法

同样是用AI辅助科研,国内与国外的关注点差异很大,照搬一套打法容易翻车。下面把两种语境的核心差异和应对建议并排列出。

维度国内语境建议国外语境建议
头号焦虑AIGC率/AI检测过不了知网维普机构政策与学术诚信是否合规
前置动作先看送审/毕业对AI率的要求先问导师、查学校政策再用
模型选型读长文档、中文润色可用国产模型进阶可接 MCP、结构化提示工作流
核心心态原创度与表达自然度并重AI是思考工具不是代写,需披露
典型风险多轮改写降AI率时改丢原意自己写的稿被检测器误判为AI

国内最尖锐的是降AIGC率:知网、维普会把像不像机器写的也作为指标,常见做法是用国产模型多轮改写、口语化、打散重组,把AI率压下来。但要警惕——为了降率反复改写很容易改丢原意甚至引入错误,改完务必回读核对事实与逻辑。模型选型上,读长中文文档、做中文润色,国产模型(如 DeepSeek、Kimi、秘塔、文心、通义)各有所长,但涉及可核验引用时,仍要回到连接真实数据库的检索,而非让任一聊天模型裸生成文献。

国外语境里,合规是绕不开的前置题:先确认导师和学校允许的边界、是否需要披露使用AI,再动手。主流共识是AI应当帮你成为更好的写作者,而不是外包大脑,因此对原创性和可复现性的审视更重。如果你自己写的稿被AI检测器误判,不要慌:保留写作过程的草稿、版本记录与文献笔记作为佐证,这些过程性证据往往比一句辩解更有说服力。无论哪种语境,把笔记和文献整理成结构化、可被AI读取的素材(比如统一存进文献集),都能让后续的检索、问答和写作衔接得更顺。

常见问题

用AI写论文,它给的参考文献是真的吗?怎么快速核实?

裸聊天模型给的文献相当比例是虚构的,格式却以假乱真。最快的核实办法是逐条拿标题、作者、DOI 去真实数据库回检,查不到就是编造。更稳的做法是从一开始就用连接真实文献库的检索工具找文献,从源头避免幻觉。

哪些环节能放心交给AI,哪些必须自己来?

生成型、改写型、发散型任务(头脑风暴、列大纲、摘要、润色)可以交给AI;事实型、判断型、署名负责型任务(核实引用、判断研究价值、下数据结论、写原创观点)必须自己来。简单说,AI降体力成本,你担判断责任。

为什么一句帮我写篇综述产出又空又假?

因为缺上下文、角色和格式约束,模型只能回归平庸。应把任务拆成设计目录、设计问题、受控检索、分版本产出、多轮迭代五步,每步给清晰约束,并限定只用已核实文献,质量会显著提升。

论文AIGC率太高过不了检测,有靠谱的降AI率方法吗?

常见做法是用国产模型多轮改写、口语化、打散重组来降率。但要警惕反复改写改丢原意或引入错误,改完务必回读核对事实与逻辑。比起一味降率,从写作过程就保留自己的判断和原创表达更治本。

怎么让AI像审稿人一样批判我的论文?

给它明确的审稿人角色和范围:请以严格同行评审身份只读方法部分,逐条指出可复现性漏洞、统计薄弱点、结论是否超出数据支撑,按严重程度排序、不要夸奖。Scholay 的 AI审稿把这种批判式提问做成了可操作流程。

作者:张薇 —— 信息科学博士,专注于学术信息检索和知识图谱研究,主持多项国家级科研项目。