学术搜索 · AI 审稿 · LaTeX 协作
用AI做科研的正确姿势:从提示词到工作流,90%的人都在这3步踩坑
张薇 · 首席研究员 · 发布 2026-06-25
用AI做科研,真正拖垮你的不是模型不够强,而是三个反复出现的坑:引用幻觉、用错环节、提示词太粗。本文把这三步拆成一套可落地的工作流,明确"能交给AI"与"必须自己来"的边界,给出任务拆解式提示词模板和逐环节验证清单,并分国内外两种语境给建议。
用AI做科研真正的瓶颈不是模型能力,而是三个反复出现的踩坑:一是引用幻觉——AI生成的参考文献可能近半数完全虚构却格式逼真;二是用错环节——把找事实、找研究空白、写引用这类AI最容易编造的活儿交给它;三是提示词太粗——一句帮我写篇综述必然产出又空又假。正确姿势是先划清AI与人的分工边界,再用任务拆解式提示词配合逐环节核验,把AI当成放大思考的工具而非代写大脑。这篇文章把这三步拆成一套可以照做的工作流。
踩坑一:引用幻觉,头号杀手
这是最致命也最隐蔽的坑。当你让通用大模型直接给出十篇相关文献时,它并不在检索真实数据库,而是在按语言概率编一篇看起来该存在的论文:作者像真的、期刊像真的、年份像真的、DOI格式也对,但整条记录可能根本不存在。多项观察显示,这类裸生成的参考文献中相当比例完全虚构,有人原样交给导师当场被识破,也有医学生在查房时被主治追问出处而无言以对。
为什么越是最新研究越容易被编造?因为模型的训练语料对近期成果覆盖稀疏,它越缺乏真实记忆,就越倾向用流畅的语言把空白填满。所以根治幻觉的关键不在换个更聪明的模型,而在改变信息来源:让答案来自可核验的真实文献库,而不是模型的语言记忆。
踩坑二:用错环节,把AI放到它最会犯错的位置
第二个普遍误区是不分环节地一步到位。新手最爱的指令是帮我写一篇关于X的综述,指望AI从找文献到下结论一条龙搞定,结果往往空洞、套话连篇且夹带虚构引用。问题不在AI不努力,而在你把它放进了它结构性不擅长的环节。
一个稳妥的判断标准是:凡是生成型、发散型、改写型的任务可以放心交给AI;凡是事实型、判断型、署名负责型的任务必须自己来。下面这张表把常见科研环节做了归位,照着对号入座就能避开大半误用。
| 科研环节 | 能放心交给AI | 必须自己来 |
|---|---|---|
| 选题与头脑风暴 | 让AI发散方向、提批判性问题 | 拍板研究问题、判断价值 |
| 文献检索 | 用检索工具找真实文献 | 核实每条引用真实存在 |
| 读长文档 | 摘要、提炼要点、做对比 | 核对关键数据与原文一致 |
| 搭框架 | 列大纲、设计目录与小标题 | 确定论证逻辑主线 |
| 写作 | 改写、润色、调整语气 | 写出原创观点与结论 |
| 数据解释 | 生成可能的解读供参考 | 对数据下最终结论 |
| 找研究空白 | 提示可能方向 | 判断空白是否真实存在 |
| 写引用 | 按已核实文献排版格式 | 保证引用真实、对应正确 |
读透这张表你会发现,AI擅长的是降低体力成本(读、改、列、搜),而你不可外包的是判断与署名责任(信什么、留什么、对什么负责)。把综述拆成设计目录、设计问题、文献调研、内容填充四个子步骤,在每一步分别约束AI,产出质量会比一次成稿高出一个量级。这也是为什么 Scholay 把检索、智能助手、AI审稿、智能写作 Prism 做成相互独立又能衔接的环节,而不是一个万能黑箱按钮——让你在每一步都看得见、改得动、可核验。
踩坑三:提示词太粗,高质量输出源于高质量输入
第三个坑是把AI当许愿池。一句帮我写篇综述之所以产出又空又假,是因为它没有上下文、没有角色约束、没有格式要求,模型只能往最平庸的方向回归。真正有效的提示词遵循一个朴素原则:你给的输入越结构化,AI的输出越可用。
把一次性大指令拆成可控的小步骤,是提示词进阶的核心。下面这套任务拆解式模板,适合用在综述、引言、方法部分等需要严谨性的写作上,可以直接套用。
- 设定角色与上下文:你是某领域的资深研究者,我正在写一篇关于X的综述,读者是同行评审,语气需严谨克制。
- 拆解结构:先不要写正文,只列出这篇综述应包含的章节目录与每节要回答的核心问题。
- 受控检索:针对第N节的问题,基于我提供的(经核实的)文献列表,总结各文献的观点与分歧,不要引入列表之外的文献。
- 分版本产出:就这一节给出三个不同切入角度的草稿,标注各自侧重,我来选择再综合。
- 多轮迭代:在选定草稿上,只做润色与逻辑衔接,保留我标记的原创判断,不要替我下新结论。
把三步拼成一套可落地的工作流
避开三个坑之后,真正的价值在于把它们串成一条可重复的流水线。下面是一条经得起核验的AI辅助科研工作流,每一步都内置了把关动作,让AI干活、你把关。
- 检索:用连接真实文献库的工具搜集候选文献,逐条点开核实存在(对应根治幻觉)。
- 精读:把核实过的文献喂给AI做摘要与对比,自己核对关键数据与原文一致。
- 搭架:让AI基于已读文献列出大纲与目录,你确定论证主线。
- 填充:按章节分步生成草稿,每节限定只用已核实文献,产出多版本再综合。
- 自审:切换审稿人角色让AI批判方法与结论,自己判断哪些意见采纳。
- 终检:逐条回检全部引用,确认每一条真实且对应正确,再定稿署名。
分国内外语境:不同战场,不同打法
同样是用AI辅助科研,国内与国外的关注点差异很大,照搬一套打法容易翻车。下面把两种语境的核心差异和应对建议并排列出。
| 维度 | 国内语境建议 | 国外语境建议 |
|---|---|---|
| 头号焦虑 | AIGC率/AI检测过不了知网维普 | 机构政策与学术诚信是否合规 |
| 前置动作 | 先看送审/毕业对AI率的要求 | 先问导师、查学校政策再用 |
| 模型选型 | 读长文档、中文润色可用国产模型 | 进阶可接 MCP、结构化提示工作流 |
| 核心心态 | 原创度与表达自然度并重 | AI是思考工具不是代写,需披露 |
| 典型风险 | 多轮改写降AI率时改丢原意 | 自己写的稿被检测器误判为AI |
国内最尖锐的是降AIGC率:知网、维普会把像不像机器写的也作为指标,常见做法是用国产模型多轮改写、口语化、打散重组,把AI率压下来。但要警惕——为了降率反复改写很容易改丢原意甚至引入错误,改完务必回读核对事实与逻辑。模型选型上,读长中文文档、做中文润色,国产模型(如 DeepSeek、Kimi、秘塔、文心、通义)各有所长,但涉及可核验引用时,仍要回到连接真实数据库的检索,而非让任一聊天模型裸生成文献。
国外语境里,合规是绕不开的前置题:先确认导师和学校允许的边界、是否需要披露使用AI,再动手。主流共识是AI应当帮你成为更好的写作者,而不是外包大脑,因此对原创性和可复现性的审视更重。如果你自己写的稿被AI检测器误判,不要慌:保留写作过程的草稿、版本记录与文献笔记作为佐证,这些过程性证据往往比一句辩解更有说服力。无论哪种语境,把笔记和文献整理成结构化、可被AI读取的素材(比如统一存进文献集),都能让后续的检索、问答和写作衔接得更顺。
常见问题
用AI写论文,它给的参考文献是真的吗?怎么快速核实?
裸聊天模型给的文献相当比例是虚构的,格式却以假乱真。最快的核实办法是逐条拿标题、作者、DOI 去真实数据库回检,查不到就是编造。更稳的做法是从一开始就用连接真实文献库的检索工具找文献,从源头避免幻觉。
哪些环节能放心交给AI,哪些必须自己来?
生成型、改写型、发散型任务(头脑风暴、列大纲、摘要、润色)可以交给AI;事实型、判断型、署名负责型任务(核实引用、判断研究价值、下数据结论、写原创观点)必须自己来。简单说,AI降体力成本,你担判断责任。
为什么一句帮我写篇综述产出又空又假?
因为缺上下文、角色和格式约束,模型只能回归平庸。应把任务拆成设计目录、设计问题、受控检索、分版本产出、多轮迭代五步,每步给清晰约束,并限定只用已核实文献,质量会显著提升。
论文AIGC率太高过不了检测,有靠谱的降AI率方法吗?
常见做法是用国产模型多轮改写、口语化、打散重组来降率。但要警惕反复改写改丢原意或引入错误,改完务必回读核对事实与逻辑。比起一味降率,从写作过程就保留自己的判断和原创表达更治本。
怎么让AI像审稿人一样批判我的论文?
给它明确的审稿人角色和范围:请以严格同行评审身份只读方法部分,逐条指出可复现性漏洞、统计薄弱点、结论是否超出数据支撑,按严重程度排序、不要夸奖。Scholay 的 AI审稿把这种批判式提问做成了可操作流程。
作者:张薇 —— 信息科学博士,专注于学术信息检索和知识图谱研究,主持多项国家级科研项目。