Scholay

学术搜索 · AI 审稿 · LaTeX 协作

系统综述与 Meta 分析怎么写?从注册到发表的 7 步完整指南

陈晓 · 内容编辑 · 发布 2026-02-12 · 更新 2026-06-25

系统综述需遵循预设方案做全面、可重复、低偏倚的证据综合;标准流程为 PROSPERO 注册、PRISMA 报告、多库检索、双人筛选与质量评价、数据提取与 Meta 分析、异质性与敏感性分析、GRADE 证据分级。本文给出可落地的 7 步与常用工具对照。

系统综述(Systematic Review)是按预先注册的方案,对某一研究问题的全部相关证据进行系统、全面、可重复的收集、评价与综合;若进一步对数据做定量合并,即成为 Meta 分析。规范的撰写流程通常包含 7 步:在 PROSPERO 注册方案、遵循 PRISMA 2020 报告标准、跨多个数据库做敏感检索、双人独立筛选与偏倚风险评价、标准化数据提取与 Meta 分析、异质性与敏感性分析、用 GRADE 对证据确定性分级并据此撰写结论。在循证医学中,高质量系统综述被视为最高级别的证据。

系统综述与传统综述、Meta 分析有什么区别?

系统综述与传统叙述性综述的核心区别在于:系统综述遵循严格的预设方案,采用明确的检索策略、纳入排除标准和质量评价方法,以最大限度减少偏倚,提供客观、透明、可重复的证据总结;叙述性综述则缺乏这些约束,结论易受作者主观选择影响。Meta 分析则是在系统综述基础上对多项研究的效应量做定量合并的统计方法——并非所有系统综述都含 Meta 分析,但 Meta 分析通常以系统综述的全面检索为前提。

维度传统叙述性综述系统综述Meta 分析
研究方案无预设方案预先注册(如 PROSPERO)在系统综述方案内规定合并方法
文献检索选择性、不透明全面、敏感、可重复依赖系统综述的全面检索
纳入标准通常不明确明确的纳入/排除标准同系统综述并附效应量要求
质量评价一般不做用 RoB 2/ROBINS-I 等评估偏倚纳入质量评价并做敏感性分析
结果呈现定性叙述定性或定量综合定量合并效应量(森林图)
证据级别较低循证医学最高级别之一高(取决于纳入研究质量)

撰写系统综述的学术价值很高:它能全面梳理某一领域的研究现状与知识缺口,为临床实践、政策制定和未来研究方向提供循证依据。高质量系统综述往往具有较高被引率——Cochrane 系统综述的平均被引次数显著高于普通原始研究论文。对研究生和早期职业研究者而言,系统综述是快速深入一个领域、建立学术影响力的有效途径。

为什么要在 PROSPERO 注册并遵循 PRISMA?

在正式检索之前,应在 PROSPERO(国际系统综述前瞻性注册平台)注册研究方案。注册的价值在于:提高研究的透明度与可信度,避免其他团队重复开展相同综述,并防止研究者在数据出来后悄悄改动结局指标(即结局转换偏倚)。部分期刊已将方案注册列为投稿的必要条件。完整方案应明确研究问题(用 PICO/PICOS 框架)、检索策略、数据库选择、纳入排除标准、质量评价工具、数据提取方法与计划的分析方法。

PRISMA(Preferred Reporting Items for Systematic Reviews and Meta-Analyses)是系统综述报告的国际公认标准。最新版 PRISMA 2020 包含 27 个核心报告条目,覆盖标题、摘要、方法、结果与讨论各部分的具体要求。严格遵循 PRISMA 清单既能提高论文质量,也能显著增加被接收的可能性——多数高影响力期刊要求投稿时附上 PRISMA 清单。此外,PRISMA 流程图是展示文献筛选过程的标准工具,清晰记录从初始检索到最终纳入的每个环节。

如何构建全面、可重复的文献检索策略?

系统综述的检索策略必须全面、敏感且可重复,建议至少检索两个以上数据库。生物医学领域通常包括 PubMed/MEDLINE、Embase、Cochrane Library;社会科学领域包括 Web of Science、Scopus、PsycINFO。检索式用布尔逻辑(AND、OR、NOT)组合主题词(如 MeSH terms)与自由词。例如研究"运动对老年人认知功能的影响",检索式可为:(exercise OR "physical activity" OR training) AND (cognition OR "cognitive function" OR memory) AND (elderly OR aged OR "older adults")。

除电子数据库外,还需手动补充检索以减少遗漏。常见补充来源包括:纳入文献的参考文献列表(滚雪球法)、相关综述的引用文献、学科专业网站,以及灰色文献(会议论文集、学位论文、政府报告、临床试验注册平台)。纳入灰色文献有助于减少发表偏倚,因为未发表的研究更可能包含阴性结果。Scholay 的检索功能支持跨多个学术数据库的联合检索并自动去重,可在保证检索全面性的同时提高效率。

  • 电子数据库:生物医学用 PubMed/MEDLINE、Embase、Cochrane Library;社科用 Web of Science、Scopus、PsycINFO
  • 参考文献追溯:对纳入文献和相关综述做滚雪球(向前/向后)引文追踪
  • 灰色文献:会议论文集、学位论文、政府报告、临床试验注册平台,降低发表偏倚
  • 检索记录:保存每个数据库的完整检索式、检索日期与命中数,以便复现和填写 PRISMA 流程图

文献怎么筛选?质量评价用哪些工具?

文献筛选应严格遵循预设的纳入排除标准,通常分两阶段进行:先根据题目和摘要初筛,排除明显不相关文献;再获取全文复筛,确定最终纳入的研究。为确保客观性,建议由两名评审员独立筛选,分歧通过讨论或由第三人裁决。使用 Rayyan、Covidence 等系统综述管理工具可显著提高筛选效率与团队协作效率,并自动记录每一步的排除理由。

质量评价(偏倚风险评估)是系统综述的核心环节,不同研究类型使用不同工具。随机对照试验(RCT)推荐 Cochrane 的 RoB 2,评估随机化、干预偏离、数据缺失、结局测量和选择性报告五个领域;非随机研究用 ROBINS-I 或 Newcastle-Ottawa Scale(NOS);诊断试验用 QUADAS-2。质量评价结果将直接影响对证据确定性的判断和最终结论的强度,因此必须在论文中逐项呈现。

研究类型推荐质量评价工具评价要点
随机对照试验(RCT)Cochrane RoB 2随机化、干预偏离、数据缺失、结局测量、选择性报告
非随机干预/观察性研究ROBINS-I 或 NOS混杂、选择偏倚、暴露/结局测量
诊断准确性研究QUADAS-2病例选择、待评试验、参考标准、流程与时间

数据提取和 Meta 分析怎么做?

数据提取应使用标准化表格,记录每项研究的基本信息(作者、年份、国家)、研究设计、样本特征、干预或暴露措施、结局指标与主要结果数据,并由两名评审员独立提取以减少错误。连续性变量通常需提取均值、标准差和样本量;二分类变量需提取事件数和总人数。若原始数据不完整,应尝试联系通讯作者获取,或用统计方法进行估算,并在论文中说明处理方式。

Meta 分析是对多个独立研究的效应量做定量合并的统计方法,选择合适的效应量指标至关重要。连续变量常用均数差(MD)或标准化均数差(SMD);二分类变量常用比值比(OR)、相对危险度(RR)或风险差(RD)。分析模型分固定效应模型与随机效应模型——当研究间存在异质性时(通常以 I² 统计量衡量,I² > 50% 表示中度异质性),应使用随机效应模型。常用软件包括 RevMan(Cochrane 官方工具)、R(meta 和 metafor 包)与 Stata。

异质性与敏感性分析:结果稳不稳怎么判断?

异质性指纳入研究的结果之间存在的变异超过随机误差所能解释的范围,识别和解释异质性是 Meta 分析的关键步骤。可通过亚组分析(按干预类型、人群特征、研究质量等分组)和 Meta 回归探索异质性来源。如果异质性过大且无法合理解释,应考虑放弃定量合并,改为叙述性综合,以免给出误导性的合并效应。

敏感性分析用于检验结果的稳健性,常见方法包括逐一排除法(依次排除每项研究观察对合并效应的影响)、仅纳入低偏倚风险的研究、更换效应量或统计模型。如果不同分析方法得到一致结论,说明结果较稳健;反之则需谨慎解读并在讨论中充分说明。发表偏倚可用漏斗图和 Egger 检验评估,通常在纳入研究数量不少于 10 项时结果较为可靠。

如何用 GRADE 分级证据并撰写结论?

GRADE(Grading of Recommendations Assessment, Development and Evaluation)是评估证据确定性的国际标准框架,从五个维度对证据质量做降级评估:偏倚风险、不一致性、间接性、不精确性和发表偏倚。RCT 证据起始等级为"高",观察性研究为"低",再根据各维度表现升降级,最终得到高、中、低、极低四个等级的证据确定性评价。使用 GRADEpro 工具可规范化这一过程并生成标准的证据概要表(Summary of Findings)。

讨论部分应围绕几个要点展开:主要发现的总结及其临床或实践意义、与现有文献的一致性和差异、优势(如检索的全面性、方法的严谨性)、局限性(如语言限制、灰色文献纳入情况、纳入研究的质量),以及对未来研究的建议。结论应直接回答研究问题,并基于 GRADE 评价结果说明推荐强度,避免过度外推或做出超出证据支持范围的论断。

系统综述撰写的标准 7 步流程

  1. 确定研究问题并在 PROSPERO 注册方案:用 PICO/PICOS 框架明确人群、干预、对照与结局
  2. 构建检索策略并跨多库敏感检索:布尔逻辑组合主题词与自由词,补充灰色文献,保存检索式
  3. 双人独立筛选文献:先题摘初筛、再全文复筛,用 Rayyan/Covidence 记录排除理由
  4. 偏倚风险评价:按研究类型选 RoB 2、ROBINS-I/NOS 或 QUADAS-2 逐项评估
  5. 标准化数据提取与 Meta 分析:双人提取,选 MD/SMD 或 OR/RR/RD,按异质性选固定或随机效应模型
  6. 异质性与敏感性分析:用亚组分析、Meta 回归、逐一排除法及漏斗图/Egger 检验检验稳健性
  7. GRADE 证据分级并撰写结论:对照 PRISMA 清单核对全文,据 GRADE 等级说明推荐强度后投稿

系统综述和 Meta 分析是一回事吗?

不是。系统综述是按预设方案系统收集和评价证据的研究方法,Meta 分析则是在此基础上对多项研究的效应量做定量合并的统计步骤。系统综述可以不含 Meta 分析(改为叙述性综合),但 Meta 分析通常以系统综述的全面检索为前提。

做系统综述一定要在 PROSPERO 注册吗?

强烈建议注册。在 PROSPERO 前瞻性注册方案能提高透明度、避免重复研究、防止数据出来后悄改结局指标,部分期刊已将其列为投稿必要条件。注册应在正式文献检索之前完成,并明确研究问题、检索与分析方法。

Meta 分析中 I² 多大需要用随机效应模型?

I² 统计量衡量研究间异质性,通常 I² 大于 50% 表示中度异质性,此时应使用随机效应模型而非固定效应模型。若异质性过大且无法用亚组分析或 Meta 回归合理解释,应考虑放弃定量合并,改为叙述性综合。

不同类型研究的偏倚风险用什么工具评价?

随机对照试验推荐 Cochrane RoB 2,评估随机化、干预偏离、数据缺失、结局测量与选择性报告;非随机研究用 ROBINS-I 或 Newcastle-Ottawa Scale;诊断准确性研究用 QUADAS-2。评价结果直接影响证据确定性判断。

什么时候才适合做发表偏倚的漏斗图和 Egger 检验?

发表偏倚可用漏斗图和 Egger 检验评估,但一般建议在纳入研究数量不少于 10 项时进行,否则检验把握度不足、结果不可靠。研究较少时应在讨论中定性说明潜在发表偏倚,而非强行做统计检验。

作者:陈晓 —— 学术出版行业从业 10 年,熟悉同行评审、期刊投稿和开放获取出版流程。