学术搜索 · AI 审稿 · LaTeX 协作
科研数据管理怎么做?FAIR 原则、DMP 与数据共享完整指南
张薇 · 首席研究员 · 发布 2026-02-18 · 更新 2026-06-25
科研数据管理(RDM)是在研究生命周期内系统地收集、组织、存储与共享数据。核心要做四件事:遵循 FAIR 原则、编写数据管理计划(DMP)、用 3-2-1 法则备份、选合适仓库开放共享。本指南给出可落地的步骤、目录模板、仓库对比与常见问题解答。
科研数据管理(Research Data Management, RDM)指在整个研究生命周期内有计划地收集、组织、存储、维护和共享数据。一句话回答"怎么做":遵循 FAIR 原则(可发现、可访问、可互操作、可复用),在项目开始前编写数据管理计划(DMP),用 3-2-1 法则做备份(3 份副本、2 种介质、1 份异地),并在论文发表时把数据存入 Zenodo、Figshare 等公开仓库并配齐元数据。这套流程既保证研究可重复,也满足 Nature、Science 等期刊及 NIH、NSFC 等资助机构的强制要求。
为什么科研数据管理至关重要?
良好的科研数据管理直接关系到研究的可重复性和学术诚信,同时也是越来越多期刊和资助机构的硬性要求。Nature、Science 等顶级期刊要求作者在论文发表时提供原始数据,或将数据存储在公开仓库中;NIH、ERC、NSFC 等主要资助机构则把数据管理计划(DMP)列为申请书的必需部分。换言之,不做数据管理,可能直接导致投稿被拒或经费申请失败。
数据丢失或混乱造成的损失可能是灾难性的。一项调查显示,约 80% 的科研数据在论文发表 20 年后无法获取,17% 的研究者曾因数据管理不善而丢失重要数据。反过来,规范的数据管理能提高团队协作效率、加速论文撰写、方便后续研究复用,甚至能产出独立的"数据论文"(Data Paper)。前期投入少量时间建立标准流程,会在研究全程节省大量时间并避免不可挽回的损失。
FAIR 原则是什么?四个要素如何落地
FAIR 原则是当前国际科学数据管理的基本框架,由四个核心要素组成:Findable(可发现)要求数据有唯一持久标识符如 DOI 并附丰富元数据;Accessible(可访问)要求数据存于可靠仓库、通过标准协议获取,即使数据需授权,元数据也应公开;Interoperable(可互操作)要求使用通用格式和标准术语,便于与其他数据集整合;Reusable(可复用)要求有明确的使用许可和详细的来源说明。FAIR 不等于完全公开,而是让数据"可被找到、可被理解、可被复用"。
- Findable 可发现:为数据集分配 DOI,撰写标题、作者、关键词等丰富元数据,使其能被搜索引擎和数据目录检索到。
- Accessible 可访问:存入可靠仓库并通过标准协议获取;数据本身可受限,但元数据应保持公开。
- Interoperable 可互操作:采用 CSV、JSON 等通用格式和领域标准术语,便于跨数据集整合。
- Reusable 可复用:附明确开放许可(如 CC BY 4.0 或 CC0)和详细的来源、方法说明。
实现 FAIR 并不意味着所有数据都必须完全公开。"尽可能开放,必要时限制"(As open as possible, as closed as necessary)是普遍接受的原则:涉及个人隐私、国家安全或商业机密的数据可设置访问限制,但仍应保证元数据的可发现性。在实践中,建议优先处理可发现性和可复用性——为数据分配 DOI、编写详细的 README 文件和数据字典、选择开放许可。
数据管理计划(DMP)怎么写?
数据管理计划(DMP)是描述如何在项目期间及之后管理研究数据的正式文件,通常控制在 2-3 页以内,且应作为"活文档"随项目进展定期更新。撰写时要避免"数据将被妥善管理"这类笼统表述,而应给出具体的工具名称、存储位置和时间节点。DMPTool(美国)和 DMPonline(欧洲)是两个免费在线工具,提供基于资助机构要求的模板和逐步引导。
- 描述数据:列出数据类型、格式与预估数据量。
- 说明收集方法:写清数据采集方式和质量控制措施。
- 定义组织规范:确定数据的目录结构和文件命名规范。
- 制定存储与备份策略:落实本地+云端+异地的 3-2-1 备份法则。
- 明确安全与隐私措施:针对敏感数据写明去标识化与访问控制。
- 规划共享与长期保存:指定目标仓库、共享时间点和保存年限。
- 分配预算与责任:明确预算和具体的人员责任。
好的 DMP 是研究项目的路线图,而非一次性交差的文档。建议在项目立项时完成初稿,在数据采集、分析、发表等关键节点回头更新。Scholay 的智能写作工具 Prism 可在编写 DMP 这类结构化学术文档时提供 AI 辅助起草与润色,帮助研究者把笼统描述细化为可执行的具体条目。
文件命名与目录结构应遵循什么规范?
规范的文件命名和目录结构是数据管理的基础,应在项目开始前确定并记录在 README 文件中。命名核心原则:使用描述性名称而非"data1.csv""final_v2_revised.xlsx"等模糊名称;日期统一用 ISO 8601 格式(YYYY-MM-DD);避免空格和特殊字符,用下划线或连字符代替;包含版本号(v01、v02)并记录每个版本的变更。
目录结构应层次清晰、逻辑一致。一个通用的项目目录模板包含:/raw_data(原始数据,永不修改)、/processed_data(清洗后的分析数据)、/scripts(分析代码和脚本)、/results(图表、统计输出)、/docs(项目文档、数据字典、DMP)、/manuscripts(论文稿件)。原始数据一旦收集完成应设为只读,所有处理操作在副本上进行;这样即使分析代码出错或数据被误改,也能从原始数据重新开始。
- /raw_data:原始数据,收集后设为只读、永不修改。
- /processed_data:清洗与转换后的分析用数据。
- /scripts:分析代码和处理脚本。
- /results:图表与统计输出。
- /docs:项目文档、数据字典与 DMP。
- /manuscripts:论文稿件及修订版本。
如何用 3-2-1 法则做数据存储与备份?
数据备份遵循"3-2-1 法则":至少保存 3 份副本,存储在 2 种不同介质上,其中 1 份在异地。实际操作中可组合使用本地工作站(日常使用)、机构服务器或 NAS(每日自动同步)、云存储(如 OneDrive、Google Drive 或机构云盘)。对于大体量数据(>100GB),可考虑使用机构提供的高性能存储或专门的科研数据存储服务。关键是:备份从未被验证等于没有备份,应至少每月测试一次备份的完整性和可恢复性。
版本控制对数据管理同样关键。对于代码和小型数据文件,Git 配合 GitHub 或 GitLab 是最佳选择;对于大型数据文件(>100MB),可使用 Git LFS 或 DVC(Data Version Control)。电子实验记录本(ELN)如 Benchling、LabArchives 可以记录实验过程、关联数据文件并提供审计追踪,适合实验科学场景。
数据共享:如何选择合适的数据仓库?
选择合适的数据仓库是实现数据共享的关键步骤,可分为通用型和学科型两类。通用型仓库适用于各学科:Zenodo 由 CERN 维护、免费且与 GitHub 集成,Figshare 免费并支持多种文件类型,Dryad 侧重生态和进化生物学且部分收费。学科型仓库更专业,如 GenBank(基因序列)、PDB(蛋白质结构)、ICPSR(社会科学)、Pangaea(地球科学)。使用 re3data.org 可以搜索和比较全球 3000+ 个数据仓库。
| 仓库 | 类型 | 特点 | 适用场景 |
|---|---|---|---|
| Zenodo | 通用型 | CERN 维护,免费,与 GitHub 集成,可分配 DOI | 跨学科数据、代码与论文附件 |
| Figshare | 通用型 | 免费,支持多种文件类型 | 图表、数据集、补充材料 |
| Dryad | 通用型(偏生物) | 侧重生态和进化生物学,部分收费 | 生命科学数据 |
| GenBank | 学科型 | 基因序列专用 | 分子生物学/基因组学 |
| PDB | 学科型 | 蛋白质结构专用 | 结构生物学 |
| ICPSR | 学科型 | 社会科学数据 | 社会学/政治学/经济学 |
上传数据时务必提供完整的元数据和文档。必需的元数据包括标题、作者、摘要、关键词、数据收集日期、地理位置(如适用)、方法描述和许可协议。README 文件应详细说明文件清单及内容描述、变量名称和含义(数据字典)、数据收集的仪器和参数、缺失值的标记方式和原因,以及引用本数据集的推荐格式。高质量的文档既方便他人复用,也是研究者学术严谨性的体现。
敏感数据如何在保护隐私的前提下共享?
涉及人类受试者的研究数据需要特别注意隐私保护,共享前必须进行去标识化处理。要移除或替换直接标识符(姓名、身份证号、电话号码)和间接标识符(稀有职业、具体地址、出生日期的完整组合)。常用技术包括数据脱敏(masking)、泛化(将精确年龄转为年龄段)、k-匿名化和差分隐私。去标识化后应进行重标识风险评估,确保无法通过数据组合推断出个体身份。
对于无法完全去标识化的敏感数据,可采用受控访问模式:数据存储在安全平台上,研究者需提交申请、签署数据使用协议并获得伦理委员会批准后才能访问。GISAID(流感/新冠基因组)和 dbGaP(基因型与表型数据库)是这类模式的典型范例。即使数据本身不公开,也应确保元数据和分析代码可公开获取,以支持研究的可验证性。
什么是科研数据管理(RDM)?
科研数据管理是在整个研究生命周期内有计划地收集、组织、存储、维护和共享数据的系统化实践。它保障研究可重复、维护学术诚信,同时满足期刊和资助机构对数据存档与共享的要求。
FAIR 原则的四个要素分别是什么?
FAIR 指 Findable(可发现)、Accessible(可访问)、Interoperable(可互操作)、Reusable(可复用)。核心是让数据有持久标识符和元数据、能通过标准协议获取、采用通用格式、并附明确许可与来源说明。
3-2-1 备份法则具体指什么?
3-2-1 法则指至少保存 3 份数据副本,存储在 2 种不同介质上,其中 1 份放在异地。常见组合是本地工作站、机构服务器或 NAS、以及云存储,并应至少每月测试备份的可恢复性。
数据管理计划(DMP)需要写多长?
一份 DMP 通常控制在 2-3 页以内,应涵盖数据描述、收集方法、组织规范、存储备份、安全隐私、共享与保存、预算责任等方面,并随项目进展作为活文档定期更新。
免费的数据仓库有哪些推荐?
通用型免费仓库推荐 Zenodo(CERN 维护、与 GitHub 集成)和 Figshare(支持多种文件类型)。学科数据可选 GenBank、PDB、ICPSR 等专业仓库,并用 re3data.org 检索比较全球数据仓库。
作者:张薇 —— 信息科学博士,专注于学术信息检索和知识图谱研究,主持多项国家级科研项目。