Nature:Universal Cell Embedding 用 3600 万单细胞数据搭出跨物种统一表征空间
顶级刊物论文速递 · 发布 2026-07-09T08:28:00+08:00 · 更新 2026-07-09T08:31:31+08:00
Nature 于 2026-07-08 发表 Universal Cell Embedding 基础模型论文,用 self-supervision 将 3600 万个单细胞、1000 多个具名细胞类型、数百个实验、数十种组织和 8 个物种压入统一表征空间,并宣称新细胞可在无标注、无重训、无微调条件下直接嵌入,且能识别发育谱系和训练集外物种数据。
Nature 2026-07-08 论文提出 Universal Cell Embedding 基础模型,目标是把跨物种、跨组织、跨实验的单细胞转录组数据压进一个统一 biological latent space。论文摘要明确写到,模型通过 self-supervision 在大规模细胞数据上训练,最终构建出一个 Integrated Mega-scale Atlas,纳入 3600 万个细胞、1000 多个具名细胞类型、数百个实验、数十种组织和 8 个物种。更关键的是,新细胞可以在不做数据标注、不重新训练模型、也不微调的情况下直接嵌入这一空间。
Nature:Universal Cell Embedding 用 3600 万单细胞数据搭出跨物种统一表征空间(图源:Nature 论文页)
这条论文值得进入本轮 top-journal,因为它把单细胞分析从“每个项目各自做降维、批次校正和注释”的工作流,向更接近基础模型的共享底座推进了一大步。论文摘要还指出,这个表征空间出现了超出训练目标的 emergent behaviour,不仅能识别 developmental lineages,还能嵌入训练集之外物种的数据。对于细胞图谱、发育生物学、疾病分型和跨物种比较研究来说,这类统一表征一旦稳健成立,真正影响的不是某一篇 atlas 的注释效率,而是未来不同实验室能否在更大范围内共享和复用细胞状态坐标系。
边界同样需要保守表述。当前直接可核验的核心证据来自 Nature 文章摘要:模型的训练方式、3600 万细胞规模、1000 多个细胞类型、8 个物种覆盖,以及对未见物种和 developmental lineages 的泛化能力都已明示。但这并不等于所有下游注释、疾病判别或跨平台整合问题已经被彻底解决,尤其不同测序协议、低质量样本、罕见细胞状态和多模态任务中的误差传播,仍需要更细的外部验证。更稳妥的理解是,截至 2026-07-09 08:28 CST,这项工作最重要的新信号,是把单细胞细胞图谱的基础设施层从工具箱推进到了可复用的统一表征底座。
信息来源
可信度说明
核心事实直接来自 Nature 正式论文摘要。当前可直接核验模型使用 self-supervision 训练、Integrated Mega-scale Atlas 纳入 3600 万细胞和 1000 多个具名细胞类型、覆盖数百个实验和 8 个物种,以及新细胞可在无标注、无重训、无微调条件下直接嵌入统一空间这些关键信息。边界在于,摘要能够支持统一表征和泛化能力的主张,但不足以独立替代全文对跨平台鲁棒性、低质量样本误差与多模态扩展问题的完整验证。