Scholay

学术搜索 · AI 审稿 · LaTeX 协作

Nature Communications 发布开源 SOFA:先剥离已知协变量,再寻找多组学潜在因子

顶级刊物论文速递 · 发布 2026-08-20T16:40:00+08:00 · 更新 2026-08-20T16:40:40+08:00

核心结论

Nature Communications 推出半监督多组学因子分析 SOFA,并开放 GitHub 代码。传统 MOFA 类方法会把疾病亚型或环境变量等已知协变量重新发现为潜在因子,挤占真正新信号;SOFA 将这些协变量预先纳入模型,再集中推断残余变异。作者在癌症、脑发育和心力衰竭数据上展示其用途。方法有助于提高潜在因子的可解释性,但新因子仍是统计结构,需独立实验验证且依赖协变量记录质量。

Nature Communications 8 月 20 日发表半监督多组学因子分析方法 SOFA,并提供公开代码。多组学研究常对同一批样本同时测量转录组、蛋白组、表观组或其他分子层,研究者通常先用群组因子分析和 MOFA 等工具寻找跨组学相关模式,把共同或组学特异的变异压缩成少数潜在因子。但其中一部分因子往往只是在重新识别已经知道的疾病亚型、批次或环境协变量。

SOFA 半监督多组学因子分析工作流程
论文图 1 展示 SOFA 如何把已知协变量与待发现的多组学潜在变异分开建模。(图源:论文作者,来源页:Nature Communications)

SOFA 的核心变化是把已知协变量在建模开始时显式放入,而不是等无监督分析完成后再人工解释每个因子。模型由此尝试把已知来源与尚未解释的变异分开,把潜在因子容量集中到可能的新模式上。论文在癌症、脑发育和心力衰竭多组学数据集上测试这一思路,展示 SOFA 可从不同生物学场景中提取未被输入协变量解释的结构,并保留多组学之间的共同和特异关系。

对使用 MOFA 作为首轮探索工具的团队而言,SOFA 的意义在于减少“把已知标签包装成新发现”的风险。研究者可以更直接地问:在已经控制疾病亚型、年龄、处理条件或其他记录因素后,剩余分子变化还能组成哪些一致模式。公开 GitHub 仓库也降低了方法复现和与现有流程对照的门槛,有利于生物信息学团队检查模型假设、参数和结果稳定性。

不过,“潜在”并不等于“未知机制”。如果协变量测量错误、缺失或彼此相关,模型仍可能把已知影响泄漏进新因子;反之,提前控制与生物信号紧密相连的标签,也可能去掉研究者真正关心的变化。案例数据能证明方法可运行,不能说明每个因子都有可重复的生物学含义。后续应与 MOFA、监督回归及批次校正方法做系统基准,报告不同初始化和样本量下的稳定性,并在独立队列、空间定位或功能实验中验证因子对应的细胞与疾病过程。

来源: Nature Communications 原始论文(8 月 20 日)SOFA 开源代码

信息来源

可信度说明

来源包括同行评议的 Nature Communications 原始论文和作者公开 GitHub 仓库,可核验方法定位及癌症、脑发育、心力衰竭案例。SOFA 输出的是统计潜在因子;协变量完整性、初始化稳定性、与现有工具的公平基准、独立队列复现和功能实验仍决定其生物学可信度。

同主题情报