Scholay

学术搜索 · AI 审稿 · LaTeX 协作

可解释蒸馏审计 SpliceAI、Pangolin 与 AlphaGenome:CpG 混杂系统性抬高预测

顶级刊物论文速递 · 发布 2026-08-21T08:40:00+08:00 · 更新 2026-08-21T08:43:24+08:00

核心结论

Genome Biology 8 月 21 日用约 100 万合成序列训练可解释蒸馏模型,近似 SpliceAI、Pangolin 与 AlphaGenome 的剪接输出,留出数据相关达 0.94—0.99。审计显示三者很大程度依赖简单加性基序,CpG 含量高会系统性抬高外显子预测,并漏掉部分 RNA 结构效应;这揭示临床变异解释的外推风险,但不代表模型整体失效。

论文结果。 Genome Biology 论文页面 8 月 21 日发表一项基因组深度学习可靠性研究。团队提出“可解释蒸馏”框架:训练结构透明的小模型去复现复杂模型的输出,再用蒸馏模型暴露原模型依赖的序列逻辑和失败条件。研究对象覆盖剪接专用模型 SpliceAI、Pangolin,以及同时预测多类基因组功能的基础模型 AlphaGenome。

可解释蒸馏审计 SpliceAI、Pangolin 与 AlphaGenome:CpG 混杂系统性抬高预测
可解释蒸馏审计 SpliceAI、Pangolin 与 AlphaGenome:CpG 混杂系统性抬高预测(图源:Genome Biology 论文页面)

先验证预测。 三个模型在三种实验测定中的外显子包含水平预测总体有效:Liao 等数据的 Pearson 相关系数为 0.83—0.86,FAS 外显子 6 为 0.81—0.88,MFASS 为 0.37—0.44。团队随后生成约 100 万条合成序列训练蒸馏模型;蒸馏输出与原模型在留出数据上的相关达到 0.94—0.99,SpliceAI 有 98.4% 的蒸馏预测落在原值上下 15% 以内。

发现了什么。 高度近似并不需要显式建模 RNA 结构或特征交互,说明这些深度模型识别外显子时,很大程度可由序列基序的简单加性组合解释。蒸馏模型找回了已知剪接调控元件,也发现 CpG 二核苷酸是各模型最重要的正向特征之一。但 CpG 不是典型剪接因子结合基序,研究也未发现 CpG 甲基化与外显子包含的普遍关联。

混杂与盲点。 在三类实验数据中,CpG 组成均与预测误差显著相关,所有检验的 ANCOVA p 值都低于 5×10⁻³:CpG 较高的序列被系统性高估,较低的序列则被低估;相邻顺序相反的 GpC 没有同样模式,因此并非一般 GC 含量效应。模型还没有充分捕捉 RNA 结构影响,在非参考序列上表现变差。

为什么重要。 剪接预测已经被研究和临床变异解释采用,基因组基础模型也在扩大用途。若模型学到的是参考基因组中的相关性捷径,它在合成变体、罕见变异或不同人群序列上可能给出有方向性的错误。可解释蒸馏提供了一种从“单个碱基为何得分”上升到“模型总体使用什么规则”的审计路径,可用于设计去混杂训练集和压力测试。

边界。 蒸馏围绕外显子包含任务和特定版本模型构建,不等于三个模型的所有输出都由简单规则决定;MFASS 的相关性较低也受荧光测量方式影响。研究指出的是系统性风险,不是宣告模型无用。后续应在临床变异集、跨祖源序列和真实 RNA 结构扰动中量化误差,并验证重新采样或显式结构建模能否改善外推。

信息来源

可信度说明

来源为 Genome Biology 开放获取同行评议论文;三模型、三实验测定、约 100 万合成序列、0.94—0.99 蒸馏相关、98.4% 误差范围和 CpG 混杂统计均来自全文。蒸馏解释针对特定剪接任务和模型版本,不能外推为 AlphaGenome 等模型所有功能的全面审计,也不直接给出临床误判率。

同主题情报