学术搜索 · AI 审稿 · LaTeX 协作
化学 AI 不只背分子字符串了,这套双视图模型开始更稳地预测质谱“体型”
其他 · 发布 2026-07-28T15:00:00+08:00 · 更新 2026-07-28T15:18:29+08:00
中国科学院 2026-07-28 14:13 发布官方稿,介绍成都生物所提出的 ClipMol 框架:把同一分子的 SMILES 和 InChI 两种表示当作双视图来对齐,再用动态 SMILES 随机化和对比学习提取更稳的结构特征。它不是一条“又多一个模型”的泛 AI 新闻,而是把不依赖显式三维构象的分子表示学习往前推了一步,并在离子迁移质谱的碰撞截面预测上给出稳定结果,对药物筛选、代谢物注释和分析化学任务都有现实意义。
这条新闻的新意不在于论文刚刚上线,而在于中国科学院在 2026-07-28 14:13 用官方中文稿把一项更早公开的方法学结果推到了当前业务小时里。对应 DOI 10.1021/acs.analchem.6c03104 的论文在线时间是 2026-07-18,所以本轮新增的是官方解读信号,而不是期刊初次发布。把这层时间关系说清,才能避免把旧论文伪装成“这一小时突然冒出来的新成果”。
它解决的问题其实很具体。很多化学 AI 模型把分子当作一串 SMILES 字符来学,计算便宜、扩展性也好,但这种单一写法未必能把结构信息保留下来。成都生物所这套 ClipMol 的思路,是把 SMILES 和 InChI 看成同一分子的两种互补表达,再通过动态 SMILES 随机化、双编码器和双向对比学习,逼模型去抓住两种写法背后相同的化学结构,而不是死记某一种字符串表面样子。对非专业读者来说,可以把它理解成让模型学“这个分子真正是什么”,而不只学“它通常怎样被写出来”。
官方稿给出的结果也不是泛泛而谈。ClipMol 在 MoleculeNet 十项分类和回归任务上表现稳定,大规模预训练版本 ClipMol-XL 在多项任务里做到最优或接近最优。更关键的是,它被拿去做离子迁移质谱中的碰撞截面预测。碰撞截面可以粗略理解成分子离子在气相里穿行时表现出来的“体型”和受阻程度,常被用来帮助判断未知分子到底是谁。CAS 稿件写到,模型在 METLIN-CCS 和 ALLCCS 两个数据集上都保持了稳定表现,即使冻结预训练编码器、只训练下游回归层,R 2 仍达到 0.876,说明学到的分子表示本身已经带有相当多与 CCS 相关的结构信息。
它为什么值得放进这一小时?因为不少化学和药物场景都想要“尽量不用昂贵三维构象,也别先堆一大堆外部语料”的模型方案。如果双视图对齐真能稳定提供可迁移的结构表征,那么分子筛选、代谢物注释、分析化学里的自动识别和后续小样本下游任务,都会多一个更容易部署的基础层。这不是说它已经替代所有三维建模路线,而是说明二维字符串表示并不只能停留在“便宜但粗糙”的老位置。
边界也要讲清。当前能直接核验的公开信息主要来自 CAS 官方稿和 DOI 元数据,足够确认发布时间、方法主线、数据集名称和关键指标;但还不足以替代对全文 benchmark 设计、对照基线和适用范围的逐节复核。因此,这更适合作为“化学 AI 的表示学习底座往前挪了一步”的科研进展,而不是“所有质谱预测问题已经被解决”。
信息来源
可信度说明
时间归属以中国科学院科研进展页 PubDate 2026-07-28 14:13 为准;方法与结果细节可由同页正文和 DOI 10.1021/acs.analchem.6c03104 的题名与上线元数据交叉核验。当前公开可直接核验的数字主要来自官方解读,全文 benchmark 设计与局限仍待逐节复核。