Scholay

学术搜索 · AI 审稿 · LaTeX 协作

OpenAI 发布 LifeSciBench,生命科学 AI 评测从答题转向研究工作流

学术圈重大事件 · 发布 2026-06-19T19:53:00+08:00 · 更新 2026-06-19T19:57:12+08:00

核心结论

OpenAI 6 月 17 日发布 LifeSciBench,称这是由专家撰写、专家复核、面向真实生命科学研发任务的评测集。它包含 750 个任务、1,062 个任务附件、173 名科学家贡献者和 453 名独立评审,覆盖证据处理、分析、实验设计、转化判断和科学沟通等七类工作流。值得关注的是,LifeSciBench 把模型是否“能答对”进一步拆成是否能处理不完整证据、复杂工件和可操作建议;OpenAI 同时披露 GPT-Rosalind 相比 GPT-5.5 有进步,但在工件密集和精确输出任务上仍明显不足。

OpenAI 官方页面显示,LifeSciBench 的目标不是再造一个生物学知识题库,而是评估 AI 系统能否在生命科学研究中承担更接近“合作者”的任务。页面称,现实研发工作很少是单一事实召回,研究者需要解释不完整证据、协调互相冲突的结果、设计困难实验、排查 assay、评估转化风险,并在不确定条件下决定下一步。

OpenAI 发布 LifeSciBench,生命科学 AI 评测从答题转向研究工作流
OpenAI 发布 LifeSciBench,生命科学 AI 评测从答题转向研究工作流(图源:OpenAI 官方发布)

评测集的结构也围绕这一点展开。OpenAI 称 LifeSciBench 包含 750 个专家撰写任务,覆盖七类工作流和七个生物学领域;任务附带 1,062 个工件,包括图、PDF、表格、序列文件、结构或化学文件以及网页引用。79% 的任务需要多步推理或决策,平均每题约四步;53% 的任务要求模型解读或综合至少一个工件。这使评测重心从“模型能否说出正确术语”转向“模型能否在证据边界内给出专家可用判断”。

评分方式同样是关键信息。页面披露,LifeSciBench 的任务由 173 名具备博士训练和生物技术或制药行业经验的科学家创建,并经 453 名未参与出题的专家独立复核;评审者 97% 持有博士或同等学位。每个任务配有细粒度 rubric,总计 19,020 条评分标准,平均每题 25 条,用来评价科学正确性、理由、限制条件、格式和对研究决策的实际帮助。

结果部分显示,GPT-Rosalind 的整体精确通过率从 GPT-5.5 的 25.7% 提升到 36.1%,在科学沟通和转化任务上提升更明显;但页面也强调,设计、优化、预测和分析仍是难点。带附件或 URL 的任务上,GPT-Rosalind 通过率从纯文本任务的 45.1% 降至 28.1%;要求精确序列、结构或数值输出时表现更弱。这对科研 AI 产品的意义很直接:模型已有助于证据整理和专家表达,但还不能被当作可直接产出实验设计、序列构建或监管判断的自动系统。

后续需要观察两点。第一,LifeSciBench 是否会开放足够透明的任务、评分与复现实验,避免评测只服务于单一模型路线。第二,基准分数如何与真实实验室效率、错误率、合规风险和研发产出相连接。OpenAI 也承认该基准不是活体研究环境的替代品,下一步仍需在更长周期、更多轮反馈和真实研发流程中验证模型能否提升科学产出。

信息来源

可信度说明

来源为 OpenAI 官方研究发布,给出任务规模、专家构成、评审流程、评分标准和模型结果。证据边界在于,基准由模型提供方发布,任务集开放度、外部复核和不同模型横向比较仍需后续确认;结果应被视为评测信号,而不是真实研发效率的直接证明。

同主题情报

  • 动物所 / `Cell`:`disc-Gastruloid` 首次把人类原条形成推进到可空间重构、可延长培养的体外模型

    中国科学院 `2026-07-08` 官方稿显示,团队构建的人类 `disc-Gastruloid` 在 `72` 小时共培养后形成类原条样区域,延长培养后超 `80%` 继续发育为轴向不对称三维胚胎样结构,分出 `14` 类细胞群并与着床后 `21` 天天然胚胎较高相似。它的重要性,在于把人类原肠运动这个长期难直接观察的发育“黑箱”推进到可重复、可操控的体...

  • 银河系最快恒星逼近中心黑洞:峰值约每秒 2.5 万公里,或可测量自旋

    Science 与美联社 8 月 19 日报道,甚大望远镜数据识别出银河系内迄今已知速度最快的恒星:峰值约每秒 2.5 万公里,绕人马座 A* 一周约 8.7 年,且比此前纪录保持者更接近黑洞。长期高精度跟踪可能约束银河系中心黑洞自旋,但当前只是发现和轨道测量起点,尚未得到自旋值。

  • 嫦娥七号以四器协同搜寻月球南极水冰,跳跃探测器瞄准永久阴影区

    Science 8 月 19 日更新嫦娥七号任务:轨道器、着陆器、巡视器和跳跃探测器将在鹊桥二号支持下调查月球南极水冰与挥发物,四平台合计 18 项载荷,并计划让跳跃探测器进入永久阴影坑现场分析。公开资料仍只给出 2026 年下半年发射口径,最终日期、落点与工程参数需以官方通告为准。

  • M87 黑洞第一次有了双频“体检图”,研究者开始按位置读等离子体状态

    中国科学院 2026-07-28 08:18 发布官方稿,介绍上海天文台团队把 1.3 毫米和 3.5 毫米两张 M87 黑洞视界尺度图像合起来,首次做出空间分辨的谱指数分布。简单说,这不只是把黑洞拍得更清楚,而是开始按位置判断视界附近等离子体在不同半径上更接近“自吸收很强的厚辐射”还是“更容易透出的薄辐射”。关键转折出现在距黑洞中心约 30 微角秒处,并与...

  • Moderna mRNA 流感疫苗获批,确诊病例相对标准疫苗减少 26.6%

    Nature 8 月 13 日梳理 Moderna 的 mRNA 流感疫苗 mFLUSIVA:FDA 于 8 月 5 日批准其用于 50–64 岁成人,并对 65 岁以上人群给予加速批准,计划进入美国 2026–27 流感季。超过 4 万人的试验中,mRNA 组 2% 出现实验室确诊流感,对照标准疫苗组为 2.8%,相对减少 26.6%;常见不良反应多为轻中...

  • KIST 公布 A²SG 训练方法,以自适应非对称梯度改善深层脉冲神经网络

    KIST 8 月 10 日公布已获 ICML 2026 接收的 A²SG 训练方法,用自适应窗口和非对称代理梯度缓解深层脉冲神经网络的梯度变化与时间不一致。机构称该方法在 ImageNet 等任务提高准确率且训练开销低于所比较基线;论文与代码可查,但相对能耗和商业化前景仍需独立复现及真实神经形态硬件验证。