学术搜索 · AI 审稿 · LaTeX 协作
OpenAI 预览 GPT-5.6 Sol:长时程安全、代码与生物工作流能力被放进“先受限再放开”的新发布节奏
学术圈重大事件 · 发布 2026-06-28T08:36:18+08:00 · 更新 2026-07-08T14:37:59+08:00
核心结论
OpenAI 6 月 26 日开始有限预览 GPT-5.6 系列,其中 Sol 被定义为旗舰模型,并把代码、基因组学和网络安全长时程工作流能力与更厚的安全栈一并推出。真正重要的不是又一次模型命名升级,而是前沿模型发布节奏明显变了:能力评估、分层防护、受信伙伴先试和政府沟通被放进同一套流程里,显示模型能力竞赛正在更直接地进入安全治理轨道。
据 OpenAI 6 月 26 日发布的说明,OpenAI 开始对 GPT-5.6 系列做有限预览,其中 Sol 被定义为旗舰模型,Terra 面向日常工作平衡成本与能力,Luna 则强调速度和低价。真正值得注意的不是命名更新,而是这次预览的发布方式和强调重点:OpenAI 把模型的长时程代码、生物和网络安全工作流能力,与更厚的安全栈、受限合作伙伴预览和政府沟通流程同时推出,表明前沿模型发布正在被重新包装成“能力进步 + 风险治理”的联合动作。
页面给出的能力描述相当具体。OpenAI 表示,GPT-5.6 Sol 在 Terminal-Bench 2.1 上创下新的最佳结果,针对需要规划、迭代和工具协调的命令行工作流做了强化;在 GeneBench v1 上,它比 GPT-5.5 展现出更强的长时程基因组学和定量生物学分析能力,同时使用更少 token;在网络安全侧,官方称其在 ExploitBench 上以约三分之一输出 token 达到与 Mythos Preview 竞争的表现。与此同时,Sol 新增 max reasoning effort,并引入依赖 subagents 的 ultra 模式,说明其目标已不只是“单轮回答更强”,而是把多步骤复杂任务进一步推向代理化执行。
更值得追踪的是发布与安全机制的绑定。OpenAI 写明,GPT-5.6 Sol 搭配了“迄今最强”的安全栈,并针对高风险活动、敏感网络安全请求和重复滥用进行了强化;系统使用模型级拒答、实时网络安全和生物滥用分类器、账号级审查、差异化访问和持续测试等分层手段。官方还披露,为寻找通用越狱和鲁棒性弱点,团队投入了超过 70 万 A100 等效 GPU 小时做自动化红队测试,并明确称 Sol 未跨过 Preparedness Framework 下的 Cyber Critical 阈值。这意味着 OpenAI 想传递的核心信息并不是“模型可以做更多攻击”,而是“模型在更强防线下被谨慎地给到一小批人先用”。
这条更新为什么重要?因为它显示前沿模型的发布逻辑正在变化。此前很多大模型升级主要围绕公开能力榜、产品功能或价格展开,而这次 OpenAI 把生物、网络安全和长时程代理能力放在同一篇发布文中,又把面向美国政府的事前沟通、合作伙伴受限预览和未来更广开放并列写出,等于把模型能力竞赛拉进了更明确的政策和安全治理轨道。对研究人员、企业安全团队和模型监管观察者来说,这种节奏本身就是新闻,因为它会影响未来谁能先接触模型、哪些评估先公开、哪些高风险能力先被门控。
但证据边界也必须写透。当前公开信息完全来自 OpenAI 自身发布和其引用的系统卡,尚不是大范围独立复现后的外部共识;而且预览期只向少量受信合作伙伴开放,普通开发者和企业用户还无法直接验证实际可用性、误拦截率和长期工作流收益。更稳妥的判断是,截至 2026 年 6 月 26 日,OpenAI 正在把下一代前沿模型发布做成一次兼顾能力展示、受限试用和安全治理实验的组合动作,而不是单纯的公开上线。
信息来源
可信度说明
证据来自 OpenAI 官方发布页,可直接核验 limited preview、Sol/Terra/Luna 分层、Terminal-Bench 2.1、GeneBench v1、ExploitBench、`max` reasoning、`ultra` subagents、70 万 A100 等效 GPU 小时红队测试以及未跨过 Cyber Critical 阈值等表述。边界在于,这些评估主要由公司侧发布,尚未经过广泛第三方复现,且模型仍处受限预览阶段。
同主题情报
- 动物所 / `Cell`:`disc-Gastruloid` 首次把人类原条形成推进到可空间重构、可延长培养的体外模型
中国科学院 `2026-07-08` 官方稿显示,团队构建的人类 `disc-Gastruloid` 在 `72` 小时共培养后形成类原条样区域,延长培养后超 `80%` 继续发育为轴向不对称三维胚胎样结构,分出 `14` 类细胞群并与着床后 `21` 天天然胚胎较高相似。它的重要性,在于把人类原肠运动这个长期难直接观察的发育“黑箱”推进到可重复、可操控的体...
- 银河系最快恒星逼近中心黑洞:峰值约每秒 2.5 万公里,或可测量自旋
Science 与美联社 8 月 19 日报道,甚大望远镜数据识别出银河系内迄今已知速度最快的恒星:峰值约每秒 2.5 万公里,绕人马座 A* 一周约 8.7 年,且比此前纪录保持者更接近黑洞。长期高精度跟踪可能约束银河系中心黑洞自旋,但当前只是发现和轨道测量起点,尚未得到自旋值。
- 嫦娥七号以四器协同搜寻月球南极水冰,跳跃探测器瞄准永久阴影区
Science 8 月 19 日更新嫦娥七号任务:轨道器、着陆器、巡视器和跳跃探测器将在鹊桥二号支持下调查月球南极水冰与挥发物,四平台合计 18 项载荷,并计划让跳跃探测器进入永久阴影坑现场分析。公开资料仍只给出 2026 年下半年发射口径,最终日期、落点与工程参数需以官方通告为准。
- M87 黑洞第一次有了双频“体检图”,研究者开始按位置读等离子体状态
中国科学院 2026-07-28 08:18 发布官方稿,介绍上海天文台团队把 1.3 毫米和 3.5 毫米两张 M87 黑洞视界尺度图像合起来,首次做出空间分辨的谱指数分布。简单说,这不只是把黑洞拍得更清楚,而是开始按位置判断视界附近等离子体在不同半径上更接近“自吸收很强的厚辐射”还是“更容易透出的薄辐射”。关键转折出现在距黑洞中心约 30 微角秒处,并与...
- Moderna mRNA 流感疫苗获批,确诊病例相对标准疫苗减少 26.6%
Nature 8 月 13 日梳理 Moderna 的 mRNA 流感疫苗 mFLUSIVA:FDA 于 8 月 5 日批准其用于 50–64 岁成人,并对 65 岁以上人群给予加速批准,计划进入美国 2026–27 流感季。超过 4 万人的试验中,mRNA 组 2% 出现实验室确诊流感,对照标准疫苗组为 2.8%,相对减少 26.6%;常见不良反应多为轻中...
- KIST 公布 A²SG 训练方法,以自适应非对称梯度改善深层脉冲神经网络
KIST 8 月 10 日公布已获 ICML 2026 接收的 A²SG 训练方法,用自适应窗口和非对称代理梯度缓解深层脉冲神经网络的梯度变化与时间不一致。机构称该方法在 ImageNet 等任务提高准确率且训练开销低于所比较基线;论文与代码可查,但相对能耗和商业化前景仍需独立复现及真实神经形态硬件验证。