OpenAI 预览 GPT-5.6 Sol:长时程安全、代码与生物工作流能力被放进“先受限再放开”的新发布节奏
学术圈重大事件 · 发布 2026-06-28T08:36:18+08:00 · 更新 2026-07-07T20:36:32+08:00
OpenAI 6 月 26 日开始有限预览 GPT-5.6 系列,其中 Sol 被定义为旗舰模型,并把代码、基因组学和网络安全长时程工作流能力与更厚的安全栈一并推出。真正重要的不是又一次模型命名升级,而是前沿模型发布节奏明显变了:能力评估、分层防护、受信伙伴先试和政府沟通被放进同一套流程里,显示模型能力竞赛正在更直接地进入安全治理轨道。
据 OpenAI 6 月 26 日发布的说明,OpenAI 开始对 GPT-5.6 系列做有限预览,其中 Sol 被定义为旗舰模型,Terra 面向日常工作平衡成本与能力,Luna 则强调速度和低价。真正值得注意的不是命名更新,而是这次预览的发布方式和强调重点:OpenAI 把模型的长时程代码、生物和网络安全工作流能力,与更厚的安全栈、受限合作伙伴预览和政府沟通流程同时推出,表明前沿模型发布正在被重新包装成“能力进步 + 风险治理”的联合动作。
页面给出的能力描述相当具体。OpenAI 表示,GPT-5.6 Sol 在 Terminal-Bench 2.1 上创下新的最佳结果,针对需要规划、迭代和工具协调的命令行工作流做了强化;在 GeneBench v1 上,它比 GPT-5.5 展现出更强的长时程基因组学和定量生物学分析能力,同时使用更少 token;在网络安全侧,官方称其在 ExploitBench 上以约三分之一输出 token 达到与 Mythos Preview 竞争的表现。与此同时,Sol 新增 max reasoning effort,并引入依赖 subagents 的 ultra 模式,说明其目标已不只是“单轮回答更强”,而是把多步骤复杂任务进一步推向代理化执行。
更值得追踪的是发布与安全机制的绑定。OpenAI 写明,GPT-5.6 Sol 搭配了“迄今最强”的安全栈,并针对高风险活动、敏感网络安全请求和重复滥用进行了强化;系统使用模型级拒答、实时网络安全和生物滥用分类器、账号级审查、差异化访问和持续测试等分层手段。官方还披露,为寻找通用越狱和鲁棒性弱点,团队投入了超过 70 万 A100 等效 GPU 小时做自动化红队测试,并明确称 Sol 未跨过 Preparedness Framework 下的 Cyber Critical 阈值。这意味着 OpenAI 想传递的核心信息并不是“模型可以做更多攻击”,而是“模型在更强防线下被谨慎地给到一小批人先用”。
这条更新为什么重要?因为它显示前沿模型的发布逻辑正在变化。此前很多大模型升级主要围绕公开能力榜、产品功能或价格展开,而这次 OpenAI 把生物、网络安全和长时程代理能力放在同一篇发布文中,又把面向美国政府的事前沟通、合作伙伴受限预览和未来更广开放并列写出,等于把模型能力竞赛拉进了更明确的政策和安全治理轨道。对研究人员、企业安全团队和模型监管观察者来说,这种节奏本身就是新闻,因为它会影响未来谁能先接触模型、哪些评估先公开、哪些高风险能力先被门控。
但证据边界也必须写透。当前公开信息完全来自 OpenAI 自身发布和其引用的系统卡,尚不是大范围独立复现后的外部共识;而且预览期只向少量受信合作伙伴开放,普通开发者和企业用户还无法直接验证实际可用性、误拦截率和长期工作流收益。更稳妥的判断是,截至 2026 年 6 月 26 日,OpenAI 正在把下一代前沿模型发布做成一次兼顾能力展示、受限试用和安全治理实验的组合动作,而不是单纯的公开上线。
信息来源
可信度说明
证据来自 OpenAI 官方发布页,可直接核验 limited preview、Sol/Terra/Luna 分层、Terminal-Bench 2.1、GeneBench v1、ExploitBench、`max` reasoning、`ultra` subagents、70 万 A100 等效 GPU 小时红队测试以及未跨过 Cyber Critical 阈值等表述。边界在于,这些评估主要由公司侧发布,尚未经过广泛第三方复现,且模型仍处受限预览阶段。