学术搜索 · AI 审稿 · LaTeX 协作
Google DeepMind:Gemini 3.5 Flash 把 computer use 并入主模型,跨平台 agent 执行动作开始标准化
学术圈重大事件 · 发布 2026-06-26T07:44:00+08:00 · 更新 2026-06-26T07:55:45+08:00
Google DeepMind 6 月 24 日宣布,computer use 不再作为独立模型存在,而是被原生并入 Gemini 3.5 Flash,可通过 Gemini API 和 Gemini Enterprise Agent Platform 调用,在浏览器、移动端和桌面环境执行跨应用任务。它的重要性不只在功能上新,而在于头部模型厂商开始把 agent 执行动作、注入防护和企业确认机制一起做成主模型标配,长链路自动化的工程门槛被明显下压。
6 月 24 日,Google DeepMind 在官方博客宣布,computer use 已从此前独立的 Gemini 2.5 computer use model,转为 Gemini 3.5 Flash 的内建工具。对外表述看似只是“功能合并”,但背后变化更接近能力栈重排:过去开发者若想让模型直接操作网页和应用,往往要额外接入专门模型或外部代理层;现在这项能力被放进主力轻量模型,意味着函数调用、搜索/地图等内建工具和图形界面操作开始在同一条产品线上汇合。
Google 公布的可核验细节比较明确。官方称 3.5 Flash 的 computer use 可让开发者构建能在浏览器、移动端和桌面环境“看见、推理并采取行动”的 agent,并把连续软件测试、跨专业应用的知识工作流程列为直接场景。博客还写到,这项能力已经可通过 Gemini API 与 Gemini Enterprise Agent Platform 调用,不再局限于单独实验模型。换句话说,Google 正在把 agent 的执行层从演示功能推向可部署接口,这比单纯模型分数更新更值得关注。
这条动态值得进“重大事件”,原因在于它改变的是 agent 工程的默认形态。过去行业把“会推理的模型”和“会点按钮的执行器”当成两层系统,稳定性、权限控制和注入防护都留给开发者自己拼装;而现在头部厂商开始把 computer use 直接下沉为主模型内建工具,并同时提供企业级确认机制和任务中止开关。对软件测试、运营自动化、企业 back-office 流程和多应用编排来说,这会明显降低原型验证门槛,也会把 agent 竞争从“会不会调用工具”推进到“能否安全完成长链路任务”。
但它离“通用自动办公助手已经成熟”仍有距离。Google 公开的是公司自述和演示场景,而不是独立第三方在复杂真实环境中的系统性成功率;官方也明确把 prompt injection 风险拿出来单独讨论,并建议继续使用 sandboxing、human-in-the-loop 和严格访问控制。更稳妥的判断是:这不是 agent 安全问题被解决了,而是头部模型厂商开始承认 computer use 需要和权限、确认、注入拦截一起打包交付,后续真正值得盯的是第三方 benchmark、失败案例和企业部署后的误操作成本是否下降。
信息来源
可信度说明
主要依据 Google DeepMind 官方博客。可直接核验的事实包括:computer use 已并入 Gemini 3.5 Flash、可经 Gemini API 和 Gemini Enterprise Agent Platform 调用,以及两项可选企业防护机制;但性能提升与企业场景价值主要来自公司自述,仍需第三方 agent benchmark 和真实部署数据验证。