Scholay

学术搜索 · AI 审稿 · LaTeX 协作

MIT / Microsoft:Murakkab 把 agent 工作流调度做成系统层优化,视频问答与代码生成场景算力压到 35%

学术圈重大事件 · 发布 2026-06-26T09:06:00+08:00 · 更新 2026-06-26T09:21:35+08:00

MIT 与 Microsoft 6 月 25 日公布的 Murakkab,不再把 agent 优化局限在提示词或单模型替换,而是把模型、工具、硬件和部署方式一起纳入自动搜索。在公开的多步骤视频问答和代码生成测试里,它把计算量压到约 35%、能耗压到约 27%,并把成本降到其他方法的 25% 以下,显示 agent 竞争正在从“谁最会回答”转向“谁最会以更低系统成本完成任务”。

6 月 25 日,MIT News 报道 MIT 与 Microsoft 研究团队推出 Murakkab,这不是又一个“更会写提示词”的 agent 框架,而是一套面向多步骤工作流的系统级编排方法。按照 MIT 的描述,开发者只需用自然语言说明工作流要完成什么,系统就会替用户在模型、工具、硬件与部署方式之间做联动优化,目标是在满足任务要求的前提下减少计算、能耗和云上开销。

MIT / Microsoft:Murakkab 把 agent 工作流调度做成系统层优化,视频问答与代码生成场景算力压到 35%
MIT / Microsoft:Murakkab 把 agent 工作流调度做成系统层优化,视频问答与代码生成场景算力压到 35%(图源:MIT News)

这条进展之所以值得关注,在于 agent 产业化的瓶颈已经逐渐从“模型能不能做”转向“整条链路值不值得长期跑”。视频问答、代码生成、文档检索和外部工具调用等 agent 场景,往往把多个模型与外部组件串在一起,人工调优通常只能局部改 prompt 或替换单个模型,却很难同时兼顾吞吐、精度、硬件资源和部署成本。Murakkab 的切入点,就是把这些原本分散在工程师脑内的取舍,转成可自动搜索的系统问题。

MIT 给出的可核验结果较具体。报道称,在视频问答和代码生成等不同 agent 工作流上,Murakkab 在满足用户要求的同时,只使用了约 35% 的计算量、约 27% 的能耗,并把成本压到其他方法的 25% 以下。团队还强调,这种动态编排允许用户主动交换精度与成本:在一个案例里,系统把能耗降了一个数量级以上,而准确率仅下降约 2%。这意味着 agent 优化不再只是“换更小模型”,而是通过不同模型、步骤和硬件的组合,寻找过去很难手工发现的配置。

它对科研和产业生态的意义,首先是把 agent 的资源效率问题推到了台前。随着越来越多应用从单轮聊天转向持续运行的多步骤代理,真正决定可部署性的未必是模型榜单名次,而是整条链路在云平台上的单位任务成本与能耗曲线。如果 MIT / Microsoft 这类方法能在更大规模集群、更多工作流类别上复现,agent 工程的竞争焦点会进一步从提示工程转向系统编排、资源调度和跨模型协同。但现阶段仍需注意,公开结果主要来自机构新闻稿中总结的测试场景,离第三方基准和跨平台复现还有距离。

信息来源

可信度说明

来源为 MIT News 官方报道,核心数字包括约 35% 计算量、约 27% 能耗、成本低于 25% 以及单案例中“能耗降一个数量级、准确率降约 2%”。这些信息目前主要来自机构转述与论文摘要级别表述,仍需等待 OSDI 论文全文、代码或第三方复现实验进一步验证。