Scholay

学术搜索 · AI 审稿 · LaTeX 协作

Nature Communications:机器视觉开始试探“慢思考”,推理时算力被写进视觉模型性能曲线

顶级刊物论文速递 · 发布 2026-06-24T16:18:00+08:00 · 更新 2026-06-24T16:47:17+08:00

Nature Communications 6 月 23 日发表的一篇论文提出面向机器视觉的“双系统”推理范式,让模型在推理阶段通过更长思考时间、候选解竞争和自我修正提升表现,而不只依赖更大标注集或预训练。作者称该方法在多类视觉任务和五个器官的癌症定位任务中优于大规模监督学习、foundation models 甚至人类专家。它的重要性在于把 inference-time compute 明确引入视觉研究;不确定性则在于论文页面目前仍标注为未编辑版本,关键实验边界仍需更完整审阅与复现。

Nature Communications 于 2026 年 6 月 23 日发表一篇题为 Reasoning in machine vision by learning fast and slow thinking 的论文。它值得进入本轮顶刊栏,不是因为“受《思考,快与慢》启发”这种标题修辞,而是因为作者把近年大模型中流行的 inference-time compute 思路,从语言和数学任务明确搬到了视觉任务里:模型不再只在训练阶段学完就结束,而是在推理阶段通过更长“思考时间”不断提出、竞争和修正候选解。这意味着视觉系统的性能提升路径,可能不必完全依赖更大标注集或更重监督训练。

根据论文摘要,作者构造了一个双系统范式。System I 负责在熟悉任务中快速提出并验证解,System II 则在标注数据有限时借助 self-play reinforcement learning 迭代修正预测,让模型通过“提出方案、相互竞争、反复收敛”的过程完成更慢的推理。论文强调,这不是把语言链式推理生硬迁移到图像上,而是为视觉问题设计一种可随着推理时算力增加而持续改进的机制。作者报告称,该方法在多类计算机视觉任务以及覆盖五个器官的癌症定位任务中,表现优于大规模监督学习、foundation models,甚至优于人类专家。

这项工作的意义首先在研究方法论层面。过去视觉模型的改进,主路径通常是更大的预训练、更丰富标签或更复杂架构;而这篇论文主张,至少在数据稀缺、任务复杂、又难以通过更多标注直接解决的场景里,推理阶段的计算本身可以成为独立性能杠杆。这与语言模型世界近一年的变化形成呼应,但又提出了一个更棘手的问题:当任务没有明确符号规则、也不能像数学题那样写出逐步文字链时,视觉系统如何“思考”。论文给出的回答,是让模型在内部竞争多个解并迭代修正,而非一次性输出最终判断。

对科研和应用生态来说,最值得关注的不是“优于人类专家”这类容易被媒体放大的表述,而是它可能改变今后视觉模型评估和部署的参数。若视觉模型真的能像语言模型一样对推理时算力更敏感,研究者和产品团队就要重新考虑 latency、算力预算、边缘部署与精度收益之间的交换关系,特别是在医学影像等高风险场景中。与此同时,这篇论文目前仍主要建立在摘要与期刊页面可见信息上,全文尚注明为未编辑版本;所谓“优于人类专家”的适用任务范围、基线设置和外部复现难度,都需要后续同行更细致审查。因此它更像是一个值得严肃跟踪的新方向,而不是已经尘埃落定的视觉推理范式胜利。

信息来源

可信度说明

证据直接来自 Nature Communications 正式论文页面,可核验发表日期、摘要、作者机构和 DOI。需要注意页面明确标注当前为未编辑版本,且“优于人类专家”等结论仍需结合全文实验设计、对照基线和后续复现来评估,因此本文只把它写作研究方向突破,不写成能力已经定型的行业结论。