Scholay

学术搜索 · AI 审稿 · LaTeX 协作

Google Research 新研究追问“为什么推理能帮模型想起事实”,LLM 记忆边界开始从“会不会”转向“怎样验证中间推理”

学术圈重大事件 · 发布 2026-06-25T05:32:00+08:00 · 更新 2026-06-25T05:37:42+08:00

核心结论

Google Research 6 月 24 日发布博文,系统解释其预印本《Thinking to Recall》为何发现“开启推理”会让模型答出原本几乎取不出的简单事实。关键不只是链式思考更长,而是模型会把额外 token 当作计算缓冲区,同时通过生成相关事实做语义预热;这让 LLM 评估开始从最终答案,进一步转向中间推理到底有没有事实支撑。

Google Research 6 月 24 日发布研究博文《Thinking to recall: How reasoning unlocks parametric knowledge in LLMs》,回到一个很基础却越来越现实的问题:很多模型在关闭“思考”模式时答不出的简单事实,为什么一旦允许先生成推理轨迹,反而能答对?这不是数学证明或多跳检索场景,而是单跳事实问答。团队把问题直接放到 Gemini-2.5 Flash、Gemini-2.5 Pro 和 Qwen3-32B 上测试,并用 SimpleQA Verified、EntityQuestions 这类闭卷问答集合比较 reasoning on/off 的差异,结论是开启推理后,模型能触达一批原本几乎不可恢复的正确答案。

Google Research 关于“Thinking to Recall”研究的配图
Google Research 6 月 24 日发布博文,解释推理如何扩大 LLM 的参数化知识召回边界。

这篇工作最值得注意的是它没有停在“链式思考有效”这层经验判断,而是继续拆机制。第一条机制是所谓计算缓冲区效应。团队把原始推理轨迹替换成重复的无意义短语,结果仅仅因为模型多生成了一段 token,最终答对率就明显高于完全关闭推理时的水平。这说明推理轨迹的价值,并不完全来自文字内容本身,还来自额外前向计算带来的内部状态细化。第二条机制则是事实预热。研究发现,模型在自然推理时常会先吐出与目标答案相关的一串中间事实,这些事实像语义桥梁一样,帮助它把最终答案“想起来”。

真正麻烦的部分也在这里。Google 同时做了大规模核验,检查中间推理里出现的事实是否可靠,结果发现只要推理链里混入哪怕一条幻觉式中间事实,最终答案正确的概率就会明显下降。换句话说,推理不是天然提高真实性,它也可能把错误放大成更有说服力的错误。这一点对当前“让模型多想一步就会更准”的产品叙事是个现实提醒。今后更重要的问题可能不只是给不给 reasoning budget,而是怎样筛掉缺乏事实支撑的中间轨迹。

这条研究之所以值得放进重大事件栏,不在于它又给 LLM 找到一个新 benchmark 提升技巧,而在于它改变了大家理解“模型记忆”的方式。过去很多评测把事实性错误看作参数里没有存住,或者排序没有排到第一;现在更接近的图景是,模型可能“知道但暂时取不出来”,而推理过程既能帮它把知识调出来,也会把伪事实一并带出来。对模型训练、推理时选择、过程奖励和科学研究场景中的可靠性控制来说,这都是直接影响设计决策的信号。

需要明确的边界是,这项工作的核心证据目前仍来自 Google 研究博客和 3 月上线的 arXiv 预印本,而不是已经过同行评议的正式期刊论文;实验对象也主要是少数几类推理模型与两个闭卷问答基准。因此,更稳妥的说法是:它为“推理为何改善事实召回”提供了一个有机制拆解的解释框架,并指出中间事实核验的必要性,而不是已经给出适用于所有模型和所有知识任务的统一定律。

信息来源

可信度说明

来源包括 Google Research 6 月 24 日官方博文和同题 arXiv 预印本。前者属于公司研究团队的一手解读,后者公开了摘要与方法方向,但目前仍是预印本、尚未完成同行评议;文中关于泛化到所有推理模型的判断应保持克制。

同主题情报

  • 动物所 / `Cell`:`disc-Gastruloid` 首次把人类原条形成推进到可空间重构、可延长培养的体外模型

    中国科学院 `2026-07-08` 官方稿显示,团队构建的人类 `disc-Gastruloid` 在 `72` 小时共培养后形成类原条样区域,延长培养后超 `80%` 继续发育为轴向不对称三维胚胎样结构,分出 `14` 类细胞群并与着床后 `21` 天天然胚胎较高相似。它的重要性,在于把人类原肠运动这个长期难直接观察的发育“黑箱”推进到可重复、可操控的体...

  • 银河系最快恒星逼近中心黑洞:峰值约每秒 2.5 万公里,或可测量自旋

    Science 与美联社 8 月 19 日报道,甚大望远镜数据识别出银河系内迄今已知速度最快的恒星:峰值约每秒 2.5 万公里,绕人马座 A* 一周约 8.7 年,且比此前纪录保持者更接近黑洞。长期高精度跟踪可能约束银河系中心黑洞自旋,但当前只是发现和轨道测量起点,尚未得到自旋值。

  • 嫦娥七号以四器协同搜寻月球南极水冰,跳跃探测器瞄准永久阴影区

    Science 8 月 19 日更新嫦娥七号任务:轨道器、着陆器、巡视器和跳跃探测器将在鹊桥二号支持下调查月球南极水冰与挥发物,四平台合计 18 项载荷,并计划让跳跃探测器进入永久阴影坑现场分析。公开资料仍只给出 2026 年下半年发射口径,最终日期、落点与工程参数需以官方通告为准。

  • M87 黑洞第一次有了双频“体检图”,研究者开始按位置读等离子体状态

    中国科学院 2026-07-28 08:18 发布官方稿,介绍上海天文台团队把 1.3 毫米和 3.5 毫米两张 M87 黑洞视界尺度图像合起来,首次做出空间分辨的谱指数分布。简单说,这不只是把黑洞拍得更清楚,而是开始按位置判断视界附近等离子体在不同半径上更接近“自吸收很强的厚辐射”还是“更容易透出的薄辐射”。关键转折出现在距黑洞中心约 30 微角秒处,并与...

  • Moderna mRNA 流感疫苗获批,确诊病例相对标准疫苗减少 26.6%

    Nature 8 月 13 日梳理 Moderna 的 mRNA 流感疫苗 mFLUSIVA:FDA 于 8 月 5 日批准其用于 50–64 岁成人,并对 65 岁以上人群给予加速批准,计划进入美国 2026–27 流感季。超过 4 万人的试验中,mRNA 组 2% 出现实验室确诊流感,对照标准疫苗组为 2.8%,相对减少 26.6%;常见不良反应多为轻中...

  • KIST 公布 A²SG 训练方法,以自适应非对称梯度改善深层脉冲神经网络

    KIST 8 月 10 日公布已获 ICML 2026 接收的 A²SG 训练方法,用自适应窗口和非对称代理梯度缓解深层脉冲神经网络的梯度变化与时间不一致。机构称该方法在 ImageNet 等任务提高准确率且训练开销低于所比较基线;论文与代码可查,但相对能耗和商业化前景仍需独立复现及真实神经形态硬件验证。