Nature:LLM 预测社会科学实验结果开始逼近 pooled human forecasts
学术圈重大事件 · 发布 2026-07-09T08:28:00+08:00 · 更新 2026-07-09T08:31:31+08:00
Nature 于 2026-07-08 发表社会科学实验预测研究,基于 70 个美国全国代表性预注册 survey experiments、469 个实验效应和 119330 名参与者数据,发现 GPT-4 派生预测与真实 treatment effects 高度相关,准确度接近 pooled human forecasts,即便对训练截点后公开的研究仍保持较高相关性,但会系统性高估效应大小。
Nature 2026-07-08 论文把“LLM 能否替代问卷或受试者”的泛化争论压到了一个更可检验的基准上。作者构建了包含 70 个美国全国代表性、预注册 survey experiments 的档案,覆盖 469 个实验效应和 119330 名参与者,再让模型模拟不同实验条件下的受访反应并反推 treatment effects。论文摘要给出的核心结论是,GPT-4 派生预测与真实实验效应高度相关,准确度接近 pooled human forecasts;即便对训练截点之后才发表或公开的研究,这一相关性仍保持较高,在另一个包含 15 个 megastudies、606 个效应的次级档案里,相关性虽下降但仍与 pooled expert forecasters 相近。
Nature:LLM 预测社会科学实验结果开始逼近 pooled human forecasts(图源:Nature 论文页)
这条结果之所以进入本轮 major-event,不只是因为它又给出一篇 AI 研究论文,而是因为它把社会科学实验设计、干预筛选和复现实验优先级排序这些原本高度依赖人工直觉的环节,第一次放进了可以和真实实验效应逐项对照的统一评估框架。论文同时调查了 460 名社会科学研究者对用途和风险的看法,并直接测试了 pilot testing、intervention selection 和 identifying effects needing replication 等实际场景。这意味着未来关于“是否让模型参与实验前评估”的讨论,至少不必再停留在观点层面,而能围绕具体准确度、偏差形态和适用边界展开。
证据边界也必须写清。论文摘要同时强调,模型预测虽然相关性高,但会系统性高估效应大小;在 megastudy 档案中的表现也弱于主档案。更重要的是,这项工作测试的是模型对实验结果方向与量级的预测能力,而不是证明 LLM 可以替代真实受试者、消除抽样偏差或直接取代伦理审查。更稳妥的理解是,截至 2026-07-09 08:28 CST,这篇 Nature 论文把 LLM 作为实验方法辅助工具的讨论推进到了可量化、可比较的阶段,但真正进入常规科研流程之前,偏差控制、透明报告和责任边界仍是核心问题。
信息来源
可信度说明
核心事实直接来自 Nature 正式论文摘要。当前可直接核验 70 个预注册实验、469 个效应、119330 名参与者、15 个 megastudies 与 606 个次级效应,以及与 pooled human forecasts 相近但会系统性高估效应大小这些关键信息。边界在于,论文同样明确强调这是一项预测能力评估,不等于 LLM 可以替代真实受试者、抽样设计或伦理约束。