Nature:LLM 预测社会科学实验结果开始逼近 pooled human forecasts
学术圈重大事件 · 发布 2026-07-09T08:35:55+08:00 · 更新 2026-07-09T08:43:25+08:00
Nature 2026-07-08 论文用 70 个美国全国代表性预注册 survey experiments、469 个实验效应和 119330 名参与者数据评估 LLM 预测能力,发现 GPT-4 派生预测与真实 treatment effects 高度相关,准确度接近 pooled human forecasts,但会系统性高估效应大小。它把 LLM 参与社会科学实验前评估的争论推进到可量化基准。
Nature 2026-07-08 论文 Large language models can predict the results of social science experiments 构建了一个可核验的社会科学实验预测基准。研究档案包含 70 个美国全国代表性、预注册 survey experiments,覆盖 469 个实验效应和 119330 名参与者;研究者让 LLM 模拟不同实验条件下代表性美国个体的回应,再通过条件差异推断 treatment effects。
Nature:LLM 预测社会科学实验结果开始逼近 pooled human forecasts(图源:Nature 论文页)
论文摘要显示,GPT-4 派生预测与真实实验效应高度相关,准确度接近 pooled human forecasts;对于训练截点之后才发表或公开的研究,以及若干开放权重模型,相关性仍然较高。在另一个包含 15 个 megastudies、606 个效应的次级档案里,相关性下降,但仍接近 pooled expert forecasters。研究还调查了 460 名社会科学研究者,并把模型预测放到 pilot testing、intervention selection 和 identifying effects needing replication 等实际场景中评估。
重要性在于,它没有泛泛讨论 LLM 能不能替代受试者,而是把模型放进实验设计前评估和复现实验优先级排序这些真实科研工作流里做量化对照。边界同样明确:论文也指出模型会系统性高估效应大小,且它测试的是预测和辅助能力,不等于可以替代真实样本、抽样设计、伦理审查或因果识别。
后续观察点:一看独立团队能否在不同国家、非美国样本和更强干预异质性场景复现预测能力;二看模型是否持续高估实验效应大小,以及能否通过校准、盲测和透明报告降低风险;三看期刊、IRB 和资助机构会不会要求披露 LLM 参与 pilot testing 或实验优先级排序的方式。
信息来源
可信度说明
核心事实直接来自 Nature 正式论文摘要。当前可直接核验 70 个预注册实验、469 个效应、119330 名参与者、15 个 megastudies 与 606 个次级效应,以及与 pooled human forecasts 相近但会系统性高估效应大小这些关键信息。边界在于,论文同样明确强调这是一项预测能力评估,不等于 LLM 可以替代真实受试者、抽样设计或伦理约束。