学术搜索 · AI 审稿 · LaTeX 协作
PNAS:AI agents 对默认项、建议和高亮信息更敏感,智能体安全评估需要纳入“选择架构”
顶级刊物论文速递 · 发布 2026-06-19T02:36:54+08:00 · 更新 2026-06-19T02:44:45+08:00
核心结论
PNAS 在线发表《AI agents are sensitive to nudges》,比较 LLM agent 在默认项、建议、信息高亮和“最优”助推下的决策变化。结果显示模型常比人类更容易被弱提示推动,链式思考和人类示例也不能稳定修正,提示 agent 评测应纳入界面排序、默认值和成本提示等非恶意选择架构。
PNAS 论文页面显示,Manuel Cherep、Pattie Maes 和 Nikhil Singh 的论文《AI agents are sensitive to nudges》发表在 PNAS 123 卷 25 期,文章号 e2537030123,DOI 为 10.1073/pnas.2537030123。第三方索引页显示其 2026 年 6 月 15 日在线发表,6 月 23 日进入期号。
论文把问题放在 LLM agent 的实际部署场景:模型不只是回答问题,还会代表用户做选择、调用工具和完成任务。研究者将人类决策实验改造为模型任务,测试默认项、建议、信息高亮,以及由资源理性人类选择模型推导出的“最优”助推。人类行为被用作可预期敏感性的基线,重点不是证明模型是否“像人”,而是比较它们在选择架构变化下是否稳定。
公开摘要和作者代码库显示,跨模型和提示策略的结果并不稳定。LLM 有时为获得信息支付过高成本,有时忽视可用信息;更关键的是,它们对弱提示的反应往往强于人类,同样的默认项或高亮信息可能把模型选择推向更好,也可能推向更差的收益结果。链式思考提示和放入人类数据示例,并不能可靠稳定这种行为;部分推理优化模型在某些配置下接近人类敏感度,但代价是更高计算量且表现不一致。
这项研究的外溢价值在 AI 安全和产品评估。很多 agent 评测关注越狱、工具调用成功率、长任务完成率或恶意指令防御,但真实产品界面中的排序、默认按钮、推荐文本、成本提示和高亮信息也会改变模型行为。若 agent 比人类更容易被这些非恶意线索推动,开发者就需要把选择架构纳入回归测试,尤其是在金融、医疗、招聘、科研检索和企业流程自动化等高影响场景。
可信边界也要分清。论文任务是实验化的选择场景,不等同于所有生产级 agent 系统;模型版本、提示格式、工具环境和温度设置都可能改变结果。作者 GitHub 提供代码和分析目录,有助于复现和扩展,但第三方复验、更多真实界面任务和跨语言场景仍是下一步关键。
信息来源
可信度说明
论文发表于 PNAS,DOI、期号和作者可核验;作者 GitHub 提供代码和方法线索,第三方索引页补充在线发表日期。边界在于,PNAS 页面本轮抓取受限,正文细节主要来自摘要、索引和代码库说明,生产系统外推仍需谨慎。
同主题情报
- Nature:剑桥团队首次用 base editing 直接研究人类胚胎基因功能,NANOG 被证实决定未来“身体”谱系
剑桥大学团队在 *Nature* 报告称,研究者首次把更精确的 base editing 真正用于人类胚胎基因功能研究。阻断 NANOG 后,未来形成身体的上胚层无法发育,而后续形成胎盘和卵黄囊的支持性组织仍可形成。重要性在于它把人类早期发育研究从模式动物外推推进到更直接的人类证据;但该研究仍严格限于受监管的基础研究框架,不能被解读为临床胚胎编辑已接近应用。
- `Nature Medicine`:ChatGPT-4o 辅助的基层临床决策支持在肯尼亚随机试验中未显著降低 14 天治疗失败
`Nature Medicine` 6 月 26 日发表的 pragmatic cluster-randomized trial,把生成式 AI 医疗辅助从离线 benchmark 推到了肯尼亚 16 家基层医疗机构的真实工作流中。103 名临床官员、9691 名患者纳入试验后,ChatGPT-4o 辅助组并未显著降低 14 天治疗失败率,但也没有识别出与干...
- 把镧系元素塞进 MXene 后,这种二维材料第一次同时拿到半导体和铁磁两张牌
这条中科院科研进展值得看,不只是因为又多了一种二维材料,而是它把 MXene 过去偏金属性的限制打破了。宁波材料所等团队用“化学剪刀”亚层编辑,把镧系元素嵌入晶格,做出兼具半导体特性和铁磁性的镧系 MXene,并把结果发在 Nature。对普通读者,关键信息不是“量子计算概念”又多了一个名字,而是自旋电子学长期缺的那类材料组合终于出现了可合成样本。
- Nature:人形机器人进入体内手术可行性研究,医疗具身智能从演示走向安全边界验证
Nature 7 月 8 日论文“In vivo feasibility study of humanoid robots in surgery”报告人形机器人在手术场景中的体内可行性研究。该信号的重要性不在于宣布临床替代医生,而在于把人形机器人从通用操控演示推进到高风险医疗环境的可行性、安全边界和工作流评估。证据来自 Nature 论文页与 DOI,仍需关...
- Nature:强化学习控制量子纠错,量子计算校准从停机重调转向在线自适应
Nature 7 月 8 日论文“Reinforcement learning control of quantum error correction”提出用强化学习处理量子纠错控制参数随环境漂移而变化的问题。论文页摘要指出,现有方案往往需要中止量子计算进行重校准,而长时量子算法难以承受这种停机。该研究的价值在于把 AI 控制策略嵌入量子纠错运行环节,但仍需...
- 只差不到 0.1 埃的离子也想分开?这项 Nature 研究先把膜缝排好,再把它锁住
这项 Nature 论文值得看,不只是因为二维膜又刷新了一组分离数据,而是它给“怎么把膜层间距稳稳锁住”提供了更可复制的工艺思路。理化所等团队利用膜内限域水和膜外体相水冰点不同,把单体组装和聚合固化拆成先后两步,做出兼顾通量、选择性和稳定性的氧化石墨烯复合膜,并演示了对水合直径只差不到 0.1 埃的铷离子和钾离子的分离。别把它理解成马上能工业化提取关键矿物;...