Scholay

学术搜索 · AI 审稿 · LaTeX 协作

PNAS:AI agents 对默认项、建议和高亮信息更敏感,智能体安全评估需要纳入“选择架构”

顶级刊物论文速递 · 发布 2026-06-19T02:36:54+08:00 · 更新 2026-06-19T02:44:45+08:00

核心结论

PNAS 在线发表《AI agents are sensitive to nudges》,比较 LLM agent 在默认项、建议、信息高亮和“最优”助推下的决策变化。结果显示模型常比人类更容易被弱提示推动,链式思考和人类示例也不能稳定修正,提示 agent 评测应纳入界面排序、默认值和成本提示等非恶意选择架构。

PNAS 论文页面显示,Manuel Cherep、Pattie Maes 和 Nikhil Singh 的论文《AI agents are sensitive to nudges》发表在 PNAS 123 卷 25 期,文章号 e2537030123,DOI 为 10.1073/pnas.2537030123。第三方索引页显示其 2026 年 6 月 15 日在线发表,6 月 23 日进入期号。

PNAS:AI agents 对默认项、建议和高亮信息更敏感,智能体安全评估需要纳入“选择架构”
PNAS:AI agents 对默认项、建议和高亮信息更敏感,智能体安全评估需要纳入“选择架构”(图源:Life Science Network 索引)

论文把问题放在 LLM agent 的实际部署场景:模型不只是回答问题,还会代表用户做选择、调用工具和完成任务。研究者将人类决策实验改造为模型任务,测试默认项、建议、信息高亮,以及由资源理性人类选择模型推导出的“最优”助推。人类行为被用作可预期敏感性的基线,重点不是证明模型是否“像人”,而是比较它们在选择架构变化下是否稳定。

公开摘要和作者代码库显示,跨模型和提示策略的结果并不稳定。LLM 有时为获得信息支付过高成本,有时忽视可用信息;更关键的是,它们对弱提示的反应往往强于人类,同样的默认项或高亮信息可能把模型选择推向更好,也可能推向更差的收益结果。链式思考提示和放入人类数据示例,并不能可靠稳定这种行为;部分推理优化模型在某些配置下接近人类敏感度,但代价是更高计算量且表现不一致。

这项研究的外溢价值在 AI 安全和产品评估。很多 agent 评测关注越狱、工具调用成功率、长任务完成率或恶意指令防御,但真实产品界面中的排序、默认按钮、推荐文本、成本提示和高亮信息也会改变模型行为。若 agent 比人类更容易被这些非恶意线索推动,开发者就需要把选择架构纳入回归测试,尤其是在金融、医疗、招聘、科研检索和企业流程自动化等高影响场景。

可信边界也要分清。论文任务是实验化的选择场景,不等同于所有生产级 agent 系统;模型版本、提示格式、工具环境和温度设置都可能改变结果。作者 GitHub 提供代码和分析目录,有助于复现和扩展,但第三方复验、更多真实界面任务和跨语言场景仍是下一步关键。

信息来源

可信度说明

论文发表于 PNAS,DOI、期号和作者可核验;作者 GitHub 提供代码和方法线索,第三方索引页补充在线发表日期。边界在于,PNAS 页面本轮抓取受限,正文细节主要来自摘要、索引和代码库说明,生产系统外推仍需谨慎。

同主题情报