FAccT 2026:Penn State 医疗 LLM 研究提示,面向普通用户的“Doctor GPT”仍有两成以上错误风险
学术圈重大事件 · 发布 2026-06-25T12:35:00+08:00 · 更新 2026-06-25T12:43:36+08:00
Penn State 团队将在 FAccT 2026 展示医疗 LLM 真实用户问答评估:34 名参与者提交 212 个健康问题,9 名医生评估后认为总体准确率约 76.2%。这说明聊天机器人可辅助医生,但普通用户端自我诊断仍存在两成以上错误和潜在伤害风险。
Penn State 团队将在 6 月 25 日至 28 日举行的 ACM FAccT 2026 上展示一项医疗大模型使用评估,题为《Dr. GPT Will See You Now, but Should It?》。EurekAlert 将论文发布日期标为 6 月 25 日,Penn State 原始新闻稿则在 5 月 28 日提前发布,说明该研究聚焦普通人如何把 ChatGPT、Gemini、Llama 等工具当作症状查询入口,而不是只评估医生考试题或专家编写病例。
研究设计比较贴近真实使用场景。团队组织了一个名为 Diagnose-a-thon 的竞赛,34 名参与者提交 212 个真实或虚构的健康问题和 AI 回复,参与者可自行选择 ChatGPT-4o、ChatGPT-3.5、Gemini-1.5 Pro 或 Llama3-8b。随后,9 名获得认证的医生用 6 点量表评估回复准确性和潜在伤害;另一组 7 名医学专业人员和受训者比较基础模型与接入医学教材、临床指南、同行评议论文后的增强版本。
最受关注的数字是 76.2%:医生认为这些 LLM 回复总体上约四分之三准确,妇产科、耳鼻喉等类别表现较好,内科、神经科和皮肤科表现较差。研究还发现,较具体、长度在 60 到 250 个字符之间的提示更容易得到准确回复。值得注意的是,额外接入医学知识库并没有稳定改进所有模型;评估小组甚至更偏好 Gemini 和 Llama 的基础模型回复,而不是增强版本。
这条新闻的意义在于,它把医疗 AI 安全讨论从“模型能不能答对医学题”推进到“普通用户会怎样问、错误会怎样进入自我分诊”。如果公众把 LLM 当作搜索引擎式健康入口,20% 以上错误率就不只是模型性能问题,还会影响就医延误、焦虑放大和错误自我处理。对医院和数字健康产品而言,近期更可取的方向不是把聊天机器人直接包装成患者端诊断工具,而是把它们放进医生工作流、提示模板、风险分级和转诊边界清晰的产品形态里。
仍需保留边界。论文目前以 arXiv 预印本和 FAccT 会议展示为主,样本规模为 212 条问答,且模型版本来自研究时点;结果不能外推到所有医疗专科、所有语言或最新闭源模型。它的价值更像一个面向真实用户行为的风险基准:医疗 LLM 可以辅助,但患者端“独立诊断”仍需要明显的警示、转人工和责任边界。
信息来源
可信度说明
来源包括 Penn State 原始新闻稿、EurekAlert 会议发布信息和 arXiv 论文页。可核验字段包括 FAccT 2026 展示窗口、212 条问答、34 名参与者、9 名医生评估、76.2% 准确率和 DOI;但论文仍为预印本/会议展示,尚不能作为临床部署有效性证据。