Scholay

学术搜索 · AI 审稿 · LaTeX 协作

FAccT 2026:Penn State 医疗 LLM 研究提示,面向普通用户的“Doctor GPT”仍有两成以上错误风险

学术圈重大事件 · 发布 2026-06-25T12:35:00+08:00 · 更新 2026-06-25T12:43:36+08:00

核心结论

Penn State 团队将在 FAccT 2026 展示医疗 LLM 真实用户问答评估:34 名参与者提交 212 个健康问题,9 名医生评估后认为总体准确率约 76.2%。这说明聊天机器人可辅助医生,但普通用户端自我诊断仍存在两成以上错误和潜在伤害风险。

Penn State 团队将在 6 月 25 日至 28 日举行的 ACM FAccT 2026 上展示一项医疗大模型使用评估,题为《Dr. GPT Will See You Now, but Should It?》。EurekAlert 将论文发布日期标为 6 月 25 日,Penn State 原始新闻稿则在 5 月 28 日提前发布,说明该研究聚焦普通人如何把 ChatGPT、Gemini、Llama 等工具当作症状查询入口,而不是只评估医生考试题或专家编写病例。

研究设计比较贴近真实使用场景。团队组织了一个名为 Diagnose-a-thon 的竞赛,34 名参与者提交 212 个真实或虚构的健康问题和 AI 回复,参与者可自行选择 ChatGPT-4o、ChatGPT-3.5、Gemini-1.5 Pro 或 Llama3-8b。随后,9 名获得认证的医生用 6 点量表评估回复准确性和潜在伤害;另一组 7 名医学专业人员和受训者比较基础模型与接入医学教材、临床指南、同行评议论文后的增强版本。

最受关注的数字是 76.2%:医生认为这些 LLM 回复总体上约四分之三准确,妇产科、耳鼻喉等类别表现较好,内科、神经科和皮肤科表现较差。研究还发现,较具体、长度在 60 到 250 个字符之间的提示更容易得到准确回复。值得注意的是,额外接入医学知识库并没有稳定改进所有模型;评估小组甚至更偏好 Gemini 和 Llama 的基础模型回复,而不是增强版本。

这条新闻的意义在于,它把医疗 AI 安全讨论从“模型能不能答对医学题”推进到“普通用户会怎样问、错误会怎样进入自我分诊”。如果公众把 LLM 当作搜索引擎式健康入口,20% 以上错误率就不只是模型性能问题,还会影响就医延误、焦虑放大和错误自我处理。对医院和数字健康产品而言,近期更可取的方向不是把聊天机器人直接包装成患者端诊断工具,而是把它们放进医生工作流、提示模板、风险分级和转诊边界清晰的产品形态里。

仍需保留边界。论文目前以 arXiv 预印本和 FAccT 会议展示为主,样本规模为 212 条问答,且模型版本来自研究时点;结果不能外推到所有医疗专科、所有语言或最新闭源模型。它的价值更像一个面向真实用户行为的风险基准:医疗 LLM 可以辅助,但患者端“独立诊断”仍需要明显的警示、转人工和责任边界。

信息来源

可信度说明

来源包括 Penn State 原始新闻稿、EurekAlert 会议发布信息和 arXiv 论文页。可核验字段包括 FAccT 2026 展示窗口、212 条问答、34 名参与者、9 名医生评估、76.2% 准确率和 DOI;但论文仍为预印本/会议展示,尚不能作为临床部署有效性证据。

同主题情报

  • 动物所 / `Cell`:`disc-Gastruloid` 首次把人类原条形成推进到可空间重构、可延长培养的体外模型

    中国科学院 `2026-07-08` 官方稿显示,团队构建的人类 `disc-Gastruloid` 在 `72` 小时共培养后形成类原条样区域,延长培养后超 `80%` 继续发育为轴向不对称三维胚胎样结构,分出 `14` 类细胞群并与着床后 `21` 天天然胚胎较高相似。它的重要性,在于把人类原肠运动这个长期难直接观察的发育“黑箱”推进到可重复、可操控的体...

  • 银河系最快恒星逼近中心黑洞:峰值约每秒 2.5 万公里,或可测量自旋

    Science 与美联社 8 月 19 日报道,甚大望远镜数据识别出银河系内迄今已知速度最快的恒星:峰值约每秒 2.5 万公里,绕人马座 A* 一周约 8.7 年,且比此前纪录保持者更接近黑洞。长期高精度跟踪可能约束银河系中心黑洞自旋,但当前只是发现和轨道测量起点,尚未得到自旋值。

  • 嫦娥七号以四器协同搜寻月球南极水冰,跳跃探测器瞄准永久阴影区

    Science 8 月 19 日更新嫦娥七号任务:轨道器、着陆器、巡视器和跳跃探测器将在鹊桥二号支持下调查月球南极水冰与挥发物,四平台合计 18 项载荷,并计划让跳跃探测器进入永久阴影坑现场分析。公开资料仍只给出 2026 年下半年发射口径,最终日期、落点与工程参数需以官方通告为准。

  • M87 黑洞第一次有了双频“体检图”,研究者开始按位置读等离子体状态

    中国科学院 2026-07-28 08:18 发布官方稿,介绍上海天文台团队把 1.3 毫米和 3.5 毫米两张 M87 黑洞视界尺度图像合起来,首次做出空间分辨的谱指数分布。简单说,这不只是把黑洞拍得更清楚,而是开始按位置判断视界附近等离子体在不同半径上更接近“自吸收很强的厚辐射”还是“更容易透出的薄辐射”。关键转折出现在距黑洞中心约 30 微角秒处,并与...

  • Moderna mRNA 流感疫苗获批,确诊病例相对标准疫苗减少 26.6%

    Nature 8 月 13 日梳理 Moderna 的 mRNA 流感疫苗 mFLUSIVA:FDA 于 8 月 5 日批准其用于 50–64 岁成人,并对 65 岁以上人群给予加速批准,计划进入美国 2026–27 流感季。超过 4 万人的试验中,mRNA 组 2% 出现实验室确诊流感,对照标准疫苗组为 2.8%,相对减少 26.6%;常见不良反应多为轻中...

  • KIST 公布 A²SG 训练方法,以自适应非对称梯度改善深层脉冲神经网络

    KIST 8 月 10 日公布已获 ICML 2026 接收的 A²SG 训练方法,用自适应窗口和非对称代理梯度缓解深层脉冲神经网络的梯度变化与时间不一致。机构称该方法在 ImageNet 等任务提高准确率且训练开销低于所比较基线;论文与代码可查,但相对能耗和商业化前景仍需独立复现及真实神经形态硬件验证。