HealthBench:用医生制定评分细则评估医疗对话模型的开放基准
HealthBench 是 OpenAI 发布的医疗对话模型评估基准,以多轮场景和医生编写的细粒度评分标准衡量准确性、安全性、沟通与情境适配,并提供 Consensus 和 Hard 子集及参考实现。
HealthBench model-evaluation healthcare-ai ai-safety open-source HealthBench 是 OpenAI 发布的医疗对话模型评估基准,以多轮场景和医生编写的细粒度评分标准衡量准确性、安全性、沟通与情境适配,并提供 Consensus 和 Hard 子集及参考实现。
1. 项目定位
OpenAI 于 2025 年 5 月发布 HealthBench,用于评估语言模型在真实医疗对话中的表现。它不只检查医学知识问答,而是用多轮用户或临床人员场景,衡量回答是否准确、相关、安全,并能否按情境给出合适沟通与下一步行动。[S1]
2. 数据与评分
基准包含 5,000 个多轮对话和 48,562 条由医生制定的独立评分标准。内容由 262 名医生参与创建,他们拥有在 60 个国家执业的经验并覆盖 26 个医学专科。[S1] 每个样本使用自身细粒度 rubric,而不是依赖一个适用于所有问题的通用分数。
3. 衡量维度
场景主题包括紧急转诊、不确定性处理、面向不同专业程度的沟通、健康数据任务、全球健康和上下文追问。评分轴还覆盖准确性、完整性、沟通质量、指令遵循与情境意识。[S1] 因此同一句医学事实正确,也可能因没有提醒就医或表达不适合用户而失分。
4. 基准家族
HealthBench 还提供 Consensus 与 Hard 两种变体:前者用多名医生的共识验证重要行为维度,后者聚焦当时前沿模型仍较困难的样本。[S1] 前者适合观察高一致性标准,后者适合区分高能力模型,但都不应替代完整集上的总体与分组分析。
5. 使用路径
官方在 openai/simple-evals 仓库中保留 HealthBench 的参考实现,并说明该仓库继续托管 HealthBench、BrowseComp 与 SimpleQA。[S2] 团队应固定数据版本、候选模型、生成参数和评分模型,先用小样本验证格式与费用,再运行全量评估并保存逐样本分数和失败原因。
6. 适用场景
它适合比较通用模型或医疗助手在患者沟通、紧急程度识别、信息追问和全球情境适配上的差异,也可作为微调、提示或安全策略变更后的回归集。它不等同于临床有效性验证,不能单凭榜单分数决定真实诊疗部署。
7. 主要风险
医疗评估对单次危险错误非常敏感,平均分可能掩盖最坏情况。还需防止数据泄漏、评分模型偏差、重复调参过拟合和不同运行配置造成的不可比;公开报告宜披露聚合结果和方法,不应逐条暴露可被检索或用于针对性调参的测试样本。
8. 评估与验收
除总分外,应按主题、评分轴、语言和风险等级报告分布,并单列紧急转诊与高伤害错误。重复生成可用于观察 worst-of-n 可靠性;人工医生应复核低分、高分但可疑、以及评分器与规则冲突的样本。验收还应记录运行成本、评分一致性和置信区间。
9. 结论
HealthBench 的核心贡献是把医疗对话质量拆成医生针对具体场景编写的可检查标准,并提供一致性与高难度子集。它适合作为医疗模型评估的一层公共基线,但真正上线仍需要本地人群、语言、流程和监管要求下的额外验证与持续监测。
10. 来源与更新时间
本文研究日期与信息截止日期均为 2026-08-07。数据规模、医生构成与子集说明来自发布页,运行入口和维护状态来自 OpenAI 官方参考实现仓库。