HealthBench Professional:面向真实临床工作对话的开放评估基准
OpenAI 面向临床专业任务发布的开放评估基准,以医生撰写并复核的对话和逐题评分标准检验模型在诊疗咨询、文书记录与医学研究中的表现。
HealthBench Professional model-evaluation healthcare-ai ai-safety open-source OpenAI 面向临床专业任务发布的开放评估基准,以医生撰写并复核的对话和逐题评分标准检验模型在诊疗咨询、文书记录与医学研究中的表现。
1. 一句话结论
HealthBench Professional 是 OpenAI 研究团队于 2026 年 4 月公开的临床任务评估基准,重点不是背诵医学知识,而是模型能否在真实临床工作对话中给出安全、完整且符合专业情境的下一条回复。[S1][S2] 它适合做模型选型和版本回归的共同量尺,但分数不能替代医院内部验证、医生判断或医疗器械合规评估。
2. 基准定位
该基准补充了覆盖患者与临床人员对话的 HealthBench,把范围收窄到临床人员常见工作。官方将任务分为诊疗咨询、写作与文档记录、医学研究三类。[S1][S2] 因此它更适合评估面向医生的助手,而不是直接证明面向患者的诊断产品已经安全可用。
3. 数据与评分
最终版本含 525 个医生撰写的任务,由 15,079 个候选样本筛选而来;每题都有专属评分标准。[S2] 样本和 rubric 经医生独立复核及最终裁决,且每个例子的评分条件由至少三名医生迭代处理。官方还按难度分层抽样,使困难样本的代表性提高约 3.5 倍。[S2]
4. 三类任务
诊疗咨询覆盖鉴别思路、处置与治疗讨论;文书类覆盖病历生成、摘要、编码、患者沟通和结构化记录;研究类关注检索并综合临床或科学证据。[S2] 采购方应先确认自己的真实任务落在哪一类,再看分项表现,不能用总分掩盖某一关键流程的明显短板。
5. 评估方式
建议固定模型版本、系统提示、工具权限和采样参数,保存每次回答,再按随基准提供的逐题标准评分。先复现一轮公开设置,确认数据加载、输出格式和评分链可重复;再加入本机构经脱敏的任务集。公开基准负责横向比较,内部集负责检验本地术语、流程和风险边界。
6. 适用场景
模型团队可用它比较候选模型,安全团队可查找容易漏掉升级就医、证据边界或必要上下文的题型,产品团队可在模型、提示词或检索组件升级后做回归。若系统还会调用处方、病历写入等工具,必须另加动作权限和真实工作流测试,基准本身不覆盖全部生产控制。
7. 接入路径
先在隔离环境下载公开材料并核对文件版本与哈希;随后用只读推理接口跑小样本,确认没有把标准答案或评分条件泄漏给被测模型。全量运行时记录失败、超时、拒答和成本,并把原始回答与评分结果分开保存。涉及机构内部病例时,只使用获批、脱敏且可审计的数据。
8. 主要风险
公开数据可能进入训练语料,导致分数受污染;模型评分器也可能和医生判断不一致。525 个任务不能覆盖所有专科、地区规范、语言和罕见事件。[S2] 更高分只代表在这套题和评分条件下表现更好,不应外推为诊断准确率、临床结局改善或可无人监督使用。
9. 验收建议
验收至少检查四项:运行结果可复现;三类任务分别达到预设门槛;关键安全题没有严重漏项;内部医生复核与自动评分的差异可解释。上线前再对最差样本做定性复盘,形成禁止使用、必须人工确认和允许辅助三类边界。任何版本变化都应重跑同一回归集。
10. 来源与更新时间
截至 2026 年 8 月 11 日,本稿仅采用 OpenAI 研究团队公开的论文页与官方论文,未采用模型厂商排行榜或媒体转述作为事实依据。