SimpleQA:用短事实问答校验模型可靠性
用于衡量模型短事实问答可靠性的公开评测与参考实现。
SimpleQA OpenAI 评测 可靠性 用于衡量模型短事实问答可靠性的公开评测与参考实现。
1. 评测定位
SimpleQA 是 OpenAI 发布的事实性问答评测,用于考察模型能否对短问题给出可判定的回答。[S1][S2] 它提供的是一个衡量角度,而不是对任何模型在所有真实任务中可靠性的总评。企业可以借鉴其强调的可核验问题设计,但不能把公开评测分数直接等同于内部产品的准确率。实际效果还取决于业务资料、语言、提示词和人工流程。
2. 官方信息边界
官方 simple-evals 仓库提供相关评测代码与材料入口,并将 SimpleQA 保留为参考实现的一部分。[S1] 这些公开材料支持它是评测项目的判断,但不保证第三方复现一定得到相同结果,也不覆盖企业特有的知识、政策或时间敏感事实。所有本地结论都应记录所用模型、版本、提示词和运行条件。
3. 为什么要做本地评测
通用问答集很难覆盖组织自己的术语、权限和决策后果。一个看似正确的通用回答,可能在企业流程中缺少来源、使用过期政策或越过授权范围。本地评测集能把真正需要的行为写清楚:何时回答、何时引用、何时拒答和何时转人工。它也让模型升级或提示词调整后有稳定的回归检查,而不是依赖主观体验。
4. 样本构建
从已批准、可公开或已脱敏的资料中抽取短而明确的问题,并为每题保存权威答案、来源位置、更新时间和适用范围。避免把答案存在争议、依赖个人判断或频繁变化的问题当作唯一标准。样本要覆盖常见、边缘、信息不足和相互矛盾的情形。出题人与审核人最好分离,减少题目设计者无意中偏向某一种回答风格。
5. 判分规则
先规定什么算正确:事实一致、单位和条件完整、引用对应,或在未知时明确拒答。对自由文本可采用人工双人复核与结构化标签,而不是只用另一个模型自动打分。将“看似流畅但无证据”“引用无关资料”“超出范围回答”单独记录,因为它们与纯粹答错的治理方式不同。判分规则也要版本化并允许复议。
6. 引用与时间性
事实问答尤其容易因资料过期而失真。每个答案应能追溯到批准来源,并标明生效日期或资料版本。对于政策、价格、人员、法规等变化快的内容,系统应优先检索最新权威材料,或要求用户确认时间范围。无法确认时应说清不确定性,而不是用旧知识补全。评测集也要安排定期失效检查。
7. 与检索系统联测
若生产系统使用检索增强生成,评测不能只测模型本身,还要测检索、权限过滤和引用渲染。记录问题是否检索到正确文档、是否漏掉关键限制、是否把无权限内容带入上下文。将检索失败与生成错误区分,才能找到修复位置。对于没有足够证据的题,正确行为往往是请求补充信息或拒答,而不是尝试猜测。
8. 风险与对抗样本
加入诱导模型编造来源、要求忽略规则、混入错误前提和利用相似名称混淆的案例。测试应验证系统能识别不可信材料,且不会因用户语言强硬就扩大权限。敏感领域还需检查是否泄露个人信息、内部规则或受限数据。对高影响答案设置人工确认和清晰免责声明,不能因为评测得分上升就取消业务责任。
9. 发布门槛
把评测结果按题型、风险级别、数据来源和失败类别拆开看。发布门槛应包含总体表现,也应包含关键题零容忍要求,例如错误权限、虚构引用或漏掉安全限制。新模型、提示词、检索索引和系统规则任一变化后,都应重新运行对应子集。保存原始输出与审核结论,使异常回归能够复盘而不是只留下一个汇总分数。
10. 来源与更新时间
为评测集指定内容负责人、技术负责人和业务审批人,明确谁能新增题目、更新答案和调整门槛。记录数据来源、许可、脱敏方式、保留期限和访问权限。将线上人工纠错转化为候选测试题,但先经过审核再纳入基准。SimpleQA 的价值在于提醒团队把“事实正确”拆成可验证环节;长期可靠性仍依赖持续维护、人工监督和清楚的拒答边界。
可追溯来源
- [S1]Tier1OpenAI simple-evals 官方开源仓库访问 2026-08-03
- [S2]Tier1OpenAI Cookbook 官方开源仓库访问 2026-08-03