数据评测安全

OpenAI Model Spec:把模型行为规则转成可测试治理基线

OpenAI 公开的模型行为框架,用于说明指令优先级、安全边界、默认行为以及训练和评测的目标。

OpenAI Model Spec OpenAI ai-safety evaluation governance OpenAI 公开的模型行为框架,用于说明指令优先级、安全边界、默认行为以及训练和评测的目标。

Frontmatter

结构化元信息

实体类型
协议
主分类
数据评测安全
产品状态
已上线
开放状态
开源
产品形态
standardframework
能力标签
governanceevaluationsafety
目标用户
开发者研究者企业
交付方式
documentation
区域
global
模型策略
公开行为规范与配套评测
部署方式
公开文档、训练目标与评测基线
技术披露
公开较多
是否实测
未测试
融资阶段
not-applicable
信息截至
2026-08-12
最后复查
2026-08-12

1. 项目定位

OpenAI Model Spec 是公开说明模型应如何遵循指令、处理冲突并安全回应的行为框架。OpenAI 在 2024 年 5 月 8 日发布首个草案,希望让用户理解和讨论塑造模型行为时的实际取舍。[S1] 当前官方仓库称它用于规定 OpenAI 产品底层模型的目标行为,同时强调生产模型尚未在所有情境下完全反映规范。[S2]

2. 结构与用途

首版把内容组织为目标、规则和默认行为,并包含指令优先级、合法性、隐私、信息危害、澄清与不确定性表达等示例。[S1] 当前规范进一步列出总体目标、红线原则、指令链和分级行为规则。[S2] 它可作为训练、评测、事故复盘和产品决策的共同词汇,但不是完整的产品政策或技术实现说明。

3. 指令优先级

Model Spec 的一个核心作用是明确不同来源指令发生冲突时如何处理。官方把这类结构称为 Chain of Command,并解释模型应在适用规则下遵循 OpenAI、开发者和用户层级的指令。[S1][S2] 接入团队应把自己的系统规则、开发者约束与用户自由度分别列出,避免用一段混合提示隐藏真正的治理顺序。

4. 落地路径

第一步是从规范中挑选与业务相关的规则,转成“输入、期望行为、禁止行为、判定理由”四列测试。第二步覆盖正常请求、模糊请求、越权请求和相互冲突的请求。第三步把失败映射到提示、工具权限、产品政策或模型能力,不要把所有问题都归咎于一个系统提示。

5. 训练与评测

OpenAI 表示,Model Spec 为研究人员和训练人员提供行为指导,也用于构建评测、识别模型行为与规范之间的差距。[S1][S2] 企业采用时应保留自身监管、品牌和业务规则,不能直接把厂商规范当成本地合规结论。评测集还要覆盖组织真实用户、语言、工具与数据,而不是只复用公开例子。

6. 版本治理

官方说明 Model Spec 会根据反馈和实际服务经验持续更新。[S1][S2] 团队应记录使用的规范版本、抓取日期、派生规则和审批人。升级模型或规范时重新跑回归集,避免同一产品在没有公告的情况下改变拒绝、澄清或工具调用行为。

7. 同类框架取舍

与只列禁用内容的政策相比,Model Spec 还处理帮助性、用户自主、默认行为和指令冲突;与内部系统提示相比,它提供了可公开讨论的参考点。[S1][S2] 它仍是 OpenAI 的目标框架,不自动覆盖其他模型供应商、行业法规或企业风险偏好。多模型系统需要一层供应商无关的本地基线。

8. 主要风险

最大风险是把“规范写了”误认为“模型一定做到”。其他风险包括版本变化未同步、示例被机械套用、规则之间产生新冲突,以及行为评测只测拒绝率却忽略帮助性。应通过持续回归、人工抽查、红队样本和线上事件反馈闭环验证实际行为,并保留明确的人工升级渠道。

9. 验收方法

验收至少覆盖清晰指令、需要澄清、层级冲突、隐私请求、高风险请求和合法边界案例。成功标准是结果符合本地规则,模型能说明必要限制但不过度拒绝,工具调用不越权,同一规则在多轮对话中保持一致,版本升级后的差异可解释。出现严重偏差时,应先限制相关能力再调查。

10. 来源与更新时间

  • [S1] OpenAI:Model Spec 首版,2024-05-08|链接
  • [S2] OpenAI 官方 GitHub:Model Spec 当前规范源码|链接

资料核对日期:2026-08-12。