OpenAI Model Spec:把模型行为规则转成可测试治理基线
OpenAI 公开的模型行为框架,用于说明指令优先级、安全边界、默认行为以及训练和评测的目标。
OpenAI Model Spec OpenAI ai-safety evaluation governance OpenAI 公开的模型行为框架,用于说明指令优先级、安全边界、默认行为以及训练和评测的目标。
1. 项目定位
OpenAI Model Spec 是公开说明模型应如何遵循指令、处理冲突并安全回应的行为框架。OpenAI 在 2024 年 5 月 8 日发布首个草案,希望让用户理解和讨论塑造模型行为时的实际取舍。[S1] 当前官方仓库称它用于规定 OpenAI 产品底层模型的目标行为,同时强调生产模型尚未在所有情境下完全反映规范。[S2]
2. 结构与用途
首版把内容组织为目标、规则和默认行为,并包含指令优先级、合法性、隐私、信息危害、澄清与不确定性表达等示例。[S1] 当前规范进一步列出总体目标、红线原则、指令链和分级行为规则。[S2] 它可作为训练、评测、事故复盘和产品决策的共同词汇,但不是完整的产品政策或技术实现说明。
3. 指令优先级
Model Spec 的一个核心作用是明确不同来源指令发生冲突时如何处理。官方把这类结构称为 Chain of Command,并解释模型应在适用规则下遵循 OpenAI、开发者和用户层级的指令。[S1][S2] 接入团队应把自己的系统规则、开发者约束与用户自由度分别列出,避免用一段混合提示隐藏真正的治理顺序。
4. 落地路径
第一步是从规范中挑选与业务相关的规则,转成“输入、期望行为、禁止行为、判定理由”四列测试。第二步覆盖正常请求、模糊请求、越权请求和相互冲突的请求。第三步把失败映射到提示、工具权限、产品政策或模型能力,不要把所有问题都归咎于一个系统提示。
5. 训练与评测
OpenAI 表示,Model Spec 为研究人员和训练人员提供行为指导,也用于构建评测、识别模型行为与规范之间的差距。[S1][S2] 企业采用时应保留自身监管、品牌和业务规则,不能直接把厂商规范当成本地合规结论。评测集还要覆盖组织真实用户、语言、工具与数据,而不是只复用公开例子。
6. 版本治理
官方说明 Model Spec 会根据反馈和实际服务经验持续更新。[S1][S2] 团队应记录使用的规范版本、抓取日期、派生规则和审批人。升级模型或规范时重新跑回归集,避免同一产品在没有公告的情况下改变拒绝、澄清或工具调用行为。
7. 同类框架取舍
与只列禁用内容的政策相比,Model Spec 还处理帮助性、用户自主、默认行为和指令冲突;与内部系统提示相比,它提供了可公开讨论的参考点。[S1][S2] 它仍是 OpenAI 的目标框架,不自动覆盖其他模型供应商、行业法规或企业风险偏好。多模型系统需要一层供应商无关的本地基线。
8. 主要风险
最大风险是把“规范写了”误认为“模型一定做到”。其他风险包括版本变化未同步、示例被机械套用、规则之间产生新冲突,以及行为评测只测拒绝率却忽略帮助性。应通过持续回归、人工抽查、红队样本和线上事件反馈闭环验证实际行为,并保留明确的人工升级渠道。
9. 验收方法
验收至少覆盖清晰指令、需要澄清、层级冲突、隐私请求、高风险请求和合法边界案例。成功标准是结果符合本地规则,模型能说明必要限制但不过度拒绝,工具调用不越权,同一规则在多轮对话中保持一致,版本升级后的差异可解释。出现严重偏差时,应先限制相关能力再调查。
10. 来源与更新时间
资料核对日期:2026-08-12。