Google 基于 Gemini 3.5 Flash 微调的网络安全模型,聚焦发现、验证和修补软件漏洞,并采取受限试点发布。
Tag
ai-safety
包含该标签的简调共 18 篇。
Anthropic 发布的自动化行为评测框架,从行为定义生成情境、运行对话并评分,用于量化前沿模型的特定行为倾向。
面向模型安全研究的开源审计工具,以多轮模拟、自动评分和人工复核探索欺骗、迎合与权力寻求等风险。
GPT-Live 为 ChatGPT Voice 提供自然语音轮替、任务发起、进度检查与持续调整能力。
Hippocratic AI 面向患者语音交互的医疗专用模型星座,强调非诊断工作流、临床升级、安全与合规。
Google Cloud 的模型无关运行时安全服务,在提示词、回复和智能体交互进入业务系统前执行威胁与敏感数据检查。
Daybreak 为获批防御者提供分级网络安全模型访问,并以受控环境、最小权限和人工监督约束使用。
OpenAI Guardrails Python 是面向 LLM 应用的开源校验库,以配置化管道在输入和输出阶段组合安全、隐私和合规检查。
OpenAI 公开的模型行为框架,用于说明指令优先级、安全边界、默认行为以及训练和评测的目标。
SHADE-Arena 用带有正常主任务和隐藏有害副目标的长程环境,联合评估 Agent 的破坏能力与监控模型的识别能力。
OpenAI 面向临床专业任务发布的开放评估基准,以医生撰写并复核的对话和逐题评分标准检验模型在诊疗咨询、文书记录与医学研究中的表现。
HealthBench 是 OpenAI 发布的医疗对话模型评估基准,以多轮场景和医生编写的细粒度评分标准衡量准确性、安全性、沟通与情境适配,并提供 Consensus 和 Hard 子集及参考实现。
Humanity's Last Exam 用专家级跨学科问题测试前沿模型的知识与推理边界,适合研究比较,但不能单独代表产品可靠性。
RE-Bench 用受控研究工程任务比较人类与模型代理表现,适合补充研发风险评测,而非替代内部上线验证。
Inspect AI 是用于构建、运行和分析 AI 模型评测任务的开源框架。
面向 AI agent 和 LLM 应用的评测、测试与 red teaming 平台,包含企业 Hub 和开源 Python library。
已被 Check Point 收购并整合进其 AI Security 体系的生成式 AI 安全平台,重点防护 prompt injection、jailbreak、数据泄露和 agent 运行时风险。
AI 评测与安全平台出身的公司,当前官网叙事转向 simulation research and infrastructure,同时仍保留评测、guardrails 和 agent 评估相关公开材料。