Google 基于 Gemini 3.5 Flash 微调的网络安全模型,聚焦发现、验证和修补软件漏洞,并采取受限试点发布。
Category
数据评测安全
该分类当前有 57 篇简调。
NVIDIA 与众多安全、云、软件及开源机构发起的 AI 安全协作倡议,目标是共建可检查、可运行的开放防御模型、代理框架与工具,当前更适合跟踪贡献与参与试点,不宜当成成熟产品。
Meta 发布的多模态脑编码研究模型,用视频、音频和文本预测 fMRI 皮层反应,并公开代码、权重与演示供非商业研究使用。
Anthropic 发布的自动化行为评测框架,从行为定义生成情境、运行对话并评分,用于量化前沿模型的特定行为倾向。
面向模型安全研究的开源审计工具,以多轮模拟、自动评分和人工复核探索欺骗、迎合与权力寻求等风险。
CHMv2 是 Meta 与世界资源研究所推出的开放模型与全球树冠高度地图,用于森林和城市树木监测。
OpenAI 发布的真实工作任务评测,覆盖 44 种职业,以专业人员创建的任务、参考材料、交付物和评分标准衡量模型能力。
OpenAI 发布的计算生物学研究级基准,用合成但现实的脏数据任务测试 AI Agent 的分析路径选择、修正与决策判断。
Google Cloud 的模型无关运行时安全服务,在提示词、回复和智能体交互进入业务系统前执行威胁与敏感数据检查。
Daybreak 为获批防御者提供分级网络安全模型访问,并以受控环境、最小权限和人工监督约束使用。
OpenAI Guardrails Python 是面向 LLM 应用的开源校验库,以配置化管道在输入和输出阶段组合安全、隐私和合规检查。
OpenAI 公开的模型行为框架,用于说明指令优先级、安全边界、默认行为以及训练和评测的目标。
SHADE-Arena 用带有正常主任务和隐藏有害副目标的长程环境,联合评估 Agent 的破坏能力与监控模型的识别能力。
OpenAI 面向临床专业任务发布的开放评估基准,以医生撰写并复核的对话和逐题评分标准检验模型在诊疗咨询、文书记录与医学研究中的表现。
MCP-Universe 是 Salesforce AI Research 开源的智能体开发与评测框架,重点检验模型在真实 MCP 服务器上的多步工具使用能力。
AssetOpsBench 用工业资产运维场景、专职智能体和多智能体编排蓝图,帮助团队构建并评估面向 Industry 4.0 的智能体系统。
Sierra Research 提出的双控制对话智能体评测基准,用真实领域任务检验用户和智能体都能采取行动时的协作表现。
MLE-bench 是 OpenAI 开源的机器学习工程智能体基准,以 75 个 Kaggle 竞赛任务衡量数据准备、模型训练、实验和提交能力。
ARC-AGI-2 以少量示例和网格变换任务评估系统对陌生规则的归纳与迁移能力,适合作为推理评测组成部分,而非通用智能单一结论。
BrowseComp 用难检索、短答案任务测试浏览代理的持续搜索与推理能力;使用时应防止数据泄漏,并把它与真实业务评测分开解读。
HealthBench 是 OpenAI 发布的医疗对话模型评估基准,以多轮场景和医生编写的细粒度评分标准衡量准确性、安全性、沟通与情境适配,并提供 Consensus 和 Hard 子集及参考实现。
OpenAI 发布的研究复现评测,要求 AI Agent 从论文理解、代码实现到实验执行完成端到端任务。
Terminal-Bench 用隔离终端环境和可验证任务评估智能体完成真实工作的能力,适合比较代理系统,但结果高度依赖任务版本与运行环境。
面向高难度数学推理的评测基准,用于比较模型在可验证复杂问题上的表现。
Humanity's Last Exam 用专家级跨学科问题测试前沿模型的知识与推理边界,适合研究比较,但不能单独代表产品可靠性。
RE-Bench 用受控研究工程任务比较人类与模型代理表现,适合补充研发风险评测,而非替代内部上线验证。
用于衡量模型短事实问答可靠性的公开评测与参考实现。
SWE-bench Verified 是经人工核验的软件工程评测子集,用于更可靠地衡量模型或 agent 解决真实 GitHub issue 的能力。
SWE-Lancer 用真实自由职业软件工程任务和经济价值衡量模型表现,适合研究编码能力,但不能替代企业代码库中的安全与维护验收。
Guardrails AI 是用于校验与约束 LLM 输入输出的开源开发框架。
Microsoft Presidio 是用于识别与处理文本中敏感信息的开源工具。
Private AI 是面向文本敏感信息识别与处理的隐私保护平台。
Unstructured 是用于将非结构化文件转换为可供下游处理的数据的工具与平台。
AgentOps 是面向团队的 Agent 可观测性 产品。
Evidently 是用于评估、测试和监控 AI 与数据系统的开源工具。
Inspect AI 是用于构建、运行和分析 AI 模型评测任务的开源框架。
MLflow 是用于机器学习实验与模型生命周期管理的产品或开源项目。
OpenPipe 是用于AI 应用微调与评测的产品。
Phoenix 是用于 LLM 应用追踪、评测与实验分析的开源可观测性工具。
Pydantic Logfire 是面向 AI 应用与常规服务的可观测性平台,以 OpenTelemetry 为基础汇集追踪、指标和日志。
W&B Weave 是用于 AI 应用追踪与评测的开发平台。
DeepEval 是用于构建、运行和管理 LLM 评测的框架与平台。
garak 是用于探测大语言模型与对话系统脆弱性的开源命令行扫描工具。
NVIDIA NeMo Guardrails 是为 LLM 应用添加可编程 guardrails 的开源 Python 库。
Promptfoo 是用于评测、红队测试和比较 LLM 应用输出的开源工具与商业平台。
面向 AI 工程师和领域专家的开源数据协作工具,用于构建、整理和迭代高质量训练与评测数据集;当前主仓库已进入成熟维护状态,不再规划新增功能。
AI observability 与 evals 平台,用于追踪生产 agent、运行系统化评测、捕捉质量回归,并把 prompt、数据集、scorers 和实验流程连接起来。
面向 AI agent 和 LLM 应用的评测、测试与 red teaming 平台,包含企业 Hub 和开源 Python library。
Stanford CRFM 推出的语言模型整体评测项目,强调用多场景、多指标和透明报告评估模型能力、局限与风险;GitHub 仓库显示其已于 2026-06-01 进入维护模式。
已被 Check Point 收购并整合进其 AI Security 体系的生成式 AI 安全平台,重点防护 prompt injection、jailbreak、数据泄露和 agent 运行时风险。
开源 AI engineering / LLM observability 平台,把 traces、monitoring、datasets、experiments、evals 和 prompt 管理连接成一个持续改进循环。
AI 评测与安全平台出身的公司,当前官网叙事转向 simulation research and infrastructure,同时仍保留评测、guardrails 和 agent 评估相关公开材料。
面向 LLM 应用的开源评测与测试框架,重点覆盖 RAG、agent、指标设计、测试集生成和持续评测循环。
AI 开发者平台,覆盖模型实验追踪、LLM 应用观测、评测和监控;2025 年被 CoreWeave 收购。
LangChain 推出的 AI 应用与 agent 工程平台,覆盖运行链路追踪、离线和在线评测、提示词管理,以及云端、混合和自托管部署。
Scale AI 是一家 AI 数据、模型评测与企业/政府 AI 应用基础设施公司,核心能力是用人类专家数据与评测流程帮助模型训练、后训练和部署。
LMSYS Chatbot Arena 是由 UC Berkeley / LMSYS 研究者发起、后来独立为 Arena 的真人偏好评测平台,用匿名模型对战和用户投票来生成 AI 模型排行榜。