NVIDIA 的开源 Agent 工具库,以插件化工作流连接模型、工具和框架,并提供观测、评测、分析与优化能力。
Tag
evaluation
包含该标签的简调共 14 篇。
Daybreak 为获批防御者提供分级网络安全模型访问,并以受控环境、最小权限和人工监督约束使用。
OpenAI Guardrails Python 是面向 LLM 应用的开源校验库,以配置化管道在输入和输出阶段组合安全、隐私和合规检查。
OpenAI 公开的模型行为框架,用于说明指令优先级、安全边界、默认行为以及训练和评测的目标。
面向高难度数学推理的评测基准,用于比较模型在可验证复杂问题上的表现。
OpenAI 推理模型的任务评估与受控工具协同实践,适合从可复核场景开始验证。
RE-Bench 用受控研究工程任务比较人类与模型代理表现,适合补充研发风险评测,而非替代内部上线验证。
DSPy 是将语言模型任务写成模块与签名,并以优化器改进提示和权重选择的开源框架。
Evidently 是用于评估、测试和监控 AI 与数据系统的开源工具。
Inspect AI 是用于构建、运行和分析 AI 模型评测任务的开源框架。
Phoenix 是用于 LLM 应用追踪、评测与实验分析的开源可观测性工具。
W&B Weave 是用于 AI 应用追踪与评测的开发平台。
Mistral 开源的生产搜索管线框架,将数据摄取、检索和评测放在统一接口下。
OpenAI 用于构建、部署和优化 agents 的工具组合,其中部分产品已宣布停止。