Anthropic 发布的自动化行为评测框架,从行为定义生成情境、运行对话并评分,用于量化前沿模型的特定行为倾向。
Tag
llm-evaluation
包含该标签的简调共 12 篇。
面向模型安全研究的开源审计工具,以多轮模拟、自动评分和人工复核探索欺骗、迎合与权力寻求等风险。
SHADE-Arena 用带有正常主任务和隐藏有害副目标的长程环境,联合评估 Agent 的破坏能力与监控模型的识别能力。
MLE-bench 是 OpenAI 开源的机器学习工程智能体基准,以 75 个 Kaggle 竞赛任务衡量数据准备、模型训练、实验和提交能力。
OpenAI 发布的研究复现评测,要求 AI Agent 从论文理解、代码实现到实验执行完成端到端任务。
面向高难度数学推理的评测基准,用于比较模型在可验证复杂问题上的表现。
DeepEval 是用于构建、运行和管理 LLM 评测的框架与平台。
Promptfoo 是用于评测、红队测试和比较 LLM 应用输出的开源工具与商业平台。
面向 AI agent 和 LLM 应用的评测、测试与 red teaming 平台,包含企业 Hub 和开源 Python library。
AI 评测与安全平台出身的公司,当前官网叙事转向 simulation research and infrastructure,同时仍保留评测、guardrails 和 agent 评估相关公开材料。
面向 LLM 应用的开源评测与测试框架,重点覆盖 RAG、agent、指标设计、测试集生成和持续评测循环。
AI 开发者平台,覆盖模型实验追踪、LLM 应用观测、评测和监控;2025 年被 CoreWeave 收购。