MLE-bench 是 OpenAI 开源的机器学习工程智能体基准,以 75 个 Kaggle 竞赛任务衡量数据准备、模型训练、实验和提交能力。
Tag
model-benchmarking
包含该标签的简调共 2 篇。
LMSYS Chatbot Arena 是由 UC Berkeley / LMSYS 研究者发起、后来独立为 Arena 的真人偏好评测平台,用匿名模型对战和用户投票来生成 AI 模型排行榜。
Tag
包含该标签的简调共 2 篇。
MLE-bench 是 OpenAI 开源的机器学习工程智能体基准,以 75 个 Kaggle 竞赛任务衡量数据准备、模型训练、实验和提交能力。
LMSYS Chatbot Arena 是由 UC Berkeley / LMSYS 研究者发起、后来独立为 Arena 的真人偏好评测平台,用匿名模型对战和用户投票来生成 AI 模型排行榜。