MLE-bench:用真实机器学习竞赛评估 AI 工程智能体
MLE-bench 是 OpenAI 开源的机器学习工程智能体基准,以 75 个 Kaggle 竞赛任务衡量数据准备、模型训练、实验和提交能力。
MLE-bench llm-evaluation agent-evaluation model-benchmarking open-source MLE-bench 是 OpenAI 开源的机器学习工程智能体基准,以 75 个 Kaggle 竞赛任务衡量数据准备、模型训练、实验和提交能力。
1. 基准定位
MLE-bench 是 OpenAI 在 2024 年 10 月发布的机器学习工程智能体评测。它从 Kaggle 整理 75 个机器学习竞赛,让智能体完成数据准备、训练模型、运行实验和生成提交文件等端到端工作。评测重点不是回答知识题,而是观察智能体能否在真实工程约束下持续改进一个可计分方案。[S1][S2]
2. 它解决什么问题
代码题或单轮问答很难覆盖机器学习项目中的长链路决策:智能体要理解数据、选择方法、排查错误、分配算力并根据实验结果迭代。MLE-bench 把这些步骤放在竞赛环境中,以隐藏测试集上的分数和奖牌门槛作为结果指标,使“会解释算法”与“能完成工程任务”得到区分。[S1][S2]
3. 数据集构成
基准覆盖图像、文本、表格、音频等不同类型的 Kaggle 竞赛。由于 Kaggle 不公开竞赛的真实隐藏测试标签,项目提供准备脚本,从公开训练数据重新划分训练集与测试集,并为每项竞赛提供评分逻辑。使用者需要通过 Kaggle API 获取原始数据,并遵守各竞赛规则。[S2]
4. 评分方式
项目以 Kaggle 公开排行榜建立人类基线,并把智能体结果映射到奖牌水平。原始研究中表现最好的组合是 o1-preview 加 AIDE scaffold,在 16.9% 的竞赛中达到至少铜牌水平。这个数字反映当时指定模型、脚手架和资源条件下的结果,不能直接代表新模型或不同运行预算。[S1]
5. 运行条件
官方仓库给出的标准比较建议包括 24 小时运行时间、36 个 vCPU、440GB 内存和一张 24GB A10 GPU,并建议至少使用三个随机种子报告均值与标准误。完整 75 题需要大量数据与计算;低复杂度 Lite 子集含 22 个竞赛,可降低首次复现实验的资源门槛。[S2]
6. 开放内容
OpenAI 公开了构建数据集的代码、评估逻辑、实验代理和示例。仓库提供准备、评分与聚合报告的工具,也包含规则违规和抄袭检测相关组件。开放代码有利于复核,但结果可比性仍依赖版本、任务划分、资源预算、模型接口和脚手架设置保持一致。[S1][S2]
7. 适用场景
MLE-bench 适合研究机器学习智能体、比较长时运行策略、分析算力扩展收益,以及检查模型是否会从实验反馈中修正方案。它不适合用来评价通用聊天、纯软件修复或低资源边缘代理。企业也可借鉴其方法,构建内部数据科学任务集,而不必照搬所有 Kaggle 竞赛。[S1][S2]
8. 主要风险
首要风险是数据污染:模型可能在预训练中见过竞赛方案或公开代码,从而高估真实泛化能力。其次是成本与方差,同一系统在长时间、多次运行中的结果可能明显不同。仓库还记录部分竞赛存在数据泄漏或准备脚本问题,并计划在后续版本集中修复;比较时必须固定基准版本。[S1][S2]
9. 验收方法
首次采用应从 Lite 子集开始,固定模型版本、脚手架、时间、硬件和随机种子,保存每次运行日志与提交文件。除 Any Medal 比例外,还应记录成功完成率、无效提交率、资源消耗、人工干预和重复运行差异。只有在同一协议下重复至少三次,跨系统比较才具有基本可信度。[S2]
10. 来源与更新时间
本文依据 OpenAI 官方研究页与开源仓库整理,研究与核对日期为 2026-08-08。排行榜提交状态、已知问题和下一版本计划会变化,复现实验前应核对当前仓库说明。