CHMv2 是 Meta 与世界资源研究所推出的开放模型与全球树冠高度地图,用于森林和城市树木监测。
Tag
model-evaluation
包含该标签的简调共 19 篇。
OpenAI 发布的真实工作任务评测,覆盖 44 种职业,以专业人员创建的任务、参考材料、交付物和评分标准衡量模型能力。
OpenAI 发布的计算生物学研究级基准,用合成但现实的脏数据任务测试 AI Agent 的分析路径选择、修正与决策判断。
微软研究院面向低资源语言推出的语音模型与评测体系,以 PazaBench、社区测试和模型微调连接数据、指标与真实使用环境。
OpenAI 面向临床专业任务发布的开放评估基准,以医生撰写并复核的对话和逐题评分标准检验模型在诊疗咨询、文书记录与医学研究中的表现。
AlphaGenome 以长 DNA 序列预测多类功能输出并辅助评估变异效应;研究使用需控制输入、版本与证据链,不能直接替代临床判断。
ARC-AGI-2 以少量示例和网格变换任务评估系统对陌生规则的归纳与迁移能力,适合作为推理评测组成部分,而非通用智能单一结论。
BrowseComp 用难检索、短答案任务测试浏览代理的持续搜索与推理能力;使用时应防止数据泄漏,并把它与真实业务评测分开解读。
Evo 2 从大规模基因组序列学习跨物种模式,可用于变异效应评估和序列生成研究,但输出不能替代实验、临床与生物安全审查。
HealthBench 是 OpenAI 发布的医疗对话模型评估基准,以多轮场景和医生编写的细粒度评分标准衡量准确性、安全性、沟通与情境适配,并提供 Consensus 和 Hard 子集及参考实现。
微软研究院的大气基础模型,通过异构地球系统数据预训练与任务微调支持天气、空气质量、海浪和热带气旋预测。
Terminal-Bench 用隔离终端环境和可验证任务评估智能体完成真实工作的能力,适合比较代理系统,但结果高度依赖任务版本与运行环境。
Boltz-1 为蛋白质及相关生物分子结构预测提供开放模型与代码,适合具备计算生物学验证能力的研究团队复现和集成。
Chai-1 将蛋白质、小分子及其他生物分子信息纳入统一结构预测流程,适合科研团队评估候选复合物,但实验验证仍不可替代。
Humanity's Last Exam 用专家级跨学科问题测试前沿模型的知识与推理边界,适合研究比较,但不能单独代表产品可靠性。
SWE-bench Verified 是经人工核验的软件工程评测子集,用于更可靠地衡量模型或 agent 解决真实 GitHub issue 的能力。
SWE-Lancer 用真实自由职业软件工程任务和经济价值衡量模型表现,适合研究编码能力,但不能替代企业代码库中的安全与维护验收。
Stanford CRFM 推出的语言模型整体评测项目,强调用多场景、多指标和透明报告评估模型能力、局限与风险;GitHub 仓库显示其已于 2026-06-01 进入维护模式。
Scale AI 是一家 AI 数据、模型评测与企业/政府 AI 应用基础设施公司,核心能力是用人类专家数据与评测流程帮助模型训练、后训练和部署。