ARC-AGI-2 以少量示例和网格变换任务评估系统对陌生规则的归纳与迁移能力,适合作为推理评测组成部分,而非通用智能单一结论。
Tag
reasoning
包含该标签的简调共 8 篇。
Anthropic 于 2025 年发布、现已从自营 API 退役的混合推理模型,适合作为模型迁移与评测样本。
Anthropic 于 2025 年推出的 Opus 4 与 Sonnet 4 模型家族,支持即时响应、扩展思考和工具调用。
Gemini 2.5 Pro 是 Google 的思考型多模态模型,适合复杂代码、文档与长上下文分析,但上线前仍需按真实任务验证质量、延迟和成本。
面向高难度数学推理的评测基准,用于比较模型在可验证复杂问题上的表现。
OpenAI 的 o4-mini 推理模型,应在固定评测、工具控制和人工复核框架中使用。
DeepSeek 在 API 中于 2025 年末部署的 V3.2 模型版本,分为非思考与思考模式,并已被 V4 系列替代。
Google 在 Gemini API 中提供的 Gemini 3 系列 Pro 预览模型,面向复杂推理、代码和多模态理解任务。