OpenAI Jalapeño:面向大模型推理的自研加速器
OpenAI 与 Broadcom 联合公布的首款 Intelligence Processor,围绕大模型推理的计算、内存移动、网络和服务模式协同设计。
OpenAI Jalapeño llm-inference ai-infrastructure inference-chip OpenAI OpenAI 与 Broadcom 联合公布的首款 Intelligence Processor,围绕大模型推理的计算、内存移动、网络和服务模式协同设计。
1. 一句话结论
Jalapeño 是 OpenAI 面向大模型推理设计的首款 Intelligence Processor,由 OpenAI 提出架构方向,Broadcom 提供芯片实现与网络技术,并由合作伙伴参与板卡和机架集成。[S1] 它代表 OpenAI 向模型下层基础设施延伸,但截至本次调研仍处于工程样片和部署准备阶段,外部团队不能把公告中的目标性能当成已可采购、可复现的产品指标。
2. 发布状态与定位
OpenAI 与 Broadcom 于 2026 年 6 月 24 日联合公布 Jalapeño。[S1] 官方称工程样片已经在实验室以目标频率和功耗运行机器学习负载,首代平台计划在 2026 年底前开始部署,并作为多代计算平台的起点。[S1] 双方此前公布的合作路线也把自研加速器与机架、网络系统的分阶段部署放在同一计划中。[S2] 这说明它已越过纯概念阶段,但详细技术报告、量产规模和对外供给方式仍未完整披露。
3. 技术路线
Jalapeño 被定位为从空白架构出发、针对现代 LLM 推理设计的加速器,而非把通用计算芯片简单改造为 AI 芯片。[S1] 官方公开的优化对象包括推理内核、数据移动、内存、网络、调度和服务模式。Broadcom 负责硅实现与包括 Tomahawk 在内的网络技术,OpenAI 则以自身模型和线上服务负载提供设计约束。[S1]
4. 适用工作负载
最直接的目标是 ChatGPT、Codex、API 和其他交互式模型服务的大规模推理。[S1] 这类负载同时要求吞吐、低延迟、内存效率和跨节点通信,单看芯片峰值算力不足以说明效果。对外部团队而言,Jalapeño 目前更适合作为观察推理基础设施趋势的样本,而不是近期硬件选型表中的可替换 SKU。
5. 部署路径
官方路线是把芯片、板卡、机架、高性能网络和数据中心部署结合起来,并在后续多代平台中扩展。[S1][S2] 真正上线前还需完成封装、散热、供电、固件、编译器、运行时、故障隔离和容量调度。采购方若未来获得使用入口,应先以一类稳定模型和固定请求分布做影子流量测试,再逐步扩大,而不是用演示负载直接替代生产集群。
6. 性能与成本判断
OpenAI 表示早期测试显示其每瓦性能将优于当时先进水平,但同时明确最终性能仍在测量,详细报告将在之后发布。[S1] 因此目前不能写出可靠的吞吐、延迟、功耗、良率或单位 token 成本结论。评估时应同时记录端到端延迟、批处理效率、峰值与平均功耗、模型兼容性、故障恢复和整机利用率,避免只比较理论峰值。
7. 供应链与集中风险
Jalapeño 的协同设计能够减少软件与硬件之间的错配,也会把模型、运行时、芯片和数据中心路线绑定得更紧。多方合作意味着任何制造、封装、网络、供电或交付环节延迟都可能影响部署。若组织依赖单一平台,应保留其他推理后端、模型导出路径和容量降级方案,并验证故障时是否能安全切回通用 GPU 或其他服务商。
8. 竞争位置
它与通用 GPU、云厂商自研加速器和专用推理芯片处在同一基础设施竞争层,但目标更贴近 OpenAI 自身模型与产品负载。潜在优势是端到端协同,潜在限制是公开资料、软件生态和外部可获得性尚不足。是否成功不能只看芯片是否流片,还要看持续量产、模型迭代兼容、数据中心可靠性以及实际服务成本。
9. 验收清单
未来若进入采购或合作评估,应要求可复现的基准说明、支持模型清单、软硬件版本、功耗测量方法、网络拓扑、故障注入结果和供应承诺。用本方真实请求比较 P50/P95/P99 延迟、吞吐、单位请求能耗和错误率,并连续运行压力测试。只有在性能、可靠性、迁移成本和退出路径同时达标时,才适合把关键推理流量迁入。