Fireworks AI 简调
面向开发者和企业的开放权重模型推理、后训练与部署平台,提供共享 API、专属 GPU 部署及客户云账户内的集群方案。
Fireworks AI open-weight-models inference model-customization 面向开发者和企业的开放权重模型推理、后训练与部署平台,提供共享 API、专属 GPU 部署及客户云账户内的集群方案。
Fireworks AI
1. 调研缘由
Fireworks AI 位于开放权重模型生产化的基础设施层。它主要做模型推理、后训练和部署,要解决的事情就是让团队省掉自己搭一整套 GPU 和模型运维环境的麻烦。2025 年 10 月,公司宣布完成 2.5 亿美元的 Series C 轮融资;到 2026 年 6 月,Microsoft 宣布 Fireworks AI on Microsoft Foundry 正式 GA,并透露预览期已经处理了超过 1760 亿 token,覆盖 17 家标普 500 企业。[S10][S12] (fireworks.ai)
本篇重点回答三个问题:Fireworks 到底是一个模型 API 服务商,还是一个更完整的模型生命周期平台;它的性能与成本主张应该怎么验证;以及“企业拥有自己的 AI”这个说法,在模型、数据和部署边界上具体指什么。
2. 简介与产品工作流
Fireworks AI 是一个给开发者和企业用的托管平台,提供 100 多个文本、视觉、音频、图像和 embedding 模型的推理与微调能力。这里说的“开放权重模型”,是指模型权重可以拿到,在许可证允许的范围内可以自己运行或修改的那种模型;Fireworks 的业务重点就是把这些模型做成直接可调用、可扩缩容的生产服务。[S1] (docs.fireworks.ai)
实际使用通常可以分成四步:
- 团队先从 Serverless 路径入手,选定模型,通过 API 按量调用。这条路径由 Fireworks 托管,用户不用自己配 GPU。[S1][S2] (docs.fireworks.ai)
- 当项目对延迟、吞吐有更稳定的要求,或者需要更高容量时,可以切到 On-demand deployment,也就是给单个客户分配专属 GPU 的部署方式。[S4] (docs.fireworks.ai)
- 团队可以用自己的数据做监督微调(SFT)、直接偏好优化(DPO)或强化微调(RFT)。SFT 是用示例答案训练模型,DPO 是训练模型偏向更符合偏好的回答,RFT 则通过评分或奖励信号来反复优化输出。[S5] (docs.fireworks.ai)
- 微调后的模型目前需要部署在 On-demand 专属环境里提供推理服务。[S6] (docs.fireworks.ai)
所以说,Fireworks 的核心仍然是推理基础设施,但它的产品流程已经延伸到了模型选择、后训练和生产部署。
3. 团队与资本背景
Fireworks AI 的创始团队主要来自 Meta、PyTorch 和 Google。CEO Lin Qiao 之前在 Meta 担任 PyTorch 负责人;联合创始人 Chenyu Zhao 曾负责 Google Vertex AI,其他创始成员也都有 Meta 基础设施和 PyTorch 方面的经历。[S9] (fireworks.ai)
公司在 2025 年 10 月宣布完成 2.5 亿美元 Series C,投后估值 40 亿美元;官方称累计融资额达到 3.27 亿美元。该轮由 Lightspeed、Index Ventures 和 Evantic 领投,Sequoia 继续参投。[S10] (fireworks.ai)
《华尔街日报》报道,公司在当时向媒体表示其年化经常性收入已超过 2.8 亿美元、员工约 115 人。这是 2025 年融资时点的公司披露数据,不应看作当前的实时经营状况。[S11] (wsj.com)
4. 技术基础与生态位
Fireworks 的模型策略以开放权重模型为主。官方文档列出了文本、视觉、音频、图像和 embedding 模型,并且支持函数调用、结构化输出、embedding 和 reranking 等面向生产场景的能力。[S1] (docs.fireworks.ai)
Fireworks 官方还支持把视频和音频作为多模态模型的输入;文档里以 Qwen3 Omni 和 Molmo2 为例,列举了视频字幕、场景分析和多模态问答等用途。这里的 video 指的是视频理解与处理能力,并不代表平台已披露了通用的视频生成能力。[S17] (docs.fireworks.ai)
在共享推理层,Serverless 分为 Standard、Priority、Fast 三种服务路径:Standard 是默认路径;Priority 面向高峰期需要更高可靠性的场景;Fast 则面向低延迟场景,需要切换到对应的 Fast 模型版本。[S2] (docs.fireworks.ai)
在专属推理层,On-demand deployment 使用专属 GPU,官方把它定位成适合低延迟、更高吞吐、较稳定性能以及共享模型库以外模型的路径,按 GPU 秒计费。企业还可以购买保留容量,通常以一年期承诺换来保证容量、更高配额和更低的 GPU 小时价格。[S4][S4] (docs.fireworks.ai)
Fireworks 也提供在客户自有 AWS 账户内运行集群的 EKS 路径:计算资源和网络可以放在客户自己的 AWS 账户里,但该方案使用的是 Fireworks 管理的 control plane,模型和部署仍通过 Fireworks 的 CLI 和 Web 控制台来管理。[S7] (docs.fireworks.ai)
这也就意味着,“企业拥有自己的 AI”在 Fireworks 这套产品语境里,主要包括模型选择、模型定制、专属容量以及部分客户云账户内的部署控制;它并不等于默认给你交付一套完全脱离 Fireworks 控制面的本地私有化平台。[S4][S6][S7] (docs.fireworks.ai)
数据方面,官方称开放模型的 prompt 和生成内容默认不会被记录或存储,除非用户主动选择加入相关数据处理;企业实际落地时,还是要结合具体合同、模型、账户配置和部署路径去核实。[S8] (docs.fireworks.ai)
open_status: partial 指的是 Fireworks 的生态里存在一些开放组件,比如 Eval Protocol 和 FireConnect;这并不表示它的主力云端推理平台整体开源。[S16] (fireworks.ai)
5. 市场与外部信号
Fireworks 的商业路径和产品层级是对应的:Serverless 按 token 计费;批处理价格为对应 Serverless 输入与输出价格的 50%;On-demand 按 GPU 秒计费;SFT 和 DPO 按训练 token 计费,部分 160 亿参数以下模型的 RFT 按官方规则可以免费使用。[S3][S4][S5] (docs.fireworks.ai)
Microsoft 在 2026 年 6 月宣布 Fireworks AI on Foundry 正式 GA,提供了企业 SLA、访问控制、审计日志和 PTU Data Zone 支持。微软同时还列出了 Perplexity、Motif、UiPath、StackBlitz 等生产落地案例,并披露了预览期的使用数据。[S12] (devblogs.microsoft.com)
这一合作释放的信号是,Fireworks 不只是靠自己的 API 入口,它也通过 Microsoft Foundry 进入了那些已有 Azure 采购、治理和运维体系的企业客户通路。[S12] (devblogs.microsoft.com)
6. 公开评价与主要分歧
目前能看到的外部独立评价还比较有限。已找到的独立资料主要是动态性能基准和行业报道,还不足以拼出一幅关于 Fireworks 长期稳定性、客户支持、真实总成本或迁移难度的完整图景。
正面评价(独立基准):
Artificial Analysis 提供了横跨 500 多个模型 API 端点的供应商比较,覆盖价格、输出速度、延迟和上下文长度等指标;Fireworks 是它追踪的供应商之一。这类基准给同模型、同指标下的横向测试提供了一个参考框架。[S13] (artificialanalysis.ai)
但目前还缺乏足够多的独立长期实测,能据此概括 Fireworks 在所有模型、所有地区或所有负载条件下的整体优势。
主要批评/质疑(独立媒体 / 分析师观点):
《华尔街日报》引述了 Gartner 分析师的观点,指出很多企业还缺少把模型、数据和推理平台组合成生产系统的专业能力。这是推理平台赛道整体面临的采用门槛,并不是针对 Fireworks 某个具体产品故障的直接指控。[S11] (wsj.com)
存在分歧之处:
性能主张必须按具体模型、价格口径、上下文长度、区域、并发量和服务路径来验证。Artificial Analysis 的供应商数据采用的是滚动时间窗口里的 P50 表现,适合观察某一时点的端点状态,但不适合被直接写成平台的永久排名。[S13] (artificialanalysis.ai)
7. 同类对比(与头部/高知名度同类项目)
主要对标项目: Together AI、Baseten。
关键维度对比(事实,标来源):
| 维度 | Fireworks AI | Together AI | Baseten |
|---|---|---|---|
| 共享推理入口 | 提供 Serverless API,并区分 Standard、Priority、Fast 服务路径。[S2] | 提供 Serverless Inference,并提供 Batch Inference。[S14] | 提供托管模型 API,也支持以 Truss 打包和部署自定义模型。[S15] |
| 专属部署 | On-demand 使用专属 GPU;另有保留容量方案。[S4] | 提供 Dedicated Model Inference、Dedicated Container Inference 与 GPU Clusters。[S14] | 部署运行在自动扩缩容基础设施上,可设置副本、并发与缩容规则。[S15] |
| 模型定制 | 支持 SFT、DPO、RFT;微调模型通过 On-demand 部署服务。[S5][S6] | 定价页列出 Fine-Tuning 与 Evaluations 产品,并公开 SFT、DPO 等定价项。[S14] | 本次核实的官方页面重点说明模型封装、部署与自动扩缩容;未找到足够公开资料确认与前两者完全对应的托管 SFT/DPO/RFT 产品路径。[S15] |
| 客户云环境 | 可在客户 AWS 账户内建立 EKS 集群,但使用 Fireworks 管理的 control plane。[S7] | 官方页面列有 Dedicated Inference 与 GPU Clusters;本次所查页面未给出与 Fireworks EKS 路径完全一致的客户自有 AWS 账户控制面说明。[S14] | 官方称通过多云容量管理跨云与区域调度部署;本次所查页面未给出与 Fireworks EKS 路径完全一致的客户账户部署说明。[S15] |
| 可比较的独立基准 | Artificial Analysis 覆盖其部分模型 API 端点。[S13] | Artificial Analysis 覆盖其部分模型 API 端点。[S13] | Artificial Analysis 覆盖其部分模型 API 端点。[S13] |
公开评价中的对比(标源,非个人裁决):
三者都覆盖开放模型的生产推理,但产品切入点不一样:Fireworks 把共享 API、专属 GPU、后训练和客户 AWS 账户内集群放进了一条产品路径;Together 的公开产品层级还包含 GPU Clusters、Sandbox、Managed Storage 和 Evaluations;Baseten 的官方文档则更突出自定义模型打包、部署、自动扩缩容和多云调度。[S1][S4][S5][S7][S14][S15] (docs.fireworks.ai)
目前还缺少足够稳定、长期、同模型同负载的独立资料,能用来对三者做整体的性能或总成本排序。比较的时候,应该按实际模型、区域、调用形态和采购方式分别测试。[S13] (artificialanalysis.ai)
8. 信息缺口与后续观察
Fireworks 已经公开了 API、部署方式和部分数据安全规则,但还没有找到足够公开资料来拆解它的底层推理引擎、GPU 资源调度、不同量化格式以及长上下文条件下的统一性能方法。
还没有找到足够公开资料来确认客户 AWS 账户内 EKS 路径的商业门槛、适用区域、运维责任边界和正式采购模式。
也还缺少足够多的独立长期测试,来比较 Fireworks、Together AI 和 Baseten 在突发流量、长上下文、模型升级、故障切换、支持响应和总成本上的实际表现。
后续可以持续观察的有:Microsoft Foundry 的新增区域和客户案例、Fireworks 的客户云部署能力会不会进一步扩展、后训练支持的模型范围变化,以及同模型第三方性能基准的持续数据。
9. 归纳洞察 ★
Fireworks 呈现出一种开放权重模型基础设施的路线:平台之间的竞争已经不只看“模型目录有多大”,还要看能不能把共享调用、专属容量、模型定制和生产部署连成一条连续的流程。
拆开来看,它的企业价值主张需要按部署边界来区分。共享 API 和专属 GPU 还是托管服务;客户 AWS 账户里的 EKS 路径则多了对基础设施位置和网络的控制,但控制面仍然在 Fireworks 手里。
Microsoft Foundry 的正式 GA 表明,这类平台的竞争维度也包含了分发和采购入口:推理服务可以借助云平台的企业治理、审计和合同体系到达客户,而不光是靠独立开发者 API 这一条路。
10. 来源与更新时间
- 信息截至(as_of): 2026-07-08
- 最后复查(last_checked): 2026-07-08
- 最后更新(last_updated): null
可追溯来源
- [S1]Tier1Fireworks AI Docs:Build with Fireworks AI访问 2026-07-08
- [S2]Tier1Fireworks Serverless Overview访问 2026-07-08
- [S3]Tier1Fireworks Serverless Pricing访问 2026-07-08
- [S4]Tier1Fireworks On-demand Deployments访问 2026-07-08
- [S5]Tier1Fireworks Managed Fine-Tuning Overview访问 2026-07-08
- [S6]Tier1Fireworks Supervised Fine Tuning - Text访问 2026-07-08
- [S7]Tier1Fireworks Control Plane on AWS EKS访问 2026-07-08
- [S8]Tier1Fireworks Data Security访问 2026-07-08
- [S9]Tier1Fireworks Team访问 2026-07-08
- [S10]Tier1Fireworks AI Raises $250M Series C访问 2026-07-08
- [S11]Tier2Wall Street Journal:AI Inference Startup Fireworks AI Is Valued at $4 Billion in Funding Round访问 2026-07-08
- [S12]Tier1Microsoft Foundry Blog:A Developer’s Guide to Managing Models, Cost and Quality in Microsoft Foundry访问 2026-07-08
- [S13]Tier2Artificial Analysis:LLM API Providers Leaderboard访问 2026-07-08
- [S14]Tier1Together AI Pricing访问 2026-07-08
- [S15]Tier1Baseten Overview;Develop a Model on Baseten访问 2026-07-08
- [S16]Tier1Fireworks Eval Protocol;FireConnect Source访问 2026-07-08
- [S17]Tier1Fireworks Video & Audio Models 更新说明;Cookbooks:Chat with Video using Qwen3 Omni访问 2026-07-08