基础设施

Fireworks AI 简调

面向开发者和企业的开放权重模型推理、后训练与部署平台,提供共享 API、专属 GPU 部署及客户云账户内的集群方案。

Fireworks AI open-weight-models inference model-customization 面向开发者和企业的开放权重模型推理、后训练与部署平台,提供共享 API、专属 GPU 部署及客户云账户内的集群方案。

Frontmatter

结构化元信息

实体类型
公司
主分类
基础设施
产品状态
已上线
开放状态
部分开源
产品形态
saasapi
能力标签
文本图像视频语音多模态
目标用户
开发者企业
交付方式
SaaSAPI
区域
us
模型策略
开源基础上开发
部署方式
云端SaaS
技术披露
有限公开
是否实测
未测试
融资阶段
Series C
信息截至
2026-07-08
最后复查
2026-07-08

Fireworks AI

1. 调研缘由

Fireworks AI 位于开放权重模型生产化的基础设施层。它主要做模型推理、后训练和部署,要解决的事情就是让团队省掉自己搭一整套 GPU 和模型运维环境的麻烦。2025 年 10 月,公司宣布完成 2.5 亿美元的 Series C 轮融资;到 2026 年 6 月,Microsoft 宣布 Fireworks AI on Microsoft Foundry 正式 GA,并透露预览期已经处理了超过 1760 亿 token,覆盖 17 家标普 500 企业。[S10][S12] (fireworks.ai)

本篇重点回答三个问题:Fireworks 到底是一个模型 API 服务商,还是一个更完整的模型生命周期平台;它的性能与成本主张应该怎么验证;以及“企业拥有自己的 AI”这个说法,在模型、数据和部署边界上具体指什么。

2. 简介与产品工作流

Fireworks AI 是一个给开发者和企业用的托管平台,提供 100 多个文本、视觉、音频、图像和 embedding 模型的推理与微调能力。这里说的“开放权重模型”,是指模型权重可以拿到,在许可证允许的范围内可以自己运行或修改的那种模型;Fireworks 的业务重点就是把这些模型做成直接可调用、可扩缩容的生产服务。[S1] (docs.fireworks.ai)

实际使用通常可以分成四步:

  1. 团队先从 Serverless 路径入手,选定模型,通过 API 按量调用。这条路径由 Fireworks 托管,用户不用自己配 GPU。[S1][S2] (docs.fireworks.ai)
  2. 当项目对延迟、吞吐有更稳定的要求,或者需要更高容量时,可以切到 On-demand deployment,也就是给单个客户分配专属 GPU 的部署方式。[S4] (docs.fireworks.ai)
  3. 团队可以用自己的数据做监督微调(SFT)、直接偏好优化(DPO)或强化微调(RFT)。SFT 是用示例答案训练模型,DPO 是训练模型偏向更符合偏好的回答,RFT 则通过评分或奖励信号来反复优化输出。[S5] (docs.fireworks.ai)
  4. 微调后的模型目前需要部署在 On-demand 专属环境里提供推理服务。[S6] (docs.fireworks.ai)

所以说,Fireworks 的核心仍然是推理基础设施,但它的产品流程已经延伸到了模型选择、后训练和生产部署。

3. 团队与资本背景

Fireworks AI 的创始团队主要来自 Meta、PyTorch 和 Google。CEO Lin Qiao 之前在 Meta 担任 PyTorch 负责人;联合创始人 Chenyu Zhao 曾负责 Google Vertex AI,其他创始成员也都有 Meta 基础设施和 PyTorch 方面的经历。[S9] (fireworks.ai)

公司在 2025 年 10 月宣布完成 2.5 亿美元 Series C,投后估值 40 亿美元;官方称累计融资额达到 3.27 亿美元。该轮由 Lightspeed、Index Ventures 和 Evantic 领投,Sequoia 继续参投。[S10] (fireworks.ai)

《华尔街日报》报道,公司在当时向媒体表示其年化经常性收入已超过 2.8 亿美元、员工约 115 人。这是 2025 年融资时点的公司披露数据,不应看作当前的实时经营状况。[S11] (wsj.com)

4. 技术基础与生态位

Fireworks 的模型策略以开放权重模型为主。官方文档列出了文本、视觉、音频、图像和 embedding 模型,并且支持函数调用、结构化输出、embedding 和 reranking 等面向生产场景的能力。[S1] (docs.fireworks.ai)

Fireworks 官方还支持把视频和音频作为多模态模型的输入;文档里以 Qwen3 Omni 和 Molmo2 为例,列举了视频字幕、场景分析和多模态问答等用途。这里的 video 指的是视频理解与处理能力,并不代表平台已披露了通用的视频生成能力。[S17] (docs.fireworks.ai)

在共享推理层,Serverless 分为 Standard、Priority、Fast 三种服务路径:Standard 是默认路径;Priority 面向高峰期需要更高可靠性的场景;Fast 则面向低延迟场景,需要切换到对应的 Fast 模型版本。[S2] (docs.fireworks.ai)

在专属推理层,On-demand deployment 使用专属 GPU,官方把它定位成适合低延迟、更高吞吐、较稳定性能以及共享模型库以外模型的路径,按 GPU 秒计费。企业还可以购买保留容量,通常以一年期承诺换来保证容量、更高配额和更低的 GPU 小时价格。[S4][S4] (docs.fireworks.ai)

Fireworks 也提供在客户自有 AWS 账户内运行集群的 EKS 路径:计算资源和网络可以放在客户自己的 AWS 账户里,但该方案使用的是 Fireworks 管理的 control plane,模型和部署仍通过 Fireworks 的 CLI 和 Web 控制台来管理。[S7] (docs.fireworks.ai)

这也就意味着,“企业拥有自己的 AI”在 Fireworks 这套产品语境里,主要包括模型选择、模型定制、专属容量以及部分客户云账户内的部署控制;它并不等于默认给你交付一套完全脱离 Fireworks 控制面的本地私有化平台。[S4][S6][S7] (docs.fireworks.ai)

数据方面,官方称开放模型的 prompt 和生成内容默认不会被记录或存储,除非用户主动选择加入相关数据处理;企业实际落地时,还是要结合具体合同、模型、账户配置和部署路径去核实。[S8] (docs.fireworks.ai)

open_status: partial 指的是 Fireworks 的生态里存在一些开放组件,比如 Eval Protocol 和 FireConnect;这并不表示它的主力云端推理平台整体开源。[S16] (fireworks.ai)

5. 市场与外部信号

Fireworks 的商业路径和产品层级是对应的:Serverless 按 token 计费;批处理价格为对应 Serverless 输入与输出价格的 50%;On-demand 按 GPU 秒计费;SFT 和 DPO 按训练 token 计费,部分 160 亿参数以下模型的 RFT 按官方规则可以免费使用。[S3][S4][S5] (docs.fireworks.ai)

Microsoft 在 2026 年 6 月宣布 Fireworks AI on Foundry 正式 GA,提供了企业 SLA、访问控制、审计日志和 PTU Data Zone 支持。微软同时还列出了 Perplexity、Motif、UiPath、StackBlitz 等生产落地案例,并披露了预览期的使用数据。[S12] (devblogs.microsoft.com)

这一合作释放的信号是,Fireworks 不只是靠自己的 API 入口,它也通过 Microsoft Foundry 进入了那些已有 Azure 采购、治理和运维体系的企业客户通路。[S12] (devblogs.microsoft.com)

6. 公开评价与主要分歧

目前能看到的外部独立评价还比较有限。已找到的独立资料主要是动态性能基准和行业报道,还不足以拼出一幅关于 Fireworks 长期稳定性、客户支持、真实总成本或迁移难度的完整图景。

正面评价(独立基准):

Artificial Analysis 提供了横跨 500 多个模型 API 端点的供应商比较,覆盖价格、输出速度、延迟和上下文长度等指标;Fireworks 是它追踪的供应商之一。这类基准给同模型、同指标下的横向测试提供了一个参考框架。[S13] (artificialanalysis.ai)

但目前还缺乏足够多的独立长期实测,能据此概括 Fireworks 在所有模型、所有地区或所有负载条件下的整体优势。

主要批评/质疑(独立媒体 / 分析师观点):

《华尔街日报》引述了 Gartner 分析师的观点,指出很多企业还缺少把模型、数据和推理平台组合成生产系统的专业能力。这是推理平台赛道整体面临的采用门槛,并不是针对 Fireworks 某个具体产品故障的直接指控。[S11] (wsj.com)

存在分歧之处:

性能主张必须按具体模型、价格口径、上下文长度、区域、并发量和服务路径来验证。Artificial Analysis 的供应商数据采用的是滚动时间窗口里的 P50 表现,适合观察某一时点的端点状态,但不适合被直接写成平台的永久排名。[S13] (artificialanalysis.ai)

7. 同类对比(与头部/高知名度同类项目)

主要对标项目: Together AI、Baseten。

关键维度对比(事实,标来源):

维度Fireworks AITogether AIBaseten
共享推理入口提供 Serverless API,并区分 Standard、Priority、Fast 服务路径。[S2]提供 Serverless Inference,并提供 Batch Inference。[S14]提供托管模型 API,也支持以 Truss 打包和部署自定义模型。[S15]
专属部署On-demand 使用专属 GPU;另有保留容量方案。[S4]提供 Dedicated Model Inference、Dedicated Container Inference 与 GPU Clusters。[S14]部署运行在自动扩缩容基础设施上,可设置副本、并发与缩容规则。[S15]
模型定制支持 SFT、DPO、RFT;微调模型通过 On-demand 部署服务。[S5][S6]定价页列出 Fine-Tuning 与 Evaluations 产品,并公开 SFT、DPO 等定价项。[S14]本次核实的官方页面重点说明模型封装、部署与自动扩缩容;未找到足够公开资料确认与前两者完全对应的托管 SFT/DPO/RFT 产品路径。[S15]
客户云环境可在客户 AWS 账户内建立 EKS 集群,但使用 Fireworks 管理的 control plane。[S7]官方页面列有 Dedicated Inference 与 GPU Clusters;本次所查页面未给出与 Fireworks EKS 路径完全一致的客户自有 AWS 账户控制面说明。[S14]官方称通过多云容量管理跨云与区域调度部署;本次所查页面未给出与 Fireworks EKS 路径完全一致的客户账户部署说明。[S15]
可比较的独立基准Artificial Analysis 覆盖其部分模型 API 端点。[S13]Artificial Analysis 覆盖其部分模型 API 端点。[S13]Artificial Analysis 覆盖其部分模型 API 端点。[S13]

公开评价中的对比(标源,非个人裁决):

三者都覆盖开放模型的生产推理,但产品切入点不一样:Fireworks 把共享 API、专属 GPU、后训练和客户 AWS 账户内集群放进了一条产品路径;Together 的公开产品层级还包含 GPU Clusters、Sandbox、Managed Storage 和 Evaluations;Baseten 的官方文档则更突出自定义模型打包、部署、自动扩缩容和多云调度。[S1][S4][S5][S7][S14][S15] (docs.fireworks.ai)

目前还缺少足够稳定、长期、同模型同负载的独立资料,能用来对三者做整体的性能或总成本排序。比较的时候,应该按实际模型、区域、调用形态和采购方式分别测试。[S13] (artificialanalysis.ai)

8. 信息缺口与后续观察

Fireworks 已经公开了 API、部署方式和部分数据安全规则,但还没有找到足够公开资料来拆解它的底层推理引擎、GPU 资源调度、不同量化格式以及长上下文条件下的统一性能方法。

还没有找到足够公开资料来确认客户 AWS 账户内 EKS 路径的商业门槛、适用区域、运维责任边界和正式采购模式。

也还缺少足够多的独立长期测试,来比较 Fireworks、Together AI 和 Baseten 在突发流量、长上下文、模型升级、故障切换、支持响应和总成本上的实际表现。

后续可以持续观察的有:Microsoft Foundry 的新增区域和客户案例、Fireworks 的客户云部署能力会不会进一步扩展、后训练支持的模型范围变化,以及同模型第三方性能基准的持续数据。

9. 归纳洞察 ★

Fireworks 呈现出一种开放权重模型基础设施的路线:平台之间的竞争已经不只看“模型目录有多大”,还要看能不能把共享调用、专属容量、模型定制和生产部署连成一条连续的流程。

拆开来看,它的企业价值主张需要按部署边界来区分。共享 API 和专属 GPU 还是托管服务;客户 AWS 账户里的 EKS 路径则多了对基础设施位置和网络的控制,但控制面仍然在 Fireworks 手里。

Microsoft Foundry 的正式 GA 表明,这类平台的竞争维度也包含了分发和采购入口:推理服务可以借助云平台的企业治理、审计和合同体系到达客户,而不光是靠独立开发者 API 这一条路。

10. 来源与更新时间

  • 信息截至(as_of): 2026-07-08
  • 最后复查(last_checked): 2026-07-08
  • 最后更新(last_updated): null
来源索引

可追溯来源

  1. [S1]Tier1Fireworks AI Docs:Build with Fireworks AI访问 2026-07-08
  2. [S2]Tier1Fireworks Serverless Overview访问 2026-07-08
  3. [S3]Tier1Fireworks Serverless Pricing访问 2026-07-08
  4. [S4]Tier1Fireworks On-demand Deployments访问 2026-07-08
  5. [S5]Tier1Fireworks Managed Fine-Tuning Overview访问 2026-07-08
  6. [S6]Tier1Fireworks Supervised Fine Tuning - Text访问 2026-07-08
  7. [S7]Tier1Fireworks Control Plane on AWS EKS访问 2026-07-08
  8. [S8]Tier1Fireworks Data Security访问 2026-07-08
  9. [S9]Tier1Fireworks Team访问 2026-07-08
  10. [S10]Tier1Fireworks AI Raises $250M Series C访问 2026-07-08
  11. [S11]Tier2Wall Street Journal:AI Inference Startup Fireworks AI Is Valued at $4 Billion in Funding Round访问 2026-07-08
  12. [S12]Tier1Microsoft Foundry Blog:A Developer’s Guide to Managing Models, Cost and Quality in Microsoft Foundry访问 2026-07-08
  13. [S13]Tier2Artificial Analysis:LLM API Providers Leaderboard访问 2026-07-08
  14. [S14]Tier1Together AI Pricing访问 2026-07-08
  15. [S15]Tier1Baseten Overview;Develop a Model on Baseten访问 2026-07-08
  16. [S16]Tier1Fireworks Eval Protocol;FireConnect Source访问 2026-07-08
  17. [S17]Tier1Fireworks Video & Audio Models 更新说明;Cookbooks:Chat with Video using Qwen3 Omni访问 2026-07-08