Together AI 简调
面向开发者和企业的 AI 基础设施平台,围绕开放权重模型提供 Serverless 与专属推理、微调和训练、GPU 集群、评测及代码沙箱等能力。
Together AI open-weight-models inference fine-tuning 面向开发者和企业的 AI 基础设施平台,围绕开放权重模型提供 Serverless 与专属推理、微调和训练、GPU 集群、评测及代码沙箱等能力。
Together AI
1. 调研缘由
Together AI 是开放权重模型基础设施赛道里产品覆盖比较全的一家公司。它不只做按 token 付费的模型 API,还把专属推理、微调与训练、GPU 集群、评测、代码沙箱和存储放到同一个平台里。[S1][S2]
2026 年 7 月,公司宣布完成 8 亿美元 Series C 融资,估值 83 亿美元。[S3][S4] 这让 Together AI 成了一个观察“开放模型怎么从模型文件变成生产服务”的合适样本。这篇重点看三件事:它的各层产品怎么衔接;性能和成本主张要怎么验证;以及它和 Fireworks AI、Groq 这类服务的边界在哪里。
2. 简介与产品工作流
Together AI 是面向开发者和企业的 AI 云平台,主要做开放权重模型的推理、后训练和部署。平台同时支持文本、图像、视频、语音等模型类型,用户可以先从共享 Serverless API 开始,再按负载和治理要求转向专属端点或 GPU 集群。[S1][S2]
典型工作流可以分成五步:
- 选模型并原型验证:开发者从模型目录里选模型,通过 OpenAI 兼容 API 发起调用。Serverless 不需要预先配置 GPU,也没有最低使用成本。[S5]
- 评测与筛选:平台的 Evaluations 服务可以用 LLM-as-a-Judge 等方式对模型和输入做比较,费用主要来自评测所消耗的推理。[S6]
- 定制模型:团队可以上传训练数据做监督微调或其他后训练,再把定制后的模型部署成服务。[S2][S7]
- 转向稳定生产容量:当流量稳定、需要更高限额或保留硬件时,可以改用 Dedicated Endpoint;同一套推理 API 让原型和专属部署之间不用重写调用逻辑。[S5]
- 扩展到基础设施层:需要直接用计算资源的团队还可以采购 GPU Clusters,并结合 Sandbox 和 Managed Storage 组织 agent 执行环境和数据。[S2][S8]
这条路径的重点不是替用户选一个固定模型,而是把模型目录、推理、评测、定制和计算资源串起来。
3. 团队与资本背景
Together AI 的创始团队包括 CEO Vipul Ved Prakash、CTO Ce Zhang、研究者 Chris Ré、首席科学家 Tri Dao 和 Percy Liang。[S9] 其中 Tri Dao 是 FlashAttention 的主要作者之一,Chris Ré、Percy Liang 和 Ce Zhang 有机器学习系统与基础模型研究背景。
公司在 2025 年 2 月宣布完成 3.05 亿美元 Series B,当时官方披露平台有约 45 万名开发者,并称客户与收入增长较快。[S10] 2026 年 7 月,Together AI 又宣布完成 8 亿美元 Series C;Reuters 报道这轮融资对应 83 亿美元估值。[S3][S4]
融资规模说明资本市场继续押注独立 AI 基础设施供应商,但估值、客户数量和官方增长数据并不能直接证明每个产品层都已形成同样成熟的收入与交付能力。
4. 技术基础与生态位
Together AI 的模型策略以开放权重模型为主。平台自己不只做托管,也参与推理内核和模型系统研究;官方把 Together Kernel Collection、推理引擎和对 FlashAttention 等技术的积累作为效率基础。[S10][S11]
在 Serverless 层,平台按输入和输出 token、图像像素、视频秒数或音频秒数计费。缓存输入可以拿到折扣,非实时批处理在部分模型上最高可按 Serverless 价格的 50% 计费。[S5][S12]
在 Dedicated 层,客户获得保留硬件和更稳定的容量;Serverless 的请求区域不能由用户指定,如有数据驻留或特定区域要求,官方建议用可固定硬件区域的 Dedicated Endpoint。[S5]
在企业部署层,Together AI 公开说明其企业平台可以运行在 Together 云、专属 GPU 或客户自己的基础设施中。[S11] 但不同方案的控制面位置、支持区域、硬件选择、最低采购量和运维责任,需要通过具体合同核实,不能把“可在自有基础设施运行”理解成所有功能都默认可离线交付。
open_status: partial 的原因是:Together AI 主要服务开放权重模型,也公开过研究和部分软件组件,但主力云平台、调度系统和完整推理服务并不是整体开源产品。
5. 市场与外部信号
Together AI 的商业模式覆盖多种负载形态:Serverless 按使用量计费;批处理提供折扣;Dedicated Endpoint 和 GPU Cluster 按硬件与保留周期收费;微调与训练按模型、token 或计算资源计费。[S5][S8][S12]
官方在 Series C 公告中列出的客户包括 Cognition、Decagon、ElevenLabs、Cursor 和 Suno,并称已有数千家客户。[S3] 这些是公司披露,能作为采用信号,但缺少独立审计的收入结构、留存率和单一客户集中度数据。
产品范围也在继续外扩。Together AI 增加了语音 agent、代码 Sandbox、Managed Storage 和 Evaluations,并与模型开发团队合作在新模型发布时提供推理入口。[S2][S6][S13] 这表明平台在从单纯模型 API 走向更完整的 AI 应用运行环境。
6. 公开评价与主要分歧
性能方面的正面信号:
Together AI 曾引用 Artificial Analysis 的独立数据展示特定模型端点的输出速度,也公布过自家推理引擎在指定硬件和输入长度下的吞吐测试。[S11] 前者提供了供应商横向观察入口,后者仍属于厂商测试。二者都需要按同模型、同量化、同上下文、并发、区域和价格口径解读。
主要质疑与不确定性:
推理平台的“快”和“便宜”很容易受模型版本、批处理、缓存命中、量化精度、服务层级和硬件利用率影响。独立研究也提醒,AI 基准常见数据污染、文档不足、测量对象失真和激励错位等问题。[S14] 因此,官网的倍数型性能或成本主张不能直接外推到所有客户负载。
Serverless 的区域不可选、限额会随共享容量变化;Dedicated 能提供更稳定的容量,但把成本从按 token 变成了保留硬件开支。[S5] 这两条路径没有一个对所有团队都更优,关键取决于流量是否稳定、对区域和延迟是否有硬要求。
7. 同类对比(与头部/高知名度同类项目)
主要对标项目: Fireworks AI、Groq。
| 维度 | Together AI | Fireworks AI | Groq |
|---|---|---|---|
| 共享推理 | Serverless API,覆盖多种开放权重模型和多模态类型。[S5][S12] | Serverless API,并区分 Standard、Priority、Fast 路径。[S15] | GroqCloud API,重点使用自研 LPU 提供低延迟推理。[S16] |
| 专属容量 | Dedicated Endpoint 与 GPU Clusters。[S2][S8] | On-demand 专属 GPU 与保留容量。[S15] | 提供企业和专属部署选项,具体方案需联系销售。[S16] |
| 模型定制 | 支持微调、训练和评测。[S2][S6][S7] | 支持 SFT、DPO、RFT,并把微调模型部署到 On-demand。[S15] | 官方产品重点是推理;本次未找到与前两者完全对应的托管训练产品链路。[S16] |
| 基础设施范围 | 还包括 GPU 集群、Sandbox、Managed Storage。[S2][S8] | 包含客户 AWS 账户内 EKS 路径和部分开放组件。[S15] | 核心差异在自研 LPU 硬件和对应云服务。[S16] |
| 区域控制 | Serverless 不可选区域;Dedicated 可固定目标区域。[S5] | 不同服务和部署路径的区域需按文档与合同核实。[S15] | 可用区域和专属部署条件需按计划核实。[S16] |
Together AI 与 Fireworks AI 都在把开放模型推理、专属容量和模型定制连成平台;Groq 的差异更多来自自研硬件。三者的真实总成本需要用同一模型、同一质量设置、同一流量曲线和同一可用性目标做压力测试,不能只比公开单价或峰值 token 速度。
8. 信息缺口与后续观察
公开资料没有完整披露 Together AI 当前收入、毛利率、客户留存、前十大客户集中度和各产品层收入占比。Series C 后的资金用途有方向性说明,但缺少可量化进度。
Serverless 的实际路由区域、故障切换机制和不同模型的长期稳定性没有统一公开数据。Dedicated 与客户自有基础设施方案的最低采购量、区域、支持边界和控制面责任也需要逐案确认。
平台公布了多项性能主张,但仍缺少覆盖长上下文、突发流量、缓存、量化质量和故障恢复的长期第三方测试。
后续可观察:Series C 后 GPU 供给扩张、客户自有环境部署、Sandbox 与 agent 工作负载的采用情况,以及同模型同负载的独立供应商基准。
9. 归纳洞察 ★
Together AI 的平台路线可以概括为:先用共享 API 试模型,再用评测和微调确定版本,流量稳定后转向专属端点,规模继续上升时再采购 GPU 集群或客户环境部署。
它的差异不只在模型目录,而在能否让这些层级使用相近接口和数据流程。对客户来说,这降低了原型到生产之间的迁移工作,同时也可能让模型、评测、计算和运行环境集中到同一供应商。
因此,选择 Together AI 时既要评估推理价格和速度,也要评估区域、控制面、退出成本和自有基础设施边界。开放权重模型降低了模型层锁定,但不会自动消除平台层锁定。
10. 来源与更新时间
- 信息截至(as_of): 2026-07-22
- 最后复查(last_checked): 2026-07-22
- 最后更新(last_updated): null
可追溯来源
- [S1]Tier1Together AI:Home访问 2026-07-22
- [S2]Tier1Together AI:Products访问 2026-07-22
- [S3]Tier1Together AI:Announcing our $800M Series C访问 2026-07-22
- [S4]Tier2Reuters via Investing.com:Together AI raises $800 million at $8.3 billion valuation访问 2026-07-22
- [S5]Tier1Together AI Docs:Serverless Overview访问 2026-07-22
- [S6]Tier1Together AI Docs:LLM Evaluations访问 2026-07-22
- [S7]Tier1Together AI:Fine-Tuning Platform访问 2026-07-22
- [S8]Tier1Together AI Docs:GPU Clusters Billing访问 2026-07-22
- [S9]Tier1Together AI:About Us访问 2026-07-22
- [S10]Tier1Together AI:$305M Series B访问 2026-07-22
- [S11]Tier1Together AI:Introducing the Together Enterprise Platform访问 2026-07-22
- [S12]Tier1Together AI:Pricing访问 2026-07-22
- [S13]Tier1Together AI:Build Real-Time Voice Agents访问 2026-07-22
- [S14]Tier2arXiv:Can We Trust AI Benchmarks?访问 2026-07-22
- [S15]Tier1Fireworks AI Docs:Introduction;On-demand Deployments;Fine-Tuning访问 2026-07-22
- [S16]Tier1Groq:GroqCloud;Products访问 2026-07-22