基础设施

Modal 简调

面向 AI 与数据团队的代码优先 Serverless 计算平台,覆盖 GPU 推理、训练、批处理、Notebook 与 Agent Sandbox。

Modal serverless-compute gpu-cloud agent-sandbox multi-cloud 面向 AI 与数据团队的代码优先 Serverless 计算平台,覆盖 GPU 推理、训练、批处理、Notebook 与 Agent Sandbox。

Frontmatter

结构化元信息

实体类型
公司
主分类
基础设施
产品状态
已上线
开放状态
部分开源
产品形态
saasapi
能力标签
代码自动化
目标用户
开发者企业
交付方式
SaaSAPI
区域
useurope
模型策略
不适用
部署方式
云端SaaS
技术披露
公开较多
是否实测
未测试
融资阶段
Series C
信息截至
2026-07-18
最后复查
2026-07-18

Modal

1. 调研缘由

Modal 是一个面向 AI 和数据工作负载的 Serverless 计算平台,目前覆盖模型推理、训练、批处理、定时任务、Notebook,以及给 Coding Agent 或强化学习系统执行代码的隔离 Sandbox。[S1][S2]

2026 年 5 月,Modal 完成了一轮 3.55 亿美元的 C 轮融资,投后估值 46.5 亿美元。公司称年化收入已超过 3 亿美元;Reuters 报道其年化收入在 2025 年 9 月时约为 6000 万美元,并引述创始人 Erik Bernhardsson 的说法,过去六个月的增长主要由 AI 编程需求带动。[S4][S5]

这次调研想搞清三件事:

  1. Modal 的核心生态位到底是 Serverless GPU、AI 云计算抽象层,还是 Agent 执行基础设施;
  2. 它跟大型云厂商和专业 GPU 平台的差异,能从哪些产品与架构事实中找到支撑;
  3. 当前增长主要受哪些工作负载驱动,按秒计费、冷启动和平台依赖又会带来哪些边界。

2. 简介与产品工作流

用 Modal,开发者可以直接在 Python 里定义要跑的函数、容器镜像、依赖、CPU、内存和 GPU,平台会负责找计算资源、启动容器、执行任务和自动扩缩容。[S1][S8]

这里的 Serverless 可以简单理解为:你只描述“要运行什么代码、需要什么资源”,不用提前买固定服务器,也不用自己搭 Kubernetes 集群。任务多了,平台可以拉起更多容器;没任务时,默认可以缩到零。[S1][S8]

一个典型的工作流大致是这样:

  1. 在本地 Python 项目里声明函数、镜像依赖和计算资源;
  2. Modal 把代码和依赖构建成云端容器;
  3. 用户通过 SDK、网页端点、队列或定时任务触发运行;
  4. Modal 按请求量调整容器数量,并按实际分配的计算资源计费。[S1][S7][S8]

Modal 目前支持的 GPU 包括 T4、L4、A10、L40S、A100、H100、H200、B200 和 B300 等。多数高端型号允许单个容器使用多张 GPU,部分型号最多支持 8 张。[S9]

在 Agent 场景下,Modal 提供可以在运行时动态创建的 Sandbox。Sandbox 是隔离的代码执行环境,能用来跑语言模型生成的代码、克隆和测试 Git 仓库、执行 lint,或给不同任务装独立的依赖。[S2]

因此,Modal 实际上横跨两个相邻的生态层:

  • 底层是面向 AI 和数据任务的弹性计算基础设施;
  • 上层是给 Coding Agent、强化学习系统这类软件 Agent 提供执行操作的运行环境。[S1][S2]

本报告把 primary_category 设为 infrastructure,因为上面这些产品最终都依赖于同一套计算、容器、存储和调度底座。

3. 团队与资本背景

Modal 由 Erik Bernhardsson 和 Akshat Bubna 联合创立。按官方介绍,公司自行构建了文件系统、容器 runtime、调度器和镜像构建系统。团队主要分布在纽约、旧金山和斯德哥尔摩。[S3]

截至 2026 年 7 月,Modal 官方公布累计融资超过 4.66 亿美元,投资方包括 General Catalyst、Redpoint Ventures、Lux Capital、Amplify Partners 和 Creandum。[S3]

2026 年 5 月完成的 C 轮融资规模是 3.55 亿美元,投后估值 46.5 亿美元,由 General Catalyst 和 Redpoint 领投,Menlo Ventures、Bain Capital Ventures 和 Accel 等新投资方加入。[S4] Reuters 对这一融资规模和估值做了独立报道,并补充称,本轮融资分两个估值不同的批次完成。[S5]

官方招聘的岗位覆盖推理研究、ML 性能、训练系统、平台工程、系统工程、基础设施安全、Python SDK、前线部署工程和算力采购策略。这些岗位既涉及底层计算系统,也涵盖模型工作负载优化和企业客户交付。[S3]

这次没有进一步核实两位创始人的完整履历,只保留跟 Modal 当前技术路线和公司资源直接相关的公开信息。

4. 技术基础与生态位

代码优先的计算抽象

Modal 的主要入口并不是云控制台或一大堆 YAML 配置,而是 Python 代码。开发者可以在代码里声明镜像、资源、密钥、存储、超时和伸缩参数,再由平台把这些声明转化成云端计算任务。[S1]

Modal 也提供 JavaScript、TypeScript 和 Go 的 SDK,可以用来创建 Sandbox、调用 Modal Function 以及操作平台资源,但 Python 仍是官方文档和主要工作流的核心。[S11]

自研运行与调度底座

Modal 官方称,公司自己构建了文件系统、容器 runtime、调度器、镜像构建器以及部分存储和计算层,并把来自不同云供应商的容量汇聚到同一个平台上。[S1][S3][S4]

Reuters 报道称,Modal 合作的云计算供应商已从前一年的 5 家增加到 13 家。Modal 会从这些供应来源中寻找可用计算资源,而不是只绑在某一朵云或某一个数据中心上。[S5]

每个 Modal Function 对应一个可自动伸缩的容器池。默认情况下,没有输入任务时可以缩容至零;开发者也可以自行设置最小容器数、最大容器数、缓冲容器数和空闲回收时间。[S8]

模型与推理路线

Modal 本身不是基础模型提供商。用户可以在它的容器里运行开源模型、自研模型、传统数据处理程序或其他任意计算任务,因此 model_strategy 对该项目记为“不适用”。

Modal 不强制用户使用某一种推理框架。官方资料提到,可以跑 vLLM、SGLang 等开源推理引擎,也可以根据任务自己配置模型、镜像、权重、GPU 和伸缩方式。[S1][S4]

Sandbox 与 Agent runtime

普通 Function 通常由开发者提前部署好,而 Sandbox 可以由外部程序在运行时动态创建,并在里面执行事先无法完全确定的代码。[S2]

这种设计很适合下面这些任务:

  • 执行语言模型生成的代码;
  • 为 Coding Agent 提供独立的工作目录和依赖环境;
  • 测试代码仓库或跑自动化检查;
  • 为强化学习任务并行创建大量隔离环境。[S2][S4]

Sandbox 跟推理、训练、批处理用的是同一套平台资源。这让 Modal 的定位不只是 GPU 出租,还包含了面向 Agent 的可编程执行环境。[S1][S2][S4]

开放状态与安全

Modal 的 Python、JavaScript/TypeScript 和 Go 客户端 SDK 都在 GitHub 上公开,其中主要客户端仓库用的是 Apache-2.0 许可证。[S11]

这次没找到 Modal 完整服务端调度器、容器 runtime 和控制平面的公开源码。因此,open_status 记为 partial:客户端 SDK 开放,核心计算服务仍以托管平台形式交付。

官方安全文档称,计算任务通过容器和 gVisor 等机制做隔离;定价与企业方案页面还列出了 SOC 2 合规、HIPAA 兼容性、审计日志、RBAC 和 SSO 等企业功能。[S6][S10]

这些认证和隔离能力不代表客户就不用承担安全责任。数据备份、权限设计、密钥管理、业务连续性和应用层安全,仍然需要用户根据自己的场景去配置。

5. 市场与外部信号

融资与收入

Modal 官方称,公司在 2025 年 9 月之后增长了大约五倍,到 2026 年 5 月,年化收入已超过 3 亿美元。[S4]

Reuters 的独立报道口径是:Modal 的年化收入从 2025 年 9 月的大约 6000 万美元,增加到约 3 亿美元。创始人向 Reuters 表示,过去六个月的 AI 编程需求是主要增长来源。[S5]

这里披露的是按近期收入速度推算的年化收入,不是经审计的完整年度收入或净利润。

Modal 官方还称,Sandbox 已经贡献了公司超过三分之一的收入,平台累计启动的 Sandbox 数量超过 10 亿个。[S4] 这些数字都来自公司自己的披露,暂时没找到独立审计或第三方统计数据来验证。

除了 AI 编程,Reuters 报道的客户类型还包括生物技术公司、对冲基金和两家天气预测公司。[S5] Modal 官方列出的其他使用场景有生成式 AI 推理、LLM 微调、计算生物技术和媒体处理。[S3]

定价

Modal 对 GPU、CPU、内存和持久化存储分别计费,普通 Function 没有预留资源要求,也没有最低使用时长增量。[S6][S7]

截至 2026 年 7 月,部分标准 GPU 公开价格如下:[S6]

GPU每秒价格约合每小时
L40.000222 美元0.80 美元
A100.000306 美元1.10 美元
A100 80GB0.000694 美元2.50 美元
H1000.001097 美元3.95 美元
H2000.001261 美元4.54 美元
B2000.001736 美元6.25 美元
B3000.001972 美元7.10 美元

普通 Function 的 CPU 价格是每个物理核心每秒 0.0000131 美元,内存价格是每 GiB 每秒 0.00000222 美元。[S6]

Sandbox 和 Notebook 用的是另一套 CPU、内存费率:每个物理核心每秒 0.00003942 美元,内存每 GiB 每秒 0.00000667 美元;GPU 仍然按标准 GPU 价格计费。[S6]

Starter 计划不收固定月费,包含每月 30 美元计算额度、最多 100 个容器和 10 个 GPU 并发。Team 计划为每月 250 美元加计算费用,包含每月 100 美元计算额度、最多 1000 个容器和 50 个 GPU 并发。Enterprise 采用定制定价,并提供更高并发、审计日志、Okta SSO 和 HIPAA 相关支持。[S6]

如果指定运行地区,会按基础价格的大约 1.5—1.75 倍收费;选择不可抢占执行,则按基础价格的 3 倍收费。[S6]

以上价格截至 2026-07,后续可能会有变动。光比 GPU 每小时价格,没法代表完整任务成本,CPU、内存、模型初始化、预热容器、地区和执行保障方式都会影响最终费用。

算力供应与招聘信号

Reuters 报道称,Modal 合作的云计算供应商已由大约 5 家增加到 13 家,反映出公司正在扩大可调度的算力来源。[S5]

官方招聘页面还同时开放推理研究、训练系统、ML 性能、平台工程、安全、SDK、前线部署和算力策略等岗位,覆盖了从算力供应、底层 runtime 到企业客户落地的多个环节。[S3]

6. 公开评价与主要分歧

目前公开的独立评价还不多。现有资料主要来自个别开发者的实验、商业机构的行业分析、学术研究和社区讨论,还没找到在相同模型、镜像、地区和流量配置下做的长期独立横向对比测试。

正面评价(独立开发者实测 / 社区用户):

独立开发者 Hamel Husain 在一篇用 Modal 和 vLLM 跑大模型的实验笔记中,把 Modal 描述成一个适合做机器学习实验的平台。他觉得当时的 A100 资源比较好拿到,实验成本也可控,并公开了脚本来展示复现流程。[S13]

这只是一名开发者基于特定实验的体验,而且部分实验用的是较早版本的 Modal 客户端,不能直接代表所有生产负载。

一些 Hacker News 用户夸 Modal 的 Python 开发体验,还提到用过来处理数据、做队列和 API 等不同任务。[S16] 这些属于少量社区用户的主观反馈,不能据此当成普遍评价,也不能证明产品整体质量。

主要批评与限制(独立开发者实测 / 行业分析 / 学术研究 / 社区用户):

Hamel Husain 的实验还记录了一个镜像缓存问题:缓存没有按预期失效,导致不同模型的实验结果被错误混在一起,后来只能强制重建才修正过来。[S13] 这只是那次实验里的开发体验,不足以证明平台普遍存在这类问题。

商业基础设施机构 Introl 的行业分析认为,Serverless GPU 的经济性高度依赖工作负载。遇到流量突发、平均利用率比较低的时候,缩容可以减少闲置成本;如果持续高利用率,按秒计费的 Serverless 价格可能会比专用或预留算力更贵。[S15] 这份资料是商业机构的分析,并不是严格控制变量的独立实验。

一项关于 Serverless 冷启动的系统综述指出,按需扩缩容和按使用量计费会引入冷启动问题,实际影响取决于运行时初始化、依赖加载和资源分配等环节。[S14] 这项研究讨论的是 Serverless 架构整体,不是专门针对 Modal 的产品评测。

Modal 自己发的工程文章也说明,“容器开始运行”和“完整模型服务可以响应”不是同一个指标。文章里一个推理服务案例,完整启动时间从超过 2000 秒缩短到大约 50 秒;较小模型配合快照后,也仍然需要十几秒才能进入可用状态。[S12] 这些是官方挑选的案例,不能当成所有模型和配置下的统一冷启动数据。

一位 Reddit 用户在讨论按需 GPU 时,评价 Modal、Runpod 等平台的冷启动体验不理想。[S17] 这只是一条社区用户的主观反馈,不能用来证明 Modal 普遍存在某个固定程度的延迟问题。

存在分歧的地方:

  1. 成本高低取决于任务形态。 对于突发或间歇性任务,缩到零可以减少闲置算力浪费;对于长期持续运行的任务,还是得把 Serverless 单价跟专用、预留资源的价格完整算一笔账。[S6][S7][S15]

  2. “冷启动”的测量终点并不唯一。 容器被调度、GPU 可以访问、模型权重加载完毕和首个请求返回,是四个不同的阶段。官方给的基础设施启动指标和开发者实际感受到的完整响应时间,不能直接当成一个数字。[S12][S14]

  3. 代码优先既提供了控制空间,也要求使用者理解运行环境。 开发者可以自定义模型、依赖、镜像和扩缩容方式,但这套工作流面向的是需要跑自定义代码的技术用户,并不等于直接调用一个现成的模型 API。[S1][S13]

  4. Sandbox 到底是一个独立产品,还是通用计算平台的自然延伸。 Modal 把 Sandbox 建在了同一套计算和隔离底座上,并称它已贡献超过三分之一的收入。[S2][S4] 现有信息能确认它已经成为一条重要产品线,但还没披露各类 Sandbox 客户、任务和留存的数据。

7. 同类对比(与头部/高知名度同类项目)

主要对标项目:

  • Runpod Serverless:面向 AI 推理和计算密集型任务的 Serverless GPU 服务;
  • Google Cloud Run GPU:大型云厂商提供的托管 GPU 容器服务;
  • E2B:面向 AI Agent 和 Coding Agent 的隔离 Sandbox 平台。

Modal 同时覆盖 GPU 计算和 Agent Sandbox,所以没有一个对标项目能跟它的全部产品范围完全重合。

关键维度对比(事实,标来源):

维度ModalRunpod ServerlessGoogle Cloud Run GPUE2B
核心范围推理、训练、批处理、网页服务、Notebook、Sandbox 和通用弹性计算 [S1][S2]AI 推理及其他计算密集型 Serverless 工作负载 [S18]在托管容器服务中运行 GPU 推理、视频处理及其他计算任务 [S20]为 AI Agent 提供隔离代码执行和工具运行环境 [S22]
主要开发接口用 Python 定义 Function、镜像和资源;另提供 JavaScript/TypeScript、Go SDK [S1][S11]编写 Handler,把代码构建为 Docker Worker,再部署到 Endpoint [S18]构建标准容器镜像,通过 Cloud Run Service、Job 或基础设施配置部署 [S20]用 Python 或 JavaScript/TypeScript SDK 创建和控制 Sandbox [S22]
扩缩容方式Function 对应自动伸缩容器池,默认没任务时可缩容至零 [S8]Flex Worker 可随请求启动并在空闲后缩容;Active Worker 保持运行 [S18][S19]GPU 实例可以缩容至零,GPU 服务采用 instance-based billing [S20][S21]按需创建独立 Sandbox,由应用控制其生命周期 [S22]
计费边界GPU、CPU、内存分别计费;普通 Function 没有最低使用时长增量 [S6][S7]Worker 从启动到完全停止期间按秒计费,并向上取整到秒 [S19]实例整个生命周期计费,并存在一分钟最低计费时间 [S21]本次未纳入价格对比,主要比较 Sandbox 产品范围
GPU 范围支持 T4 至 B300,多种型号可配置多张 GPU [S9]GPU 型号由 Serverless Worker 配置和平台资源决定 [S18]当前支持 L4 和 RTX PRO 6000,每个实例配置一张 GPU [S20]本次所查官方资料重点为 Agent Sandbox,未将其作为 GPU 型号对标
Agent Sandbox提供执行不受信任代码、测试仓库和动态依赖环境的 Sandbox [S2]本次所查 Serverless 文档主要围绕 Worker 和 Endpoint,未找到完全对应的一等 Sandbox 产品说明 [S18]提供通用容器隔离,本次未找到专门面向 Coding Agent 的同名一级产品说明 [S20]产品核心即面向 Agent 的隔离代码执行环境 [S22]
开放与自托管客户端 SDK 为 Apache-2.0;核心计算平台为托管服务 [S11]通过 Runpod 托管平台和用户构建的容器 Worker 交付 [S18]由 Google Cloud 托管,使用标准容器与 Google Cloud 资源体系 [S20]核心基础设施仓库为 Apache-2.0,并提供在 AWS、GCP、Azure 或普通 Linux 环境自托管的说明 [S23]

就拿 L4 来说,Modal 的标准 GPU 组件价格是每秒 0.000222 美元,另计 CPU 和内存。[S6] Cloud Run 的非区域冗余 L4 GPU 组件价格是每秒 0.0001867 美元,但它还要求配置并支付最低 CPU、内存资源,而且实例有一分钟最低计费时间。[S20][S21]

这两种价格结构不同,不能单看 GPU 组件单价就去判断完整任务成本的高低。

公开评价中的对比(标源,非个人裁决):

Introl 的商业机构分析把 Modal 描述成偏重 Python 原生开发体验的平台,把 Runpod 描述成同时提供 Serverless Worker 和传统 GPU Pod,并提供多种资源使用模式的平台。那篇文章认为,做选择的时候要结合负载利用率、对冷启动的容忍度、定价方式以及需要的控制程度,而不是只比单项小时价格。[S15]

Hamel Husain 的开发者实验说明,Modal 可以用来快速构建可复现的自定义大模型实验环境。[S13] 这次实验没有在相同条件下同时测 Runpod、Cloud Run GPU 和 E2B,所以不能用来得出 Modal 整体优于其他平台的结论。

这次没找到在相同模型、镜像、地区、并发和持续时间下,对这四个平台做完整对照的独立测试。因此,这一栏只保留产品范围、接口、资源、计费规则和标了来源的外部观点,不做整体优劣判断。

8. 信息缺口与后续观察

  1. 收入构成只披露到部分层级。 Modal 已披露 Sandbox 贡献超过三分之一收入,但没找到足够公开资料来拆分推理、训练、批处理、Notebook 和其他服务的收入占比。

  2. Sandbox 使用结构不透明。 官方公布了累计启动量和收入占比,但没披露活跃 Sandbox 客户数、重复使用率、任务类型分布和客户集中度。

  3. 独立生产环境测试不足。 现有独立资料多为个别开发者实验或行业分析,缺少在统一配置下的长期成本、吞吐、冷启动和可用性对比。

  4. 底层供应商结构未完全公开。 Reuters 报道 Modal 与 13 家云计算公司合作,但没披露各供应商名称、容量占比、区域分布和长期资源保障方式。

  5. 平台迁移成本尚未实测。 Modal 使用的是普通 Python 和容器依赖,但应用大量采用 Function、Volume、Queue、Secret、Sandbox 和自动伸缩接口之后,往其他平台迁移需要多少改造,这次没有覆盖。

  6. 冷启动需要拆分测量。 后续测试最好分别记录调度、镜像启动、模型下载、权重加载、GPU 初始化和首个有效响应时间。

  7. 企业可靠性资料有限。 官方披露了安全合规和企业功能,但这次没找到足够细的历史 SLA 达成率、重大故障记录和跨区域恢复数据。

  8. 本次未做产品实测。 is_tested 标记为 untested。如果进入深调,可以选同一个开源模型,分别测突发推理、持续推理、批处理和 Agent Sandbox 四类任务。

9. 归纳洞察 ★

Modal 反映出,AI 计算平台提供的单位正在从“单张 GPU 的使用时间”扩展为“完整的可编程运行环境”。GPU 仍是核心资源,但容器构建、模型加载、自动伸缩、存储、密钥管理和代码执行环境也逐渐被整合进同一个产品里。

Sandbox 与 Modal 原有计算平台用的是同一套容器、隔离和调度基础。不管是跑模型推理、拉起强化学习环境,还是执行 Agent 生成的代码,都需要快速创建、控制和销毁计算环境。Modal 把这些任务放在同一个底座上,说明 Agent runtime 已成为其通用计算平台中一个重要的工作负载。

Modal 的技术路线不依赖自研基础模型。它的产品差异主要来自代码优先的接口、自建的运行和存储组件、跨云容量调度,以及在同一平台上同时覆盖推理、训练、批处理和 Sandbox。

Reuters 的报道显示,AI 编程是 Modal 最近一轮增长的主要来源;官方披露也显示 Sandbox 已占超过三分之一收入。同时,现有的客户和使用场景仍然覆盖生物技术、金融、天气预测、媒体处理和模型推理。现阶段更准确的归类是:通用 AI 计算平台正在把 Agent 执行环境纳入核心产品范围。

10. 来源与更新时间

  • 信息截至(as_of):2026-07-18
  • 最后复查(last_checked):2026-07-18
  • 最后更新(last_updated):2026-07-18
来源索引

可追溯来源

  1. [S1]Tier1Modal Docs: Introduction访问日期:2026-07-18
  2. [S2]Tier1Modal Docs: Sandboxes访问日期:2026-07-18
  3. [S3]Tier1Modal Company访问日期:2026-07-18
  4. [S4]Tier1Modal's Series C: Raising $355M at a $4.65B Valuation访问日期:2026-07-18
  5. [S5]Tier2Reuters: Modal Labs Valued at $4.65 Billion as AI Coding Takes Off访问日期:2026-07-18
  6. [S6]Tier1Modal Plan Pricing访问日期:2026-07-18
  7. [S7]Tier1Modal Docs: Billing访问日期:2026-07-18
  8. [S8]Tier1Modal Docs: Scaling Out访问日期:2026-07-18
  9. [S9]Tier1Modal Docs: GPU Acceleration访问日期:2026-07-18
  10. [S10]Tier1Modal Docs: Security and Privacy访问日期:2026-07-18
  11. [S11]Tier1GitHub: modal-labs/modal-client访问日期:2026-07-18
  12. [S12]Tier1Modal: How We Achieved Truly Serverless GPUs访问日期:2026-07-18
  13. [S13]Tier2Hamel Husain: vLLM & Large Models访问日期:2026-07-18
  14. [S14]Tier2arXiv: A Systematic Review on Serverless Computing and Cold Start访问日期:2026-07-18
  15. [S15]Tier2Introl: Serverless GPU Platforms — RunPod, Modal, and Beam Compared访问日期:2026-07-18
  16. [S16]Tier3Hacker News: Ask HN — What Do You Use for ML Hosting?访问日期:2026-07-18
  17. [S17]Tier3Reddit r/MachineLearning: On-Demand GPU Discussion访问日期:2026-07-18
  18. [S18]Tier1Runpod Docs: Serverless Overview访问日期:2026-07-18
  19. [S19]Tier1Runpod Docs: Serverless Pricing访问日期:2026-07-18
  20. [S20]Tier1Google Cloud Docs: GPU Support for Cloud Run Services访问日期:2026-07-18
  21. [S21]Tier1Google Cloud Run Pricing访问日期:2026-07-18
  22. [S22]Tier1E2B Documentation访问日期:2026-07-18
  23. [S23]Tier1GitHub: e2b-dev/e2b访问日期:2026-07-18