Modal 简调
面向 AI 与数据团队的代码优先 Serverless 计算平台,覆盖 GPU 推理、训练、批处理、Notebook 与 Agent Sandbox。
Modal serverless-compute gpu-cloud agent-sandbox multi-cloud 面向 AI 与数据团队的代码优先 Serverless 计算平台,覆盖 GPU 推理、训练、批处理、Notebook 与 Agent Sandbox。
Modal
1. 调研缘由
Modal 是一个面向 AI 和数据工作负载的 Serverless 计算平台,目前覆盖模型推理、训练、批处理、定时任务、Notebook,以及给 Coding Agent 或强化学习系统执行代码的隔离 Sandbox。[S1][S2]
2026 年 5 月,Modal 完成了一轮 3.55 亿美元的 C 轮融资,投后估值 46.5 亿美元。公司称年化收入已超过 3 亿美元;Reuters 报道其年化收入在 2025 年 9 月时约为 6000 万美元,并引述创始人 Erik Bernhardsson 的说法,过去六个月的增长主要由 AI 编程需求带动。[S4][S5]
这次调研想搞清三件事:
- Modal 的核心生态位到底是 Serverless GPU、AI 云计算抽象层,还是 Agent 执行基础设施;
- 它跟大型云厂商和专业 GPU 平台的差异,能从哪些产品与架构事实中找到支撑;
- 当前增长主要受哪些工作负载驱动,按秒计费、冷启动和平台依赖又会带来哪些边界。
2. 简介与产品工作流
用 Modal,开发者可以直接在 Python 里定义要跑的函数、容器镜像、依赖、CPU、内存和 GPU,平台会负责找计算资源、启动容器、执行任务和自动扩缩容。[S1][S8]
这里的 Serverless 可以简单理解为:你只描述“要运行什么代码、需要什么资源”,不用提前买固定服务器,也不用自己搭 Kubernetes 集群。任务多了,平台可以拉起更多容器;没任务时,默认可以缩到零。[S1][S8]
一个典型的工作流大致是这样:
- 在本地 Python 项目里声明函数、镜像依赖和计算资源;
- Modal 把代码和依赖构建成云端容器;
- 用户通过 SDK、网页端点、队列或定时任务触发运行;
- Modal 按请求量调整容器数量,并按实际分配的计算资源计费。[S1][S7][S8]
Modal 目前支持的 GPU 包括 T4、L4、A10、L40S、A100、H100、H200、B200 和 B300 等。多数高端型号允许单个容器使用多张 GPU,部分型号最多支持 8 张。[S9]
在 Agent 场景下,Modal 提供可以在运行时动态创建的 Sandbox。Sandbox 是隔离的代码执行环境,能用来跑语言模型生成的代码、克隆和测试 Git 仓库、执行 lint,或给不同任务装独立的依赖。[S2]
因此,Modal 实际上横跨两个相邻的生态层:
- 底层是面向 AI 和数据任务的弹性计算基础设施;
- 上层是给 Coding Agent、强化学习系统这类软件 Agent 提供执行操作的运行环境。[S1][S2]
本报告把 primary_category 设为 infrastructure,因为上面这些产品最终都依赖于同一套计算、容器、存储和调度底座。
3. 团队与资本背景
Modal 由 Erik Bernhardsson 和 Akshat Bubna 联合创立。按官方介绍,公司自行构建了文件系统、容器 runtime、调度器和镜像构建系统。团队主要分布在纽约、旧金山和斯德哥尔摩。[S3]
截至 2026 年 7 月,Modal 官方公布累计融资超过 4.66 亿美元,投资方包括 General Catalyst、Redpoint Ventures、Lux Capital、Amplify Partners 和 Creandum。[S3]
2026 年 5 月完成的 C 轮融资规模是 3.55 亿美元,投后估值 46.5 亿美元,由 General Catalyst 和 Redpoint 领投,Menlo Ventures、Bain Capital Ventures 和 Accel 等新投资方加入。[S4] Reuters 对这一融资规模和估值做了独立报道,并补充称,本轮融资分两个估值不同的批次完成。[S5]
官方招聘的岗位覆盖推理研究、ML 性能、训练系统、平台工程、系统工程、基础设施安全、Python SDK、前线部署工程和算力采购策略。这些岗位既涉及底层计算系统,也涵盖模型工作负载优化和企业客户交付。[S3]
这次没有进一步核实两位创始人的完整履历,只保留跟 Modal 当前技术路线和公司资源直接相关的公开信息。
4. 技术基础与生态位
代码优先的计算抽象
Modal 的主要入口并不是云控制台或一大堆 YAML 配置,而是 Python 代码。开发者可以在代码里声明镜像、资源、密钥、存储、超时和伸缩参数,再由平台把这些声明转化成云端计算任务。[S1]
Modal 也提供 JavaScript、TypeScript 和 Go 的 SDK,可以用来创建 Sandbox、调用 Modal Function 以及操作平台资源,但 Python 仍是官方文档和主要工作流的核心。[S11]
自研运行与调度底座
Modal 官方称,公司自己构建了文件系统、容器 runtime、调度器、镜像构建器以及部分存储和计算层,并把来自不同云供应商的容量汇聚到同一个平台上。[S1][S3][S4]
Reuters 报道称,Modal 合作的云计算供应商已从前一年的 5 家增加到 13 家。Modal 会从这些供应来源中寻找可用计算资源,而不是只绑在某一朵云或某一个数据中心上。[S5]
每个 Modal Function 对应一个可自动伸缩的容器池。默认情况下,没有输入任务时可以缩容至零;开发者也可以自行设置最小容器数、最大容器数、缓冲容器数和空闲回收时间。[S8]
模型与推理路线
Modal 本身不是基础模型提供商。用户可以在它的容器里运行开源模型、自研模型、传统数据处理程序或其他任意计算任务,因此 model_strategy 对该项目记为“不适用”。
Modal 不强制用户使用某一种推理框架。官方资料提到,可以跑 vLLM、SGLang 等开源推理引擎,也可以根据任务自己配置模型、镜像、权重、GPU 和伸缩方式。[S1][S4]
Sandbox 与 Agent runtime
普通 Function 通常由开发者提前部署好,而 Sandbox 可以由外部程序在运行时动态创建,并在里面执行事先无法完全确定的代码。[S2]
这种设计很适合下面这些任务:
- 执行语言模型生成的代码;
- 为 Coding Agent 提供独立的工作目录和依赖环境;
- 测试代码仓库或跑自动化检查;
- 为强化学习任务并行创建大量隔离环境。[S2][S4]
Sandbox 跟推理、训练、批处理用的是同一套平台资源。这让 Modal 的定位不只是 GPU 出租,还包含了面向 Agent 的可编程执行环境。[S1][S2][S4]
开放状态与安全
Modal 的 Python、JavaScript/TypeScript 和 Go 客户端 SDK 都在 GitHub 上公开,其中主要客户端仓库用的是 Apache-2.0 许可证。[S11]
这次没找到 Modal 完整服务端调度器、容器 runtime 和控制平面的公开源码。因此,open_status 记为 partial:客户端 SDK 开放,核心计算服务仍以托管平台形式交付。
官方安全文档称,计算任务通过容器和 gVisor 等机制做隔离;定价与企业方案页面还列出了 SOC 2 合规、HIPAA 兼容性、审计日志、RBAC 和 SSO 等企业功能。[S6][S10]
这些认证和隔离能力不代表客户就不用承担安全责任。数据备份、权限设计、密钥管理、业务连续性和应用层安全,仍然需要用户根据自己的场景去配置。
5. 市场与外部信号
融资与收入
Modal 官方称,公司在 2025 年 9 月之后增长了大约五倍,到 2026 年 5 月,年化收入已超过 3 亿美元。[S4]
Reuters 的独立报道口径是:Modal 的年化收入从 2025 年 9 月的大约 6000 万美元,增加到约 3 亿美元。创始人向 Reuters 表示,过去六个月的 AI 编程需求是主要增长来源。[S5]
这里披露的是按近期收入速度推算的年化收入,不是经审计的完整年度收入或净利润。
Modal 官方还称,Sandbox 已经贡献了公司超过三分之一的收入,平台累计启动的 Sandbox 数量超过 10 亿个。[S4] 这些数字都来自公司自己的披露,暂时没找到独立审计或第三方统计数据来验证。
除了 AI 编程,Reuters 报道的客户类型还包括生物技术公司、对冲基金和两家天气预测公司。[S5] Modal 官方列出的其他使用场景有生成式 AI 推理、LLM 微调、计算生物技术和媒体处理。[S3]
定价
Modal 对 GPU、CPU、内存和持久化存储分别计费,普通 Function 没有预留资源要求,也没有最低使用时长增量。[S6][S7]
截至 2026 年 7 月,部分标准 GPU 公开价格如下:[S6]
| GPU | 每秒价格 | 约合每小时 |
|---|---|---|
| L4 | 0.000222 美元 | 0.80 美元 |
| A10 | 0.000306 美元 | 1.10 美元 |
| A100 80GB | 0.000694 美元 | 2.50 美元 |
| H100 | 0.001097 美元 | 3.95 美元 |
| H200 | 0.001261 美元 | 4.54 美元 |
| B200 | 0.001736 美元 | 6.25 美元 |
| B300 | 0.001972 美元 | 7.10 美元 |
普通 Function 的 CPU 价格是每个物理核心每秒 0.0000131 美元,内存价格是每 GiB 每秒 0.00000222 美元。[S6]
Sandbox 和 Notebook 用的是另一套 CPU、内存费率:每个物理核心每秒 0.00003942 美元,内存每 GiB 每秒 0.00000667 美元;GPU 仍然按标准 GPU 价格计费。[S6]
Starter 计划不收固定月费,包含每月 30 美元计算额度、最多 100 个容器和 10 个 GPU 并发。Team 计划为每月 250 美元加计算费用,包含每月 100 美元计算额度、最多 1000 个容器和 50 个 GPU 并发。Enterprise 采用定制定价,并提供更高并发、审计日志、Okta SSO 和 HIPAA 相关支持。[S6]
如果指定运行地区,会按基础价格的大约 1.5—1.75 倍收费;选择不可抢占执行,则按基础价格的 3 倍收费。[S6]
以上价格截至 2026-07,后续可能会有变动。光比 GPU 每小时价格,没法代表完整任务成本,CPU、内存、模型初始化、预热容器、地区和执行保障方式都会影响最终费用。
算力供应与招聘信号
Reuters 报道称,Modal 合作的云计算供应商已由大约 5 家增加到 13 家,反映出公司正在扩大可调度的算力来源。[S5]
官方招聘页面还同时开放推理研究、训练系统、ML 性能、平台工程、安全、SDK、前线部署和算力策略等岗位,覆盖了从算力供应、底层 runtime 到企业客户落地的多个环节。[S3]
6. 公开评价与主要分歧
目前公开的独立评价还不多。现有资料主要来自个别开发者的实验、商业机构的行业分析、学术研究和社区讨论,还没找到在相同模型、镜像、地区和流量配置下做的长期独立横向对比测试。
正面评价(独立开发者实测 / 社区用户):
独立开发者 Hamel Husain 在一篇用 Modal 和 vLLM 跑大模型的实验笔记中,把 Modal 描述成一个适合做机器学习实验的平台。他觉得当时的 A100 资源比较好拿到,实验成本也可控,并公开了脚本来展示复现流程。[S13]
这只是一名开发者基于特定实验的体验,而且部分实验用的是较早版本的 Modal 客户端,不能直接代表所有生产负载。
一些 Hacker News 用户夸 Modal 的 Python 开发体验,还提到用过来处理数据、做队列和 API 等不同任务。[S16] 这些属于少量社区用户的主观反馈,不能据此当成普遍评价,也不能证明产品整体质量。
主要批评与限制(独立开发者实测 / 行业分析 / 学术研究 / 社区用户):
Hamel Husain 的实验还记录了一个镜像缓存问题:缓存没有按预期失效,导致不同模型的实验结果被错误混在一起,后来只能强制重建才修正过来。[S13] 这只是那次实验里的开发体验,不足以证明平台普遍存在这类问题。
商业基础设施机构 Introl 的行业分析认为,Serverless GPU 的经济性高度依赖工作负载。遇到流量突发、平均利用率比较低的时候,缩容可以减少闲置成本;如果持续高利用率,按秒计费的 Serverless 价格可能会比专用或预留算力更贵。[S15] 这份资料是商业机构的分析,并不是严格控制变量的独立实验。
一项关于 Serverless 冷启动的系统综述指出,按需扩缩容和按使用量计费会引入冷启动问题,实际影响取决于运行时初始化、依赖加载和资源分配等环节。[S14] 这项研究讨论的是 Serverless 架构整体,不是专门针对 Modal 的产品评测。
Modal 自己发的工程文章也说明,“容器开始运行”和“完整模型服务可以响应”不是同一个指标。文章里一个推理服务案例,完整启动时间从超过 2000 秒缩短到大约 50 秒;较小模型配合快照后,也仍然需要十几秒才能进入可用状态。[S12] 这些是官方挑选的案例,不能当成所有模型和配置下的统一冷启动数据。
一位 Reddit 用户在讨论按需 GPU 时,评价 Modal、Runpod 等平台的冷启动体验不理想。[S17] 这只是一条社区用户的主观反馈,不能用来证明 Modal 普遍存在某个固定程度的延迟问题。
存在分歧的地方:
-
成本高低取决于任务形态。 对于突发或间歇性任务,缩到零可以减少闲置算力浪费;对于长期持续运行的任务,还是得把 Serverless 单价跟专用、预留资源的价格完整算一笔账。[S6][S7][S15]
-
“冷启动”的测量终点并不唯一。 容器被调度、GPU 可以访问、模型权重加载完毕和首个请求返回,是四个不同的阶段。官方给的基础设施启动指标和开发者实际感受到的完整响应时间,不能直接当成一个数字。[S12][S14]
-
代码优先既提供了控制空间,也要求使用者理解运行环境。 开发者可以自定义模型、依赖、镜像和扩缩容方式,但这套工作流面向的是需要跑自定义代码的技术用户,并不等于直接调用一个现成的模型 API。[S1][S13]
-
Sandbox 到底是一个独立产品,还是通用计算平台的自然延伸。 Modal 把 Sandbox 建在了同一套计算和隔离底座上,并称它已贡献超过三分之一的收入。[S2][S4] 现有信息能确认它已经成为一条重要产品线,但还没披露各类 Sandbox 客户、任务和留存的数据。
7. 同类对比(与头部/高知名度同类项目)
主要对标项目:
- Runpod Serverless:面向 AI 推理和计算密集型任务的 Serverless GPU 服务;
- Google Cloud Run GPU:大型云厂商提供的托管 GPU 容器服务;
- E2B:面向 AI Agent 和 Coding Agent 的隔离 Sandbox 平台。
Modal 同时覆盖 GPU 计算和 Agent Sandbox,所以没有一个对标项目能跟它的全部产品范围完全重合。
关键维度对比(事实,标来源):
| 维度 | Modal | Runpod Serverless | Google Cloud Run GPU | E2B |
|---|---|---|---|---|
| 核心范围 | 推理、训练、批处理、网页服务、Notebook、Sandbox 和通用弹性计算 [S1][S2] | AI 推理及其他计算密集型 Serverless 工作负载 [S18] | 在托管容器服务中运行 GPU 推理、视频处理及其他计算任务 [S20] | 为 AI Agent 提供隔离代码执行和工具运行环境 [S22] |
| 主要开发接口 | 用 Python 定义 Function、镜像和资源;另提供 JavaScript/TypeScript、Go SDK [S1][S11] | 编写 Handler,把代码构建为 Docker Worker,再部署到 Endpoint [S18] | 构建标准容器镜像,通过 Cloud Run Service、Job 或基础设施配置部署 [S20] | 用 Python 或 JavaScript/TypeScript SDK 创建和控制 Sandbox [S22] |
| 扩缩容方式 | Function 对应自动伸缩容器池,默认没任务时可缩容至零 [S8] | Flex Worker 可随请求启动并在空闲后缩容;Active Worker 保持运行 [S18][S19] | GPU 实例可以缩容至零,GPU 服务采用 instance-based billing [S20][S21] | 按需创建独立 Sandbox,由应用控制其生命周期 [S22] |
| 计费边界 | GPU、CPU、内存分别计费;普通 Function 没有最低使用时长增量 [S6][S7] | Worker 从启动到完全停止期间按秒计费,并向上取整到秒 [S19] | 实例整个生命周期计费,并存在一分钟最低计费时间 [S21] | 本次未纳入价格对比,主要比较 Sandbox 产品范围 |
| GPU 范围 | 支持 T4 至 B300,多种型号可配置多张 GPU [S9] | GPU 型号由 Serverless Worker 配置和平台资源决定 [S18] | 当前支持 L4 和 RTX PRO 6000,每个实例配置一张 GPU [S20] | 本次所查官方资料重点为 Agent Sandbox,未将其作为 GPU 型号对标 |
| Agent Sandbox | 提供执行不受信任代码、测试仓库和动态依赖环境的 Sandbox [S2] | 本次所查 Serverless 文档主要围绕 Worker 和 Endpoint,未找到完全对应的一等 Sandbox 产品说明 [S18] | 提供通用容器隔离,本次未找到专门面向 Coding Agent 的同名一级产品说明 [S20] | 产品核心即面向 Agent 的隔离代码执行环境 [S22] |
| 开放与自托管 | 客户端 SDK 为 Apache-2.0;核心计算平台为托管服务 [S11] | 通过 Runpod 托管平台和用户构建的容器 Worker 交付 [S18] | 由 Google Cloud 托管,使用标准容器与 Google Cloud 资源体系 [S20] | 核心基础设施仓库为 Apache-2.0,并提供在 AWS、GCP、Azure 或普通 Linux 环境自托管的说明 [S23] |
就拿 L4 来说,Modal 的标准 GPU 组件价格是每秒 0.000222 美元,另计 CPU 和内存。[S6] Cloud Run 的非区域冗余 L4 GPU 组件价格是每秒 0.0001867 美元,但它还要求配置并支付最低 CPU、内存资源,而且实例有一分钟最低计费时间。[S20][S21]
这两种价格结构不同,不能单看 GPU 组件单价就去判断完整任务成本的高低。
公开评价中的对比(标源,非个人裁决):
Introl 的商业机构分析把 Modal 描述成偏重 Python 原生开发体验的平台,把 Runpod 描述成同时提供 Serverless Worker 和传统 GPU Pod,并提供多种资源使用模式的平台。那篇文章认为,做选择的时候要结合负载利用率、对冷启动的容忍度、定价方式以及需要的控制程度,而不是只比单项小时价格。[S15]
Hamel Husain 的开发者实验说明,Modal 可以用来快速构建可复现的自定义大模型实验环境。[S13] 这次实验没有在相同条件下同时测 Runpod、Cloud Run GPU 和 E2B,所以不能用来得出 Modal 整体优于其他平台的结论。
这次没找到在相同模型、镜像、地区、并发和持续时间下,对这四个平台做完整对照的独立测试。因此,这一栏只保留产品范围、接口、资源、计费规则和标了来源的外部观点,不做整体优劣判断。
8. 信息缺口与后续观察
-
收入构成只披露到部分层级。 Modal 已披露 Sandbox 贡献超过三分之一收入,但没找到足够公开资料来拆分推理、训练、批处理、Notebook 和其他服务的收入占比。
-
Sandbox 使用结构不透明。 官方公布了累计启动量和收入占比,但没披露活跃 Sandbox 客户数、重复使用率、任务类型分布和客户集中度。
-
独立生产环境测试不足。 现有独立资料多为个别开发者实验或行业分析,缺少在统一配置下的长期成本、吞吐、冷启动和可用性对比。
-
底层供应商结构未完全公开。 Reuters 报道 Modal 与 13 家云计算公司合作,但没披露各供应商名称、容量占比、区域分布和长期资源保障方式。
-
平台迁移成本尚未实测。 Modal 使用的是普通 Python 和容器依赖,但应用大量采用 Function、Volume、Queue、Secret、Sandbox 和自动伸缩接口之后,往其他平台迁移需要多少改造,这次没有覆盖。
-
冷启动需要拆分测量。 后续测试最好分别记录调度、镜像启动、模型下载、权重加载、GPU 初始化和首个有效响应时间。
-
企业可靠性资料有限。 官方披露了安全合规和企业功能,但这次没找到足够细的历史 SLA 达成率、重大故障记录和跨区域恢复数据。
-
本次未做产品实测。
is_tested标记为untested。如果进入深调,可以选同一个开源模型,分别测突发推理、持续推理、批处理和 Agent Sandbox 四类任务。
9. 归纳洞察 ★
Modal 反映出,AI 计算平台提供的单位正在从“单张 GPU 的使用时间”扩展为“完整的可编程运行环境”。GPU 仍是核心资源,但容器构建、模型加载、自动伸缩、存储、密钥管理和代码执行环境也逐渐被整合进同一个产品里。
Sandbox 与 Modal 原有计算平台用的是同一套容器、隔离和调度基础。不管是跑模型推理、拉起强化学习环境,还是执行 Agent 生成的代码,都需要快速创建、控制和销毁计算环境。Modal 把这些任务放在同一个底座上,说明 Agent runtime 已成为其通用计算平台中一个重要的工作负载。
Modal 的技术路线不依赖自研基础模型。它的产品差异主要来自代码优先的接口、自建的运行和存储组件、跨云容量调度,以及在同一平台上同时覆盖推理、训练、批处理和 Sandbox。
Reuters 的报道显示,AI 编程是 Modal 最近一轮增长的主要来源;官方披露也显示 Sandbox 已占超过三分之一收入。同时,现有的客户和使用场景仍然覆盖生物技术、金融、天气预测、媒体处理和模型推理。现阶段更准确的归类是:通用 AI 计算平台正在把 Agent 执行环境纳入核心产品范围。
10. 来源与更新时间
- 信息截至(as_of):2026-07-18
- 最后复查(last_checked):2026-07-18
- 最后更新(last_updated):2026-07-18
可追溯来源
- [S1]Tier1Modal Docs: Introduction访问日期:2026-07-18
- [S2]Tier1Modal Docs: Sandboxes访问日期:2026-07-18
- [S3]Tier1Modal Company访问日期:2026-07-18
- [S4]Tier1Modal's Series C: Raising $355M at a $4.65B Valuation访问日期:2026-07-18
- [S5]Tier2Reuters: Modal Labs Valued at $4.65 Billion as AI Coding Takes Off访问日期:2026-07-18
- [S6]Tier1Modal Plan Pricing访问日期:2026-07-18
- [S7]Tier1Modal Docs: Billing访问日期:2026-07-18
- [S8]Tier1Modal Docs: Scaling Out访问日期:2026-07-18
- [S9]Tier1Modal Docs: GPU Acceleration访问日期:2026-07-18
- [S10]Tier1Modal Docs: Security and Privacy访问日期:2026-07-18
- [S11]Tier1GitHub: modal-labs/modal-client访问日期:2026-07-18
- [S12]Tier1Modal: How We Achieved Truly Serverless GPUs访问日期:2026-07-18
- [S13]Tier2Hamel Husain: vLLM & Large Models访问日期:2026-07-18
- [S14]Tier2arXiv: A Systematic Review on Serverless Computing and Cold Start访问日期:2026-07-18
- [S15]Tier2Introl: Serverless GPU Platforms — RunPod, Modal, and Beam Compared访问日期:2026-07-18
- [S16]Tier3Hacker News: Ask HN — What Do You Use for ML Hosting?访问日期:2026-07-18
- [S17]Tier3Reddit r/MachineLearning: On-Demand GPU Discussion访问日期:2026-07-18
- [S18]Tier1Runpod Docs: Serverless Overview访问日期:2026-07-18
- [S19]Tier1Runpod Docs: Serverless Pricing访问日期:2026-07-18
- [S20]Tier1Google Cloud Docs: GPU Support for Cloud Run Services访问日期:2026-07-18
- [S21]Tier1Google Cloud Run Pricing访问日期:2026-07-18
- [S22]Tier1E2B Documentation访问日期:2026-07-18
- [S23]Tier1GitHub: e2b-dev/e2b访问日期:2026-07-18