基础设施

DeepSeek 3FS:面向 AI 训练存储的落地边界

3FS 是面向 AI 训练与推理工作负载的开源分布式文件系统;应先在隔离集群验证数据加载、检查点与故障恢复。

DeepSeek 3FS deepseek storage infrastructure 3FS 是面向 AI 训练与推理工作负载的开源分布式文件系统;应先在隔离集群验证数据加载、检查点与故障恢复。

Frontmatter

结构化元信息

实体类型
开源项目
主分类
基础设施
产品状态
已上线
开放状态
开源
产品形态
distributed-storageopen-source
能力标签
shared-storagetraining-data-accesscheckpointing
目标用户
infrastructure-teamsml-engineers
交付方式
self-hosted
区域
chinaglobal
信息截至
2026-08-03
最后复查
2026-08-03

1. 产品定位

DeepSeek 3FS(Fire-Flyer File System)是 DeepSeek 公开的高性能分布式文件系统,目标是服务 AI 训练和推理中的共享存储访问。[S1] 官方说明强调 SSD、RDMA 网络、文件接口和强一致性;它不是模型、对象存储网关或托管 SaaS。对团队而言,最实际的切入点是把它作为训练数据、并行检查点或推理 KVCache 的候选数据层,而不是把“高吞吐”直接等同于业务集群会得到同样的性能。

2. 适合先验证的工作负载

先挑一个可回放的训练任务:固定数据集切片、固定 dataloader 并发数和固定检查点频率,同时保留现有存储作为对照。3FS 的资料列出了数据准备、随机访问的数据加载、并行 checkpoint 和推理 KVCache 等场景。[S1] 因此验收应分别量读取尾延迟、训练吞吐、checkpoint 完成时间与恢复时间;不要把四类负载混成一个平均数,也不要用空载压测替代训练期间的观测。

3. 集群与依赖边界

部署前应把节点角色、NVMe 盘、网卡、RDMA 配置、FoundationDB、FUSE 和编译器版本写成清单。官方安装说明列出了这些依赖,并提示不同编译器对应的 shuffle 配置可能不兼容。[S1] 这意味着新旧节点混跑或“临时升级编译器”都可能带来兼容性风险。先在独立测试集群完成安装和重启演练,再决定是否接入生产训练网络;这一步可逆,生产数据不应成为首个验证样本。

4. 数据组织与访问控制

将训练原始数据、可再生中间结果、模型 checkpoint 和推理缓存分目录、分配额、分保留期。客户端只授予所需路径的读写权限,训练服务账户不应拥有删除全局数据或读取其他项目目录的能力。凭据通过节点或工作负载身份下发,不能写入镜像、训练脚本或日志。尤其是 KVCache 含有请求上下文衍生信息时,应按推理租户隔离并设置过期策略。

5. 性能验证方法

官方展示的是特定硬件和集群规模下的测试结果,[S1] 不应外推到本地。用相同模型、批大小、数据切分和网络条件,对比基线与 3FS:记录每 epoch 耗时、GPU 空闲比例、p50/p95 读取延迟、失败重试与节点资源占用。再分别施加小文件、随机读取、并发 checkpoint 和背景 I/O。成功不是某个峰值更高,而是在目标负载下吞吐稳定、尾延迟不拖慢训练,且没有数据完整性告警。

6. 一致性与恢复演练

3FS 的设计资料提到强一致性和事务性元数据依赖。[S1] 仍应以本地演练验证故障时的行为:中断一个客户端、重启存储节点、模拟网络抖动,再检查目录列表、文件哈希、checkpoint 可加载性及任务是否出现重复写入。所有演练使用可丢弃数据,并记录故障注入时间、恢复操作和结果。若训练框架在恢复后读取到不完整 checkpoint,必须阻断自动续跑并回到上一个已验证快照。

7. 容量、成本与生命周期

容量规划不能只看原始盘容量。应为副本、元数据、临时输出、检查点保留和故障余量留出空间,并为训练高峰设置水位线。数据准备产生的大量中间文件可能比最终数据集更快耗尽 inode 或元数据资源。每项作业写明所有者、预计读写量、保存期限和清理责任;清理前先生成清单并由作业负责人确认,避免把可恢复训练所需的 checkpoint 当作临时目录删除。

8. 可观测性与运维

仪表板至少按存储节点、客户端和工作负载展示容量、网络、读写延迟、错误率、重试次数及不可用时间。训练侧同时记录 dataloader 等待、GPU 利用率和 checkpoint 成功率,才能判断瓶颈在存储还是训练代码。告警要区分容量逼近、单节点异常、元数据失败和客户端权限拒绝;每一种告警附运行手册、值班责任人和安全降级方式,例如暂停新作业而不是让所有训练作业同时失败。

9. 上线验收

建议分三关:第一关在空集群通过安装、权限和单节点恢复;第二关用脱敏或公开数据完成完整训练与恢复;第三关以一个可回退的低优先级生产作业灰度运行。每关均保留配置版本、负载参数、哈希校验和观测数据。放量条件应是连续多个训练周期无数据损坏、恢复流程可执行、容量水位正常,并得到平台、训练和安全负责人共同确认。

10. 来源与更新时间

本文仅依据官方仓库和组织入口核验项目身份与公开能力范围。[S1][S2] 版本、硬件规模、依赖和许可证变化时,应重新运行安装、兼容性和恢复测试。对外报告应明确本地测试条件,不把官方示例或测试集群结果描述为本组织的生产指标。

  • [S1] DeepSeek 3FS 官方仓库|链接|访问 2026-08-03
  • [S2] DeepSeek 官方 GitHub 组织|链接|访问 2026-08-03