Chitu 赤兔:面向多元算力的开源大模型推理框架
Chitu(赤兔)是 thu-pacman 团队开源的大模型推理框架,重点覆盖多种硬件、从单机到集群的部署与生产服务。
Chitu llm-inference model-serving ai-infrastructure open-source Chitu(赤兔)是 thu-pacman 团队开源的大模型推理框架,重点覆盖多种硬件、从单机到集群的部署与生产服务。
1. 项目定位
Chitu(赤兔)是 thu-pacman 团队维护的开源大模型推理框架,项目强调效率、灵活性和可用性,并把自身定位为生产级推理引擎。它关注的是把已有模型权重稳定地跑在不同算力上,而不是训练基础模型或提供终端聊天产品。代码以 Apache License 2.0 发布。[S1]
2. 它解决什么问题
大模型落地会遇到硬件差异、模型结构变化、并行配置和服务稳定性等问题。Chitu 试图覆盖从 CPU、单 GPU 到多机集群的渐进式部署,并为 NVIDIA 及多类国产芯片提供适配路径。其价值在于减少为每种设备单独拼装推理栈的工作,但实际兼容性仍取决于版本与具体配置。[S1][S2]
3. 多元硬件支持
官方仓库列出 NVIDIA、昇腾、沐曦、海光、摩尔线程等平台相关支持,开发手册也分别给出容器和源码安装方式。不同平台需要相应驱动、PyTorch 变体和构建选项,不能把“支持”理解为同一安装包在所有设备上无差别运行。采购或迁移前应先核对目标卡型与当前版本。[S1][S2]
4. 模型与并行
项目面向 DeepSeek、Qwen、GLM、Kimi 等模型持续增加适配,并提供张量并行、流水线并行和多实例部署等配置。开发手册展示了通过配置文件和命令行设置模型目录、并行规模、缓存与注意力实现。参数组合与硬件强相关,官方示例应作为起点,而不是直接复制到生产环境。[S1][S2]
5. 安装与分发
官方推荐从 Releases 获取 chitu.run,用单个可执行文件封装容器与启动逻辑;同时保留显式 Docker、Apptainer 和源码安装路径。chitu.run 可以简化多节点、多实例或分离式部署的启动,但使用者仍需准备匹配的驱动、设备权限、模型文件和网络环境。[S1][S2]
6. 适用场景
适合评估的场景包括国产与 NVIDIA 混合硬件环境、需要自托管开放权重模型的企业、单卡到集群逐步扩容的推理服务,以及希望针对缓存、并行和算子做细致调优的工程团队。若只需低流量 API 且没有运维能力,托管推理服务可能更省时。[S1][S2]
7. 建议部署路径
先选官方明确支持的一种小模型和单机设备,完成固定输入的功能验证;再用真实请求分布测试吞吐、首 token 延迟与显存;随后才扩大并行规模或切换硬件。所有实验都应固定 Chitu 版本、模型提交、驱动、容器镜像与配置文件,避免性能结果无法复现。[S1][S2]
8. 主要风险
多硬件适配会扩大依赖矩阵,驱动、编译器、PyTorch 和可选算子之间容易出现版本冲突。不同模型的新结构也可能早于框架支持。生产环境还需处理服务限流、请求隔离、模型加载失败、节点退出和监控告警;仓库提供推理能力,不代表这些业务保障已经自动完成。[S1][S2]
9. 验收方法
验收应使用与业务接近的输入输出长度和并发分布,记录吞吐、TTFT、TPOT、峰值显存、错误率和长时间稳定性。再模拟进程重启、单节点退出、无效请求和显存压力,确认恢复行为。跨硬件比较必须使用同一模型、精度和请求集,并把安装复杂度与运维时间计入总成本。[S1][S2]
10. 来源与更新时间
本文依据项目官方仓库与开发手册整理,研究与核对日期为 2026-08-08。支持的模型、设备和安装方式更新较快,部署前应核对当前分支、发行版与文档。