MTIA 300–500 是 Meta 面向推荐、训练和生成式 AI 推理持续迭代的自研加速器家族。
Tag
llm-inference
包含该标签的简调共 15 篇。
NVIDIA AI Enterprise 体系中的推理微服务,把模型、优化运行时与标准 API 封装为可在云端或数据中心部署的容器。
OpenAI 与 Broadcom 联合公布的首款 Intelligence Processor,围绕大模型推理的计算、内存移动、网络和服务模式协同设计。
NVIDIA KVPress 汇集多种训练无关的 KV Cache 压缩方法,并提供基于 Transformers 的统一接口与长上下文评测工具。
vLLM 社区维护的昇腾硬件插件,为大语言模型在 Ascend NPU 上提供与 vLLM 对接的推理和服务路径。
Chitu(赤兔)是 thu-pacman 团队开源的大模型推理框架,重点覆盖多种硬件、从单机到集群的部署与生产服务。
nano-vLLM 是一个轻量、可读的 vLLM 风格推理实现,适合教学、代码研读和受控实验,不宜未经压测直接替代成熟生产引擎。
vLLM Semantic Router 在模型服务前按请求语义选择模型、工具与策略,适合多模型推理平台,但需要用业务流量校准路由并保留安全回退。
DeepEP 为混合专家模型训练与推理提供高吞吐、低延迟的 GPU 通信内核,适合能控制并测量底层分布式环境的平台团队。
FlashMLA 提供针对多头潜在注意力的高性能 CUDA 内核,适合有明确硬件、模型结构与基准能力的推理基础设施团队评估。
NVIDIA 的开源分布式推理编排栈,面向多节点模型服务的部署与运行管理。
NIXL 为分布式 AI 系统提供统一的数据传输接口与插件机制,重点服务 KV 缓存等跨内存层移动,价值取决于真实拓扑下的端到端验证。
围绕自研 LPU 推理芯片和 GroqCloud 提供高速、低成本 LLM 推理服务,主打 public、private 和 co-cloud 部署形态。
面向大语言模型和多模态模型的开源高性能推理服务框架,强调低延迟、高吞吐、OpenAI 兼容接口和从单 GPU 到分布式集群的部署。
vLLM 是一个开源的大模型推理与服务引擎,核心用途是让开发者更高效地部署和服务 LLM / 多模态模型。