Meta 面向开发者推出的模型接口,目前以公共预览方式提供 Muse Spark 1.1,支持智能体、多模态、搜索与兼容式 API 接入。
Tag
model-serving
包含该标签的简调共 16 篇。
Google 基于 Gemma 4 推出的实验性开放权重文本扩散模型,以并行去噪生成换取本地低并发场景的更低时延。
IBM 推出的开放权重语言模型家族,以 Mamba-2 与 Transformer 混合架构降低长上下文和并发推理的内存压力。
NVIDIA AI Enterprise 体系中的推理微服务,把模型、优化运行时与标准 API 封装为可在云端或数据中心部署的容器。
Thinking Machines Lab 提供的托管后训练服务,让研究者控制数据、损失与训练循环,由平台处理分布式算力和故障恢复。
Llama 3.3 70B Instruct 是 Meta 于 2024 年 12 月发布的 70B 文本指令模型,提供开放权重与长上下文能力,但使用者需遵守专用许可证并自行承担部署与安全治理。
Chitu(赤兔)是 thu-pacman 团队开源的大模型推理框架,重点覆盖多种硬件、从单机到集群的部署与生产服务。
nano-vLLM 是一个轻量、可读的 vLLM 风格推理实现,适合教学、代码研读和受控实验,不宜未经压测直接替代成熟生产引擎。
BentoML 是用于将 AI 模型封装为可部署服务的开源 Python 框架与工具链。
fal 是用于生成式媒体模型推理的产品。
Ollama 是面向本地运行和调用语言模型的开源工具与服务接口。
围绕 Ray 生态构建的 AI 计算平台,服务分布式训练、批量推理、模型服务、LLM 与生成式 AI 工作负载。
围绕 wafer-scale AI 芯片构建训练与推理基础设施的公司,核心卖点是用超大芯片和云服务提供低延迟、高吞吐的 AI 计算。
面向 AI 训练、推理和应用开发的专用云平台,核心优势是围绕 GPU/加速计算构建的基础设施和托管服务。
面向大语言模型和多模态模型的开源高性能推理服务框架,强调低延迟、高吞吐、OpenAI 兼容接口和从单 GPU 到分布式集群的部署。
vLLM 是一个开源的大模型推理与服务引擎,核心用途是让开发者更高效地部署和服务 LLM / 多模态模型。