Meta 面向开发者推出的模型接口,目前以公共预览方式提供 Muse Spark 1.1,支持智能体、多模态、搜索与兼容式 API 接入。
Tag
ai-infrastructure
包含该标签的简调共 27 篇。
NVIDIA 基于 Thor 架构公布的两款 Jetson 边缘 AI 模组,面向机器人、视觉代理与自主机器;量产前宜用开发套件仿真验证算力、内存、功耗和软件兼容。
TPU Developer Hub 汇总 Google Cloud TPU 从架构、训练、后训练到推理、调试和安全的官方资源,适合作为上手与评审入口,而非独立算力服务。
Cloudflare 面向 Workers 推出的 Agent 开发与运行框架,以 Durable Objects 承载身份、状态、实时连接和定时任务。
Llama Stack 起源于 Meta 的标准化 AI 应用接口提案;截至 2026 年 8 月,其官方仓库已更名并转向模型无关的 OGX。
MTIA 300–500 是 Meta 面向推荐、训练和生成式 AI 推理持续迭代的自研加速器家族。
NemoClaw 把 Agent、推理服务与 OpenShell 沙箱组合成可安装、可治理的参考栈,重点解决长期运行 Agent 的权限、网络与凭据边界。
NVIDIA AI Enterprise 体系中的推理微服务,把模型、优化运行时与标准 API 封装为可在云端或数据中心部署的容器。
OpenAI 与 Broadcom 联合公布的首款 Intelligence Processor,围绕大模型推理的计算、内存移动、网络和服务模式协同设计。
Thinking Machines Lab 提供的托管后训练服务,让研究者控制数据、损失与训练循环,由平台处理分布式算力和故障恢复。
Mistral 提供的专用 GPU 云与托管基础设施,覆盖裸金属、Kubernetes、Slurm 以及训练和推理运维。
NVIDIA KVPress 汇集多种训练无关的 KV Cache 压缩方法,并提供基于 Transformers 的统一接口与长上下文评测工具。
Envoy AI Gateway 在 Kubernetes 与 Envoy Gateway 之上统一连接多种模型服务,为生成式 AI 请求提供路由、认证、策略和可观测能力。
Chitu(赤兔)是 thu-pacman 团队开源的大模型推理框架,重点覆盖多种硬件、从单机到集群的部署与生产服务。
Cactus 是面向手机、可穿戴设备和边缘硬件的 AI 推理引擎,以自有计算图、ARM 优化内核和多语言绑定支持文本、语音、视觉及工具调用,并可按置信度转交云端。
vLLM Semantic Router 在模型服务前按请求语义选择模型、工具与策略,适合多模型推理平台,但需要用业务流量校准路由并保留安全回退。
Microsoft BitNet.cpp 是面向 1-bit 语言模型的开源推理框架,官方仓库提供本地构建、模型运行和基准工具。
DeepEP 为混合专家模型训练与推理提供高吞吐、低延迟的 GPU 通信内核,适合能控制并测量底层分布式环境的平台团队。
FlashMLA 提供针对多头潜在注意力的高性能 CUDA 内核,适合有明确硬件、模型结构与基准能力的推理基础设施团队评估。
NVIDIA 的开源分布式推理编排栈,面向多节点模型服务的部署与运行管理。
NIXL 为分布式 AI 系统提供统一的数据传输接口与插件机制,重点服务 KV 缓存等跨内存层移动,价值取决于真实拓扑下的端到端验证。
围绕 wafer-scale AI 芯片构建训练与推理基础设施的公司,核心卖点是用超大芯片和云服务提供低延迟、高吞吐的 AI 计算。
面向 AI 训练、推理和应用开发的专用云平台,核心优势是围绕 GPU/加速计算构建的基础设施和托管服务。
围绕自研 LPU 推理芯片和 GroqCloud 提供高速、低成本 LLM 推理服务,主打 public、private 和 co-cloud 部署形态。
面向 AI 训练和推理的 GPU 云与专用集群服务,核心卖点是把 NVIDIA GPU 算力以实例、集群和更大规模基础设施形式交付给模型团队。
面向大语言模型和多模态模型的开源高性能推理服务框架,强调低延迟、高吞吐、OpenAI 兼容接口和从单 GPU 到分布式集群的部署。
Ray 是面向 AI 与 Python 工作负载的开源分布式计算框架,Anyscale 是围绕 Ray 做生产化、托管化和企业化的平台公司。