Cohere 发布的 20 亿参数开放语音识别模型,支持 14 种语言与 API、自托管、Model Vault 交付;导入时应实测口音、噪声、专有名词和未内置的时间戳与说话人分离需求。
Tag
developer-api
包含该标签的简调共 12 篇。
Google Gemini API 的统一交互接口,用同一资源模型调用基础模型与专用 Agent,并支持状态、后台任务和执行步骤。
Thinking Machines Lab 提供的托管后训练服务,让研究者控制数据、损失与训练循环,由平台处理分布式算力和故障恢复。
Claude 3.5 Haiku 曾面向低延迟、高吞吐任务提供轻量模型选择,现已进入历史生命周期,存量系统应以迁移与回归验证为重点。
GPT-4.1 系列曾以长上下文、编码和指令遵循进入 OpenAI API,当前选型必须结合官方模型状态与替代路径重新评测。
面向工具调用和多轮任务的 OpenAI API 接口,用于构建可受控的 Agent 应用。
Private AI 是面向文本敏感信息识别与处理的隐私保护平台。
Composio 为 AI Agent 提供应用连接与工具集成能力。
Tavily 是面向 AI 应用与 Agent 的网页搜索和研究 API。
AI 视频生成与翻译平台,覆盖 avatar generation、voice cloning、captions、translation、企业本地化和开发者 API。
MiniMax 在 2026 年 6 月发布的 M 系列模型,官方资料强调 coding、agentic tasks、1M context、原生多模态和 MSA 架构,并提供 API 与开放模型相关入口。
Google DeepMind 的高效率视频生成模型,基于 Veo 3,可从文本或图像生成带音频的高质量高分辨率视频,并通过 Gemini API、AI Studio、Vertex AI 和 Flow 分发。