Claude Opus 4.7 是 Anthropic 面向复杂编码、智能体、视觉和多步骤专业工作的闭源模型,适合用真实长任务评估质量、成本与安全控制。
Tag
multimodal
包含该标签的简调共 24 篇。
Muse Image 是 Meta 推出的智能体式图像生成与编辑模型,支持搜索、代码工具、自我修正和多参考图组合,并通过 Meta AI 等产品交付。
Brain2Qwerty v2 是 Meta 面向非侵入式脑机接口研究的端到端脑信号到文本解码系统。
Google DeepMind 的多模态视频生成与编辑模型,可接收文本、图像或视频输入,并通过多轮自然语言保持场景连续地调整输出。
Google 面向手机、平板与笔记本推出的开放权重多模态模型,以嵌套架构和低内存设计支持端侧文本、视觉与音频任务。
Google Pics 是由 Nano Banana 驱动的图像生成与编辑工具,支持提示词、参考图和元素级修改。
GPT-Live 为 ChatGPT Voice 提供自然语音轮替、任务发起、进度检查与持续调整能力。
微软研究院面向低资源语言推出的语音模型与评测体系,以 PazaBench、社区测试和模型微调连接数据、指标与真实使用环境。
Mistral Physics AI 面向工业工程,用几何、边界条件和仿真数据训练模型,辅助设计探索与数字孪生。
Meta Superintelligence Labs 推出的多模态推理模型系列,支持工具调用、视觉推理和多智能体编排,并通过 Meta AI 与预览 API 提供能力。
Google 面向盲人和低视力跑者研究的设备端辅助代理,结合路径分割、Gemma 4 与多代理语音提示。
SAM 3.1 是 Meta 面向图像与视频检测、分割和跟踪的模型更新,重点优化多对象视频处理。
Llama 3.2 是 Meta 于 2024 年发布的模型家族,包含面向端侧文本任务的 1B、3B 模型,以及支持图像理解的 11B、90B 视觉模型。
Gemma 3 是 Google DeepMind 推出的开放权重模型家族,提供多种参数规模,并在较大版本中支持图文输入、长上下文和多语言。
Gemini 2.0 是 Google 于 2024 年底发布、面向智能体时代的多模态模型家族,强调原生工具调用与低延迟 Flash 路线;其 Gemini API 端点已于 2026-06-01 停用,现更适合作为架构演进案例而非新项目选型。
Gemini 2.5 Pro 是 Google 的思考型多模态模型,适合复杂代码、文档与长上下文分析,但上线前仍需按真实任务验证质量、延迟和成本。
Google DeepMind 的具身 AI 模型方向,面向机器人感知、推理和动作任务的研究与受控试点。
Hume AI 提供面向语音与表达交互的 AI 开发平台与 API。
Google 在 Gemini API 中提供的 Gemini 3 系列 Pro 预览模型,面向复杂推理、代码和多模态理解任务。
Mistral 发布的开放模型,将推理、多模态理解和 Agent 编程能力合并到同一 Small 系列模型中。
Google DeepMind 在 2026 年 7 月发布的 Flash-tier Gemini 模型,定位为高效率 workhorse model,强调 coding、knowledge work、多模态和 token efficiency。
Google DeepMind 发布的新一代 Gemma 开放模型家族,面向高级推理、agentic workflows、本地部署和多模态能力。
Moonshot AI 的 Kimi K2.6 模型,官方强调编码、长程执行、agent swarm、多模态输入和 256K 上下文,是 Kimi 工作流能力的核心模型之一。
Meta 发布的开放权重基础模型系列,Llama 4 引入原生多模态和 MoE 架构,形成了全球最重要的开源权重模型生态之一。