模型

GLM-4.6V 简调

Z.ai 开源的多模态模型系列,覆盖文本、图像、视频和文件输入,并加入原生函数调用能力。

GLM-4.6V glm vision-language function-calling open-weights Z.ai 开源的多模态模型系列,覆盖文本、图像、视频和文件输入,并加入原生函数调用能力。

Frontmatter

结构化元信息

实体类型
模型
主分类
模型
产品状态
已上线
开放状态
开源
产品形态
modelapimodel-weights
能力标签
多模态文本代码推理自动化
目标用户
开发者企业创作者
交付方式
API模型权重自托管
区域
china
模型策略
自研基础模型
部署方式
Z.ai API 与本地部署
技术披露
有限公开
是否实测
未测试
融资阶段
not-applicable
信息截至
2026-07-31
最后复查
2026-07-31

GLM-4.6V

1. 调研缘由

GLM-4.6V 把视觉理解与函数调用放进同一模型系列,是 2025 年末多模态 Agent 路线的一个清晰样本。[S1]

2. 简介与产品工作流

Z.ai 于 2025 年 12 月发布并开源 GLM-4.6V 系列,包含面向云端和高性能集群的 GLM-4.6V(106B),以及面向本地部署与低延迟场景的 GLM-4.6V-Flash(9B)。[S1]

官方文档列出的输入模态包括视频、图像、文本和文件,输出为文本;开发者可把视觉或文档内容直接作为模型输入,并让模型在需要时调用工具。[S1][S2]

3. 团队与资本背景

该系列由 Z.ai 发布,属于其 GLM 模型线,不是独立融资项目。[S1]

4. 技术基础与生态位

官方称 GLM-4.6V 训练上下文长度为 128K,并首次在该系列中集成原生 Function Calling;模型权重可从 Hugging Face 和 ModelScope 获取,也支持通过 Z.ai 的 OpenAI 兼容 API 调用。[S1][S2]

它位于开源多模态基础模型层,目标是在视觉理解之后直接进入工具执行,而不是先把所有视觉输入转换为纯文字描述。[S1]

5. 市场与外部信号

Z.ai 同时提供云端 API 与本地部署路径,并列出 vLLM、SGLang 等推理框架支持。这使其可被用于托管服务或自建推理环境。[S1][S2]

6. 公开评价与主要分歧

正面评价(官方):

官方将原生多模态工具调用定位为连接视觉感知与可执行动作的能力。[S1]

主要批评/质疑(独立来源):

本次调研未纳入足以形成独立评价汇总的可复现第三方资料。

存在分歧之处:

官方披露了型号、上下文和部署方式,但完整训练数据、配方与系统性安全评估仍需以后续技术材料补充。

7. 同类对比(与头部/高知名度同类项目)

主要对标项目: Qwen-VL、Gemini 系列、GPT 系列多模态模型。

维度GLM-4.6V闭源多模态 API其他开源视觉语言模型
输入视频、图像、文本、文件。[S2]视产品而定。视模型而定。
工具调用官方宣称原生 Function Calling。[S1]常通过各自工具接口提供。实现方式不一。
部署API 与本地权重部署。[S1]通常为 API。常可本地部署。
开放程度开源。[S1]多为闭源。多为开放权重或开源。

8. 信息缺口与后续观察

  • 原生工具调用在不同推理框架中的兼容性需实测。
  • 对视频、长文件和复杂工具链的延迟与成本未在本文比较。
  • 模型许可证和商业部署约束应以权重仓库为准复查。

9. 归纳洞察 ★

GLM-4.6V 反映出多模态模型正在把“看懂内容”和“使用工具”并作一个产品接口。对实际系统而言,后续关键不只是视觉基准,而是工具参数传递、部署成本和长链路稳定性。

10. 来源与更新时间

  • 信息截至(as_of): 2026-07-31
  • 最后复查(last_checked): 2026-07-31
  • 最后更新(last_updated): null
来源索引

可追溯来源

  1. [S1]Tier1Z.ai:GLM-4.6V: Open Source Multimodal Models with Native Tool Use访问日期:2026-07-31
  2. [S2]Tier1Z.ai Developer Docs:GLM-4.6V Overview访问日期:2026-07-31