Qwen3:统一思考与非思考模式的开放权重模型系列
Qwen3 是 Qwen 团队发布的开放权重模型系列,通过思考与非思考模式切换覆盖推理、通用对话、工具调用和本地部署场景。
Qwen3 foundation-model open-weight-models reasoning-models tool-calling Qwen3 是 Qwen 团队发布的开放权重模型系列,通过思考与非思考模式切换覆盖推理、通用对话、工具调用和本地部署场景。
1. 调研缘由
Qwen 团队于 2025 年 4 月 29 日发布 Qwen3 系列。[S1] 这一代同时提供稠密和混合专家模型,并将逐步推理与快速响应放进同一模型行为框架,适合评估开放权重模型在推理成本、工具使用和私有部署之间的取舍。
2. 模型定位
Qwen3 面向数学、编码、逻辑推理、通用对话、多语言与智能体任务。官方首发包含 Qwen3-235B-A22B、Qwen3-30B-A3B 等 MoE 模型及多个稠密尺寸。[S1] 它不是单一端点,而是一组规模、运行需求和用途不同的权重,选型必须落实到具体模型标识。
3. 双模式机制
Qwen3 的显著设计是混合思考模式:复杂任务可启用逐步推理,简单请求可关闭思考以降低延迟。官方示例通过 enable_thinking 控制默认行为,并支持在多轮提示中使用 /think 与 /no_think 软切换。[S1] 这给路由策略提供了空间,也要求应用明确预算与输出处理规则。
4. 训练与能力基础
官方披露预训练分三阶段:先建立语言和知识基础,再增加 STEM、编码与推理数据,最后用长上下文数据扩展处理能力;后训练则包含长思维链冷启动、推理强化学习、模式融合和通用强化学习。[S1] 这些信息说明双模式来自训练设计,而非仅在界面隐藏推理文本。
5. 部署路径
官方材料给出 Transformers 使用示例,并列出 SGLang、vLLM、本地 Ollama、LM Studio、llama.cpp 等运行路径。[S1] 实施时应先按硬件选择尺寸与量化,再固定 tokenizer、模板、推理解析器和依赖版本。官方 GitHub 记录 Qwen3 系列发布日期,并持续维护运行说明与后续版本信息。[S2]
6. 智能体场景
Qwen3 支持工具调用;Qwen-Agent 官方仓库提供函数调用封装,并列出 MCP、代码解释器和检索等组件。[S3] 适用场景包括代码助手、检索分析、多步任务和本地知识工具。但模型能产生工具调用,不代表调用安全;应用仍需对工具清单、参数、权限、超时和副作用设置独立约束。
7. 主要风险
模型系列名称容易掩盖版本差异:首发权重、后续 2507 更新及不同推理框架的行为可能不一致。思考模式会增加时延与输出长度,关闭后又可能降低复杂任务质量。开放权重便于部署,但团队需要自己承担容量规划、补丁、内容安全、日志保护和许可证核对。
8. 对比与边界
相较只提供托管 API 的闭源模型,Qwen3 提供更大的部署控制和框架选择;相较纯推理模型,其双模式更适合混合负载。代价是工程团队必须自行建立评测与运维能力。官方性能比较可作为线索,不应代替本组织数据、语言和工具链上的盲测。
9. 归纳洞察 ★
建议把请求按难度分层,分别测试思考开启和关闭时的任务成功率、首 token 延迟、总耗时、输出长度、工具调用正确率与硬件占用。再用固定回归集检查升级前后差异。若路由能让简单任务稳定走快速模式、复杂任务才消耗推理预算,Qwen3 的双模式优势才真正兑现。
10. 来源与更新时间
本文聚焦 2025 年 4 月首发 Qwen3 系列,基于 Qwen 官方博客与官方 GitHub 仓库,信息截点为 2026-08-11。仓库包含后续更新,部署时必须按具体模型卡复核上下文、依赖和许可证。