模型原理与推理

Qwen3 的混合思考与 MoE:开放权重之后如何做任务路由

以 2025 年 4 月 29 日至 5 月 1 日的公告、存档与仓库快照为边界,拆分 Qwen3 的 thinking/non-thinking、MoE 与 dense 型号、上下文、部署和 Apache-2.0 商用条件。

发布:2025/05/02更新:2025/05/23
任务路由器按复杂度把请求分配给 Qwen3 非思考模式、思考模式和不同尺寸部署池
图 1:本站依据 Qwen3 2025-05-01 固定公告重绘。图中表达任务路由与资源选择,不代表本站测得性能或成本数据。

时间与证据

本文采用的事件日是 2025 年 4 月 29 日:Qwen 团队发布 Qwen3,并开放两个 Mixture-of-Experts(MoE)模型和六个 dense 模型。同期信息截止日是 5 月 1 日,固定证据包括 Qwen3 公告、5 月 1 日 Internet Archive 快照,以及 4 月 30 日完整 commit 2af51e0e5cca7cc564ea96a358d6199aa7321bbb 的仓库快照。文章发布日期与更新日期见页首。

事件类型是 开放权重发布,不是“完整训练工程开源”。T+2 可以确认模型权重在 Hugging Face、ModelScope、Kaggle 等平台提供,公告声明采用 Apache-2.0,并给出 Transformers、SGLang、vLLM、Ollama、LM Studio、MLX、llama.cpp 与 KTransformers 等使用路径。是否“开源”还涉及训练数据、训练代码和开放定义,本文使用更准确的“开放权重”。

时间边界必须特别防止三类倒灌:Qwen3 技术报告到 5 月 13 日才公开;Qwen3-2507 属于后续版本;1M 上下文也不是首发 T+2 的已交付能力。本文只使用公告快照中能够核对的型号、模式、训练概述、上下文和工具示例。所有横向 Benchmark 与“更强”“节省”等性能措辞均为 Qwen 团队官方报告,不是本站复测。

当时发生了什么

八个型号不是一条部署路线

首发系列包含两个 MoE:Qwen3-235B-A22B 的总参数约 235B、每次前向激活约 22B;Qwen3-30B-A3B 总参数约 30B、激活约 3B。六个 dense 型号为 32B、14B、8B、4B、1.7B 和 0.6B。公告表格还区分上下文:0.6B、1.7B、4B 为 32K,8B、14B、32B 与两个 MoE 为 128K。

A22BA3B 描述每个 Token 参与计算的激活参数,不等于部署时只需容纳 22B 或 3B 权重。MoE 推理仍要处理完整专家权重的存储、分片、路由与通信;量化、KV Cache、并发、框架工作区和副本会继续占用显存。相反,小 dense 模型的单 Token 计算更多地覆盖全部参数,但部署形态更简单。总参数、激活参数、权重驻留和线上吞吐必须分开核算。

这套尺寸梯度提供的是候选空间,不是“越大越好”的购买顺序。0.6B 至 4B 可以探索端侧、分类或窄任务;8B 至 32B 更适合单机或较小集群的通用服务;30B-A3B 尝试用较小激活计算获得更大模型容量;235B-A22B 则要求成熟的多卡服务工程。实际边界取决于精度、量化、序列长度、批处理和硬件,不能只从型号名得出。

Hybrid Thinking 把推理预算变成路由变量

Qwen3 的核心产品设计是同一系列支持两种行为:Thinking Mode 生成更长的逐步推理,用于数学、代码和复杂逻辑;Non-Thinking Mode 追求更快响应,用于简单查询。首发示例通过 chat template 的 enable_thinking 控制,默认值为 True;在启用 thinking 的多轮场景中,还可以用 /think/no_think 软切换,并以最近指令决定当前模式。

工程价值不在于把所有请求都打开 thinking,而在于能够把 任务难度、正确率收益与推理预算联系起来。若简单格式转换也生成数万 Token 的思考,模型单价再低也会增加队列、延迟和失败概率;若复杂诊断被强制直答,可能省下 Token 却增加错误和人工返工。

软提示不是权限或计费控制。用户输入可以包含 /think/no_think,多轮消息还可能改变最近指令,因此生产系统不能把预算控制完全交给自然语言。应用层应决定模式、限制最大输出、记录路由理由,并在不允许用户覆盖时过滤或隔离控制标记。

四阶段 post-training 解释了“两种模式如何共存”

首发公告描述四阶段后训练:先用数学、代码、逻辑和 STEM 的 long CoT 数据做 cold start;再以规则奖励扩大 reasoning RL;第三阶段把 long CoT 与通用 instruction data 融合,形成 thinking 与 non-thinking 的统一模型;最后在二十多个通用任务上做 RL,强化指令、格式和 Agent 能力。

这段信息说明混合模式不是在两个独立 checkpoint 之间简单切换,而是通过训练与模板让一个模型表达两种预算行为。但公告没有开放足以完整复刻这条训练链的全部数据与执行细节,因此外部能下载权重、验证推理和做领域适配,不能声称凭 T+2 仓库完整重训 Qwen3。

公告还报告预训练数据约 36T Token、覆盖 119 种语言和方言,并描述三阶段预训练。数字与能力均应按 vendor-reported 处理。语言列表不等于每种语言在企业术语、方言客服和法规文本上达到相同质量,仍需分语言评测。

Agent 支持仍然依赖外部执行系统

Qwen3 公告展示 Qwen-Agent、工具调用与 MCP 配置,并给出 OpenAI-compatible endpoint 的部署方式。这证明首发提供了工具接入路径,却不表示模型自己拥有权限、沙箱或审计。工具 schema、调用解析、重试、资源身份、租户隔离和人工审批仍由 Qwen-Agent、MCP server 与业务系统承担。

同样,公告推荐的 SGLang 与 vLLM 版本及 reasoning-parser 参数是当时的集成要求。生产镜像必须固定模型 revision、tokenizer、chat template、推理框架和 parser;任一环节变化都可能改变 <think> 分离、结构化输出或工具调用行为。

任务判断

假设一家跨境电商要在内网建设“多语言售后工单助手”。输入包含订单状态、商品文档、客户消息和政策;系统需要分类、检索证据、生成建议回复,并在退款或赔付时交给人工审批。数据不能默认发往外部 API,日常工单量大,少量争议工单需要更深推理。

Qwen3 的合理方案不是选一个最大模型覆盖全部流量,而是三段路由:

路由 典型任务 候选模式 验收重点
快速路径 语言识别、意图分类、模板补全 较小 dense,non-thinking P95、格式有效率、单位吞吐
标准路径 有检索证据的政策问答与回复 8B-32B 或 30B-A3B,默认短预算 引用正确、拒答、语言质量
深度路径 多政策冲突、异常订单、升级建议 thinking,并设置硬预算 决策正确率、推理成本、人工接管

评测集应按语言、任务风险和输入长度分层。每条样本保存允许使用的证据、期望动作、禁止动作和是否必须人工确认。关键指标不是通用榜单,而是证据引用正确率、政策违规率、结构化字段有效率、P50/P95、每工单 Token、GPU 小时、重试率、人工接管率,以及 每个正确关闭工单的总成本

型号比较必须在相同 tokenizer、模板、量化精度、并发、上下文和输出预算下进行。MoE 的低激活参数可能改善计算效率,但如果权重无法合理分片、通信成为瓶颈或业务并发很低,实际 TCO 未必优于较小 dense。该实验尚未执行,因此本文只给出测试设计,不给出虚构吞吐数字。

工程影响

路由器应使用可观测信号,而不是让模型自报难度

路由输入可以包括任务类型、风险级别、检索证据数量、语言、上下文长度、历史失败和用户 SLA。规则先确定允许的最大模型与工具集合,再由小型分类器或模型预测难度。深度路径输出仍需 schema、政策规则和人工门禁,不能因为使用 thinking 就放宽验证。

系统要记录 requested_modeeffective_mode、模型 revision、chat template hash、最大输出、实际 Token 和路由理由。这样才能回答某类工单为什么突然变慢,或者一次模型升级是否让更多请求进入 thinking。仅记录最终文本无法分析成本。

开放权重把供应商账单换成基础设施责任

自托管需要模型文件校验、镜像固定、GPU 调度、批处理、KV Cache、超时、熔断、负载均衡和容量预测。MoE 还增加专家权重布局与跨卡通信问题。上线前应测冷启动、长上下文峰值、并发下尾延迟、单卡故障和滚动升级,而不是只测一条命令能否生成答案。

权重可获取也不意味着每个框架输出完全一致。不同 reasoning parser 可能把思考区段放在 reasoning_content 或普通 content;chat template 处理 /think 的方式也会改变。API 网关应统一外部响应,并把模型原始输出保存在受控审计层,避免业务代码依赖某个框架的临时字段。

许可证只是准入项,不是完整商用审查

首发公告声明八组模型采用 Apache-2.0,这为商业使用、修改和分发提供了清晰基础,但企业仍需保留许可证与 NOTICE、记录权重来源、检查第三方依赖和模型卡限制。若在模型上继续微调或分发量化版本,还要维护衍生版本、数据来源与安全评测。

模型许可不覆盖业务数据是否可训练、用户隐私、行业监管和输出责任。自托管减少数据出域,并不会自动完成合规。

全栈能力如何迁移

后端的 API 网关变成模型路由与预算控制;数据库的审计表变成 Prompt、模型、工具和证据血缘;前端需要展示引用、执行状态与人工接管;测试从确定性断言扩展为固定数据集上的统计回归;容器与运维能力进入模型服务、GPU 容量和滚动回退。

真正新增的 AI 工程工作,是把非确定性结果转成可发布门禁:固定评测样本、定义误差成本、按版本保存输出、分析失败簇,并确保模型或模板改变时可以重复比较。

商业价值

Qwen3 最适合的付费方不是“想拥有一个大模型”的组织,而是有数据边界、多语言需求、稳定高流量且愿意运营推理基础设施的企业。它增强的是客服、知识检索、代码辅助和文档处理等既有流程;开放权重允许围绕私有数据部署和版本控制,混合模式则提供按任务管理推理预算的可能。

收益成立需要三个条件:私有化或本地延迟带来的价值大于 GPU 与运维成本;真实任务上中小模型已经达到可接受质量;路由能让少量高风险请求使用更深推理,而不是全量进入昂贵路径。可量化的结果包括人工处理时间、一次解决率、违规动作减少量、单位吞吐与每个正确任务成本。

成本由硬件折旧或租赁、功耗、模型副本、工程人员、数据标注、评测、升级回归和人工复核共同组成。MoE 的 activated parameters 只能解释部分计算,不是报价单。低流量团队可能更适合托管 API;没有数据出域限制、也没有模型运维能力的团队,不应为了“开放权重”自建集群。

90 天 MVP 可以从一个语言和一类低风险工单开始:第一个月建立评测与只读检索;第二个月比较三个候选尺寸与两种模式;第三个月 shadow 运行并测人工接管。若正确率收益不显著、GPU 利用率过低或回归维护成本超过节省的人力,就应停止扩容或改用托管服务。

长期壁垒来自带审批结果的多语言任务数据、政策知识图谱、路由规则和持续评测,不来自公开权重本身。其他团队可以下载同一 checkpoint,却不能复制企业积累的失败样本与业务反馈。

局限与风险

第一,本文只复原 T+2。5 月 13 日技术报告、Qwen3-2507、后续上下文和工具能力均不进入首发判断。

第二,公告中的 Benchmark、训练规模、语言覆盖和成本比较都是 Qwen 团队报告。没有相同 runner、量化、硬件和任务数据,不能转写成本站独立结论。

第三,MoE 的低激活参数可能被误读为低显存。生产容量必须测完整权重、KV Cache、并发与通信,不得按 A3B 直接采购普通 3B 模型级别的资源。

第四,thinking 内容不是可信审计证据,也可能泄露不应展示的上下文。应用应以工具结果、引用、规则和审批作为证据,并明确哪些中间内容可以留存。

第五,Prompt 软开关可能被用户消息或检索内容干扰。预算与权限必须由代码控制,模型文本只作为建议。

第六,开放权重扩大供应链责任。模型文件、量化版本、远程代码、容器和推理框架都要固定哈希、扫描并支持回滚。

面试表达

30 秒结论: Qwen3 首发开放两个 MoE 与六个 dense 模型,并把 thinking/non-thinking 放在同一系列。我的核心判断不是“30B-A3B 等于部署 3B”,而是把模式和型号都变成任务路由变量,用真实正确率、尾延迟、GPU 利用与每个正确任务成本选型。

3 分钟架构: 请求先经过数据授权和任务分类,规则限定可用模型、最大预算与工具;低风险走 non-thinking,中高风险按评测收益进入 thinking。模型服务固定 checkpoint、tokenizer、template、parser 和量化版本,输出经过 schema、证据校验与人工门禁。观测层记录路由理由、实际模式、Token、P95、重试和任务结果。MoE 与 dense 在相同硬件和任务集上压测,TCO 包含权重驻留、KV、通信、副本和运维。

追问“为什么不直接上最大的 235B-A22B”时,回答应回到业务:更大总容量是否在目标任务上提高可验证正确率,提升是否足以覆盖多卡通信和可靠性成本。没有这两项证据,参数量不是架构决策。

复盘

站在 2026 年回看,Qwen3 T+2 最重要的信号是推理模型开始从“单一慢速强模型”走向 可切换的计算预算 + 可部署的尺寸梯度。这让应用架构有机会在同一模型家族内建立快慢路径,也让路由、评测和成本治理成为一等能力。

当时最容易高估的是“开放权重会自动降低成本”。更准确的结论是:它让企业有权选择成本结构,却把服务可靠性与供应链责任转移给企业。下一次看到 MoE 与混合推理发布,我会优先记录总参数、激活参数、上下文、模板开关、框架版本、许可证和实际可下载对象,再决定是否进入部署实验。

方法披露

本文由 AI 辅助整理公告结构、形成评测清单并生成原创 SVG 草图;日期、固定 commit、型号、上下文、模式、许可和官方表述由作者对照 T+2 来源复核。本文未下载或压测 Qwen3 权重,所有性能与训练结论均标为官方报告,部署部分仅为可执行实验方案。

修订记录

  • 2025-05-02:初版发布;限定 2025-04-29 至 2025-05-01 信息窗口,拆分模式、模型与部署成本。

Source ledger

来源账本

以下来源用于核对事实、日期与当时可用范围。厂商自报性能不视为本站独立复现。

  1. Qwen3: Think Deeper, Act Faster
    Qwen Team官方一手来源同期证据来源发布:2025/04/29本站核验:2025/05/23
  2. Qwen3 announcement T+2 snapshot
    Qwen Team (Internet Archive)历史页面存档同期证据来源发布:2025/05/01本站核验:2025/05/23
  3. Qwen3 T+1 repository snapshot
    Qwen Team官方仓库同期证据来源发布:2025/04/30本站核验:2025/05/23

讨论

正在加载评论...