模型原理与推理
Qwen3 的混合思考与 MoE:开放权重之后如何做任务路由
Qwen3 首发的工程价值不只是开放八组权重,而是把 thinking 与 non-thinking 放入同一系列,并提供从 0.6B dense 到 235B MoE 的部署梯度;生产收益取决于任务路由、完整 TCO 和回归评测。
Category
共 7 篇文章。
模型原理与推理
Qwen3 首发的工程价值不只是开放八组权重,而是把 thinking 与 non-thinking 放入同一系列,并提供从 0.6B dense 到 235B MoE 的部署梯度;生产收益取决于任务路由、完整 TCO 和回归评测。
模型原理与推理
o3 与 o4-mini 首发把推理、视觉输入和工具选择连成任务循环;生产价值仍取决于外置身份与权限、幂等执行、结果验证、完整轨迹评测和每个合格任务的成本。
模型原理与推理
正式 R1 不是纯 RL,Distill 不是 671B 的量化副本,首发 API 也不等于权重能力;生产选型必须分别核算训练路径、接口契约、许可和任务总成本。
模型原理与推理
DeepSeek-V3 报告 671B 主模型总参数、每 token 约 37B 激活参数,以 MLA、MoE、FP8 和通信优化构成效率路线;但少量激活不消除全量权重、KV、跨卡通信和服务运维,2.788M H800 GPU-hours 也不是全部研发成本。
模型原理与推理
o1-preview 把更长的模型内推理过程带入产品,但首发 API 仅向 Tier 5 开放、限 20 RPM,且缺少 function calling、streaming 与 system message;正确工程动作是按难度路由并用外部验证器衡量收益。
模型原理与推理
DeepSeek-V2 把 KV Cache 和激活参数直接带入产品成本讨论;MLA 与 MoE 是值得验证的架构信号,但论文节省不能未经同栈压测就写成业务账单节省。
模型原理与推理
1M token 实验窗口证明长上下文成为新的系统变量,却没有证明整库直塞比检索更准、更便宜;选型必须比较完整任务的召回、干扰、延迟和缓存复用。