模型部署与推理
Llama、Qwen、DeepSeek 开放权重之后:部署经济学不是免 API 账单
从 Llama 3、Qwen2/Qwen3、DeepSeek-V2/V3/R1 的固定发布证据出发,建立开放权重选型的模型、硬件、服务、许可、评测与组织成本框架。
时间语境与证据
本文不是单一事件的历史 T+2,而是 2026 年 7 月 13 日基于多个固定发布切片做的部署综合。时间轴从 2024 年 4 月的 Llama 3、5 月的 DeepSeek-V2、6 月的 Qwen2,经过 12 月的 DeepSeek-V3 与 2025 年 1 月的 R1,到 4 月的 Qwen3。每个事件的当时可用范围应回到独立时间线;本文不把后续能力倒填给早期型号。
这条时间线展示了三种变化:可部署尺寸越来越丰富;MoE、MLA、FP8 和蒸馏把成本讨论带到架构层;推理模式与 Agent 能力又把输出长度和工具轨迹带进线上 TCO。与此同时,许可证并未统一,权重可下载的含义也不等于 OSI 定义的开源。
来源使用完整 Git commit、固定仓库树、arXiv v1 与 Internet Archive 快照。论文和厂商公告中的性能、训练开销与效率结论均为官方报告。本文没有把这些模型放在相同硬件和任务集上压测,因此只建立决策框架,不给出“某模型每秒多少 Token”的虚构排名。
核心判断:开放的是选择权,也是责任
托管 API 把模型服务封装成输入、输出、价格、限额与 SLA;开放权重让企业获得版本控制、数据边界、部署位置、量化和微调选择。账单不再只表现为每百万 Token,但 GPU、网络、电力、容量、工程和故障成本并没有消失,只是从供应商账单转移到内部系统。
所以“下载免费”等于“推理便宜”是错误等式。正确比较是:在满足质量、隐私和 SLA 的前提下,每个成功任务需要多少 全年化总成本。同一模型在一台闲置 GPU 上跑通 demo,与在高峰期持续提供多租户服务,是两种经济对象。
可以用下面的框架计算:
单位成功任务 TCO
= (GPU/CPU/存储/网络 + 平台软件 + 运维人力 + 评测与升级
+ 数据治理 + 失败重试 + 人工复核 + 容灾冗余)
/ 满足质量与 SLA 的成功任务数
分母尤其重要。一个低价模型若产生更多错误、重试和人工接管,单位正确任务可能更贵;一个高价模型若通过率更高,也不一定值得覆盖所有简单请求。模型路由是部署经济学的一部分。
三个系列带来的不同信号
Llama:开放权重成为企业候选路线
Llama 3 首发提供 8B 与 70B Base/Instruct,固定模型卡可确认首发模型采用 8K 上下文。词表规模与上下文窗口是不同参数;本文现有固定来源不量化词表数值,也不从二手参数表把具体数字补写进模型卡。这个边界说明选型必须回到固定版本证据,而不是只看传播标题。8B 与 70B 也建立了本地小型路线和较高能力路线的直观梯度。
Llama 使用自己的 Community License,而不是把“开放权重”统一等同于 Apache 或 MIT。企业需要检查适用版本的许可、AUP、NOTICE、品牌与分发条件;不能因为文件能下载,就把法律审查从清单中删除。
Qwen:尺寸、语言与许可证进入产品矩阵
Qwen2 扩大 dense 与 MoE 尺寸、多语言和长上下文选择,同时不同尺寸在当时存在许可证差异。Qwen3 又把两个 MoE 与六个 dense 型号统一放到 Apache-2.0,并加入 thinking/non-thinking。到这一步,部署决策从“选一个聊天模型”变成“选尺寸、架构、上下文、模式与框架的组合”。
Qwen3-30B-A3B 的 A3B 表示激活参数,不是只需容纳 3B 权重;Qwen3 小型号的上下文也不完全相同。生产容量必须读取具体 config、精度和框架,不能用系列宣传覆盖每个 checkpoint。
DeepSeek:模型架构直接进入单位经济性
DeepSeek-V2 官方报告用 DeepSeekMoE 与 Multi-head Latent Attention(MLA)讨论激活参数和 KV Cache;V3 又加入 FP8 训练和 Multi-Token Prediction,公开 2.788M H800 GPU-hours 的完整训练开销口径。该 GPU-hour 数字不包含全部前期研究与消融,更不是 R1 的训练成本。
R1 随后同时提供完整 MoE、蒸馏模型与 API。完整 R1 总参数 671B、每 Token 激活约 37B;六个蒸馏模型则基于 Qwen/Llama 的较小 dense 架构。37B activated 不等于部署普通 37B,Distill 也不是把 671B 文件简单压缩。模型对象不分清,硬件预算会从第一步就错。
这些架构确实可能降低单 Token 计算或缓存,但线上成本仍由权重驻留、专家分片、通信、KV、输出长度和并发共同决定。论文效率只能形成假设,必须在目标硬件与流量上验证。
TCO 的五层账本
第一层:业务质量
先定义任务成功,而不是先租 GPU。客服需要政策正确与低违规,代码需要测试通过,RAG 需要引用正确,抽取需要 schema 与字段准确。固定任务集、输入版本、提示、工具和裁判,比较模型在可接受错误率下的完成率。
如果 8B 已满足任务,就没有必要为 70B 或更大模型承担容量;如果小模型在高风险任务频繁漏错,量化节省也可能被人工成本吃掉。质量决定分母。
第二层:模型内存与计算
权重内存的理想估算只是参数量乘位宽,实际还要加量化 scale、KV Cache、激活、框架工作区与碎片。上下文越长、并发越高,KV 越可能成为主要变量。MoE 降低每 Token 激活计算,但专家权重的存储与跨设备路由仍在。
容量规划必须分别测 prefill 与 decode。长文档首先产生重 prefill;长推理又拉长 decode 和占槽时间。只报告单用户短 Prompt 的 Token/s,不能预测生产吞吐。
第三层:服务可靠性
生产至少需要模型副本、健康检查、负载均衡、排队、超时、限流、熔断、模型加载、滚动升级和故障回退。大模型启动慢,错误升级可能导致长时间容量下降;多机 MoE 还要处理节点与网络故障。
目标不是 GPU 平均利用率最高,而是在峰值与故障下仍满足 SLO。为了冗余预留的空闲容量也属于成本。低流量团队常因利用率太低,无法摊薄固定投入。
第四层:许可与供应链
每个 checkpoint 建立物料清单:来源 URL、revision、文件哈希、模型卡、许可证、基础模型、量化工具、容器和远程代码。不同系列、尺寸与衍生模型可能适用不同条件,不能用仓库顶层许可证概括全部权重。
安全上还要扫描镜像、限制远程代码、验证权重和 tokenizer、隔离模型服务、保护 Prompt 与日志。开放权重减少单一 API 依赖,却扩大内部供应链面积。
第五层:组织运维
模型更新不是普通包升级。新 revision 可能改变质量、模板、拒答、工具解析和 Token 分布;每次上线都要回归、灰度和可回退。维护评测集、标注失败和分析 drift 的人力属于长期成本,而不是一次部署项目。
如果组织没有 GPU 平台、24 小时值守或模型评测能力,托管 API 的溢价可能买回了更低的组织复杂度。Build、Buy、Open Weight 不是意识形态选择,而是能力与规模匹配。
一个 90 天部署验证
假设一家法律科技公司需要在区域内处理合同条款抽取与风险解释,数据不能默认出域。验证可以分四步:
- 第 1-2 周:任务基线。 选 500 份脱敏合同,标注字段、引用与风险等级;定义允许错误、拒答和人工门禁。
- 第 3-5 周:模型筛选。 选择一个小 dense、一个中型 dense、一个 MoE 与一个托管 API,在相同输入与 schema 下比较质量和输出长度。
- 第 6-9 周:系统压测。 固定量化和服务框架,测短/长合同、并发、故障、冷启动、P95 与成本;同时完成许可和供应链清单。
- 第 10-13 周:shadow。 不改变真实业务状态,与人工结果对比,统计接管、误报、漏报和每个正确任务 TCO。
路由可以让简单抽取走小模型,复杂冲突条款走更强模型,无法引用证据的结果直接转人工。是否自托管由数据边界、稳定流量和正确任务成本共同决定。本文未运行该实验,所有步骤都是可复现计划。
商业判断
开放权重最有价值的买方通常具备三项中的至少两项:严格数据驻留、稳定且足够大的推理量、需要深度定制或离线能力。它替代的是外部模型调用与部分通用平台能力,同时增强对版本、延迟和数据的控制。
商业收益可能来自减少外部 Token 账单、提高 GPU 利用率、避免数据出域、在窄任务上用小模型达到目标,以及通过量化或批处理优化成本。成立条件是团队能持续维护服务与评测;失效条件是流量波动大、模型升级频繁、内部正确率不达标或运维人力超过 API 溢价。
不应采用自托管的场景包括:每月调用很少、没有模型平台团队、任务快速变化且依赖最新前沿能力、无法承担容灾,或许可与数据来源无法审清。混合架构往往更现实:敏感稳定任务用开放权重,低频高难任务经策略路由到托管模型,并保留相同评测与审计。
长期护城河是企业的任务数据、路由、服务优化与反馈,不是某个可公开下载的模型。权重可以被所有人获得,单位成功成本的持续优化不能被一次下载复制。
局限与风险
第一,本文跨多个发布切片,不能把 Qwen3、R1 或 V3 的能力归给更早型号,也不能用 2026 当前仓库替代固定版本。
第二,没有跨模型实测数据。任何吞吐、显存和成本数字都应在明确硬件、精度、框架、上下文和并发下生成,本文不编造。
第三,厂商训练效率不等于企业推理 TCO。GPU-hours、activated parameters 与模型价格分别描述不同对象。
第四,开放权重不等于无许可限制、无安全风险或完整开源。企业需按具体 checkpoint 与衍生链审查。
第五,过度量化可能降低关键任务质量;过长上下文和推理可能把省下的单价换成长尾延迟。优化必须回到单位成功任务。
第六,自托管集中基础设施风险。容量不足、GPU 故障、供应链污染和错误升级都由企业承担,必须预留回退方案。
面试表达
30 秒结论: 开放权重不是免费推理,而是把版本、部署和数据选择权连同容量、可靠性、许可与升级责任交回企业。我用满足质量和 SLA 的每个成功任务 TCO 比较 Llama、Qwen、DeepSeek 与托管 API,不用参数量或单 Token 价格做唯一决策。
3 分钟架构: 先用固定业务集确定质量分母,再在同一硬件与框架测权重、KV、prefill、decode、并发与故障;建立 checkpoint BOM 和许可审查;通过网关按任务路由小模型、MoE 与外部 API。服务有版本、灰度、回退与全轨迹成本,最终看正确率、P95、接管和全年化 TCO。
方法披露
本文由 AI 辅助归纳成本层次和生成原创 SVG 草图;事件顺序、模型对象、完整 commit、论文版本、许可证边界和最终判断由作者对照固定来源复核。未执行的压测与财务估算均明确写作验证方案,没有把官方效率报告标成本站生产数据。
修订记录
2026-07-13:初版发布;建立开放权重的五层 TCO 账本与 90 天验证路径。
Reusable projects
关联可复用项目
本文已经进入以下工程项目;项目页提供固定版本、运行命令和结果工件。
- 设计依据已独立复现
本地推理容量规划工具
本文要求按满足质量与 SLA 的成功任务总成本选型,本项目先提供单机延迟、吞吐和正确性基线。
Source ledger
来源账本
以下来源用于核对事实、日期与当时可用范围。厂商自报性能不视为本站独立复现。
- Meta Llama 3 T+2 model card snapshot
- DeepSeek-V2 release-day initial repository snapshot
- DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
- Qwen2 announcement T+2 snapshot
- DeepSeek-V3 T+2 repository snapshot
- DeepSeek-V3 Technical Report
- DeepSeek-R1 release commit
- Qwen3 announcement T+2 snapshot
- Qwen3 T+1 repository snapshot
讨论