Younis AI LabAI 应用开发、RAG、Agent 与工程化实践笔记
首页文章时间线项目证据关于简历账户

Tag

开放权重

共 7 篇文章。

模型部署与推理

Llama、Qwen、DeepSeek 开放权重之后:部署经济学不是免 API 账单

开放权重把按 Token 付费的选择权交给企业,也把容量、可靠性、许可和升级责任一并交回;正确比较单位是满足质量与 SLA 的每个成功任务总成本。

发布 2026/07/13更新 2026/07/13
  • 开放权重
  • Llama
  • Qwen
  • DeepSeek
  • 推理部署

AI 工程实践

gpt-oss 首发复盘:80GB 是权重门槛,不是 128K 并发的生产显存答案

gpt-oss 把可商用的 Apache-2.0 权重、稀疏 MoE、原生 MXFP4 与 Harmony 推理协议交给部署者,但 80GB/16GB 只说明一种权重装载入口;生产显存还要支付 KV Cache、并发、工作区、运行时和安全余量,开放权重也不等于完整开源或现成托管服务。

发布 2025/08/07更新 2025/09/11
  • gpt-oss
  • 开放权重
  • 推理部署
  • MoE
  • MXFP4

AI 工程实践

Qwen3-Coder 与 Qwen Code 首发复盘:开放权重 Coding Agent 的成本不止显存

Qwen3-Coder 首发把 480B-A35B 开放权重模型、长上下文、执行反馈训练与 Qwen Code CLI 放到同一条 Coding Agent 链路;生产价值仍取决于全量权重驻留、隔离工具、真实仓库评测、人工合并和每个经验证任务的总成本。

发布 2025/07/25更新 2025/08/11
  • Qwen3-Coder
  • Qwen Code
  • Coding Agent
  • 开放权重
  • 自托管

模型原理与推理

Qwen3 的混合思考与 MoE:开放权重之后如何做任务路由

Qwen3 首发的工程价值不只是开放八组权重,而是把 thinking 与 non-thinking 放入同一系列,并提供从 0.6B dense 到 235B MoE 的部署梯度;生产收益取决于任务路由、完整 TCO 和回归评测。

发布 2025/05/02更新 2025/05/23
  • Qwen3
  • 混合推理
  • MoE
  • 开放权重
  • 本地部署

模型部署与推理

Qwen2.5 复盘:从中文开放权重到结构化输出生产验收

Qwen2.5 同期覆盖 0.5B 到 72B 的通用开放权重模型,并强调结构化数据理解和 JSON 输出;真正生产价值要经过语法、Schema、业务规则、幂等写入四道门,同时逐模型核验许可证。

发布 2024/09/21更新 2024/10/21
  • Qwen2.5
  • 中文模型
  • 结构化输出
  • JSON Schema
  • 开放权重

模型部署与推理

Llama 3.1 开放权重之后:405B、蒸馏与私有部署的真实边界

Llama 3.1 同日公开 8B、70B、405B 文本模型,把 128K、多语言与模型输出再利用带入开放权重生态;但许可证、权重存储、推理服务、数据治理和任务评测仍是五道独立上线门。

发布 2024/07/27更新 2024/08/09
  • Llama 3.1
  • 开放权重
  • 私有部署
  • 蒸馏
  • 许可证

模型部署与推理

Llama 3 开放权重之后:本地部署的价值要用完整系统成本证明

Llama 3 首发开放 8B 与 70B 权重,为私有部署提供了现实候选;但开放权重不等于 OSI 开源,128K 是词表大小而非上下文,商业决策还必须计入基础设施与运维。

发布 2024/04/20更新 2024/04/27
  • Llama 3
  • 开放权重
  • 本地部署
  • 模型评测
  • 许可证
© 2026 Younis Zhang
项目复用清单LLMs