Younis AI LabAI 应用开发、RAG、Agent 与工程化实践笔记
首页文章时间线项目证据关于简历账户

Tag

推理部署

共 3 篇文章。

模型部署与推理

Llama、Qwen、DeepSeek 开放权重之后:部署经济学不是免 API 账单

开放权重把按 Token 付费的选择权交给企业,也把容量、可靠性、许可和升级责任一并交回;正确比较单位是满足质量与 SLA 的每个成功任务总成本。

发布 2026/07/13更新 2026/07/13
  • 开放权重
  • Llama
  • Qwen
  • DeepSeek
  • 推理部署

AI 工程实践

gpt-oss 首发复盘:80GB 是权重门槛,不是 128K 并发的生产显存答案

gpt-oss 把可商用的 Apache-2.0 权重、稀疏 MoE、原生 MXFP4 与 Harmony 推理协议交给部署者,但 80GB/16GB 只说明一种权重装载入口;生产显存还要支付 KV Cache、并发、工作区、运行时和安全余量,开放权重也不等于完整开源或现成托管服务。

发布 2025/08/07更新 2025/09/11
  • gpt-oss
  • 开放权重
  • 推理部署
  • MoE
  • MXFP4

模型原理与推理

DeepSeek-V3 复盘:MoE、MLA、FP8 与低成本叙事如何验算

DeepSeek-V3 报告 671B 主模型总参数、每 token 约 37B 激活参数,以 MLA、MoE、FP8 和通信优化构成效率路线;但少量激活不消除全量权重、KV、跨卡通信和服务运维,2.788M H800 GPU-hours 也不是全部研发成本。

发布 2024/12/30更新 2025/01/22
  • DeepSeek-V3
  • MoE
  • MLA
  • FP8
  • 推理部署
© 2026 Younis Zhang
项目复用清单LLMs