Younis AI LabAI 应用开发、RAG、Agent 与工程化实践笔记
首页文章时间线项目证据关于简历账户

Category

模型部署与推理

共 8 篇文章。

模型部署与推理

Llama、Qwen、DeepSeek 开放权重之后:部署经济学不是免 API 账单

开放权重把按 Token 付费的选择权交给企业,也把容量、可靠性、许可和升级责任一并交回;正确比较单位是满足质量与 SLA 的每个成功任务总成本。

发布 2026/07/13更新 2026/07/13
  • 开放权重
  • Llama
  • Qwen
  • DeepSeek
  • 推理部署

模型部署与推理

本地模型不是下载成功就算部署:Qwen3 8B 的流式推理与任务正确性实测

14 次本地请求全部完成,TTFT P50 为 178.995 ms、输出吞吐 P50 为 14.98 token/s;含糊枚举提示连续失败,收紧字段契约后连续通过。

发布 2026/07/13更新 2026/07/13
  • Qwen3
  • Ollama
  • Inference
  • Benchmark
  • 可复现实验

模型部署与推理

本地大模型部署的取舍记录

本地部署不是单纯把模型跑起来,而是在成本、速度、质量和维护复杂度之间找平衡。

发布 2026/06/27更新 2026/07/01
  • AI
  • LLM
  • Inference
  • Deployment

模型部署与推理

Qwen2.5 复盘:从中文开放权重到结构化输出生产验收

Qwen2.5 同期覆盖 0.5B 到 72B 的通用开放权重模型,并强调结构化数据理解和 JSON 输出;真正生产价值要经过语法、Schema、业务规则、幂等写入四道门,同时逐模型核验许可证。

发布 2024/09/21更新 2024/10/21
  • Qwen2.5
  • 中文模型
  • 结构化输出
  • JSON Schema
  • 开放权重

模型部署与推理

vLLM v0.6.0 复盘:吞吐提升之后,推理服务仍要按 SLO 验收

v0.6.0 证明 CPU 调度也可能让 GPU 空等;但厂商吞吐提升不能直接换算成生产容量,服务仍需按工作负载分别验收 TTFT、TPOT、队列、拒绝与单位合格请求成本。

发布 2024/09/08更新 2024/09/27
  • vLLM
  • 推理服务
  • Continuous Batching
  • SLO
  • GPU

模型部署与推理

Llama 3.1 开放权重之后:405B、蒸馏与私有部署的真实边界

Llama 3.1 同日公开 8B、70B、405B 文本模型,把 128K、多语言与模型输出再利用带入开放权重生态;但许可证、权重存储、推理服务、数据治理和任务评测仍是五道独立上线门。

发布 2024/07/27更新 2024/08/09
  • Llama 3.1
  • 开放权重
  • 私有部署
  • 蒸馏
  • 许可证

模型部署与推理

Qwen2 发布后的中文模型选型:上下文、许可证与语言质量要一起验收

Qwen2 把多尺寸中文与多语言开放权重带入选型,但 128K 宣称不等于每个模型默认原生支持,系列内许可证也不同;部署必须固定型号、配置和权利边界。

发布 2024/06/10更新 2024/06/21
  • Qwen2
  • 中文模型
  • 长上下文
  • 许可证
  • 部署评测

模型部署与推理

Llama 3 开放权重之后:本地部署的价值要用完整系统成本证明

Llama 3 首发开放 8B 与 70B 权重,为私有部署提供了现实候选;但开放权重不等于 OSI 开源,128K 是词表大小而非上下文,商业决策还必须计入基础设施与运维。

发布 2024/04/20更新 2024/04/27
  • Llama 3
  • 开放权重
  • 本地部署
  • 模型评测
  • 许可证
© 2026 Younis Zhang
项目复用清单LLMs