Younis AI LabAI 应用开发、RAG、Agent 与工程化实践笔记
首页文章时间线项目证据关于简历账户

Tag

MLA

共 2 篇文章。

模型原理与推理

DeepSeek-V3 复盘:MoE、MLA、FP8 与低成本叙事如何验算

DeepSeek-V3 报告 671B 主模型总参数、每 token 约 37B 激活参数,以 MLA、MoE、FP8 和通信优化构成效率路线;但少量激活不消除全量权重、KV、跨卡通信和服务运维,2.788M H800 GPU-hours 也不是全部研发成本。

发布 2024/12/30更新 2025/01/22
  • DeepSeek-V3
  • MoE
  • MLA
  • FP8
  • 推理部署

模型原理与推理

DeepSeek-V2 为什么重要:MLA 与 MoE 如何进入推理单位经济性

DeepSeek-V2 把 KV Cache 和激活参数直接带入产品成本讨论;MLA 与 MoE 是值得验证的架构信号,但论文节省不能未经同栈压测就写成业务账单节省。

发布 2024/05/09更新 2024/06/07
  • DeepSeek-V2
  • MLA
  • MoE
  • 推理成本
  • 模型部署
© 2026 Younis Zhang
项目复用清单LLMs