模型原理与推理
DeepSeek-V3 复盘:MoE、MLA、FP8 与低成本叙事如何验算
DeepSeek-V3 报告 671B 主模型总参数、每 token 约 37B 激活参数,以 MLA、MoE、FP8 和通信优化构成效率路线;但少量激活不消除全量权重、KV、跨卡通信和服务运维,2.788M H800 GPU-hours 也不是全部研发成本。
Tag
共 2 篇文章。
模型原理与推理
DeepSeek-V3 报告 671B 主模型总参数、每 token 约 37B 激活参数,以 MLA、MoE、FP8 和通信优化构成效率路线;但少量激活不消除全量权重、KV、跨卡通信和服务运维,2.788M H800 GPU-hours 也不是全部研发成本。
模型原理与推理
DeepSeek-V2 把 KV Cache 和激活参数直接带入产品成本讨论;MLA 与 MoE 是值得验证的架构信号,但论文节省不能未经同栈压测就写成业务账单节省。