Younis AI LabAI 应用开发、RAG、Agent 与工程化实践笔记
首页文章时间线项目证据关于简历账户

Category

模型原理与推理

共 7 篇文章。

模型原理与推理

Qwen3 的混合思考与 MoE:开放权重之后如何做任务路由

Qwen3 首发的工程价值不只是开放八组权重,而是把 thinking 与 non-thinking 放入同一系列,并提供从 0.6B dense 到 235B MoE 的部署梯度;生产收益取决于任务路由、完整 TCO 和回归评测。

发布 2025/05/02更新 2025/05/23
  • Qwen3
  • 混合推理
  • MoE
  • 开放权重
  • 本地部署

模型原理与推理

OpenAI o3 与 o4-mini 首发复盘:工具化推理不能替代业务控制面

o3 与 o4-mini 首发把推理、视觉输入和工具选择连成任务循环;生产价值仍取决于外置身份与权限、幂等执行、结果验证、完整轨迹评测和每个合格任务的成本。

发布 2025/04/19更新 2025/05/16
  • OpenAI o3
  • o4-mini
  • 工具化推理
  • 多模态
  • Agent

模型原理与推理

DeepSeek-R1 的开放推理到底开放了什么:RL、蒸馏与生产成本边界

正式 R1 不是纯 RL,Distill 不是 671B 的量化副本,首发 API 也不等于权重能力;生产选型必须分别核算训练路径、接口契约、许可和任务总成本。

发布 2025/01/22更新 2025/02/10
  • DeepSeek-R1
  • 推理模型
  • 强化学习
  • 模型蒸馏
  • 模型部署

模型原理与推理

DeepSeek-V3 复盘:MoE、MLA、FP8 与低成本叙事如何验算

DeepSeek-V3 报告 671B 主模型总参数、每 token 约 37B 激活参数,以 MLA、MoE、FP8 和通信优化构成效率路线;但少量激活不消除全量权重、KV、跨卡通信和服务运维,2.788M H800 GPU-hours 也不是全部研发成本。

发布 2024/12/30更新 2025/01/22
  • DeepSeek-V3
  • MoE
  • MLA
  • FP8
  • 推理部署

模型原理与推理

o1-preview 首发复盘:推理时计算、接口缺口与任务路由

o1-preview 把更长的模型内推理过程带入产品,但首发 API 仅向 Tier 5 开放、限 20 RPM,且缺少 function calling、streaming 与 system message;正确工程动作是按难度路由并用外部验证器衡量收益。

发布 2024/09/14更新 2024/10/02
  • OpenAI o1
  • 推理模型
  • 推理时计算
  • 模型路由
  • 评测归因

模型原理与推理

DeepSeek-V2 为什么重要:MLA 与 MoE 如何进入推理单位经济性

DeepSeek-V2 把 KV Cache 和激活参数直接带入产品成本讨论;MLA 与 MoE 是值得验证的架构信号,但论文节省不能未经同栈压测就写成业务账单节省。

发布 2024/05/09更新 2024/06/07
  • DeepSeek-V2
  • MLA
  • MoE
  • 推理成本
  • 模型部署

模型原理与推理

Gemini 1.5 Pro 的 1M 上下文意味着什么:长上下文没有自动终结 RAG

1M token 实验窗口证明长上下文成为新的系统变量,却没有证明整库直塞比检索更准、更便宜;选型必须比较完整任务的召回、干扰、延迟和缓存复用。

发布 2024/02/17更新 2024/03/22
  • Gemini
  • 长上下文
  • RAG
  • MoE
  • 评测
© 2026 Younis Zhang
项目复用清单LLMs