Younis AI LabAI 应用开发、RAG、Agent 与工程化实践笔记
首页文章时间线项目证据关于简历账户

Tag

强化学习

共 1 篇文章。

模型原理与推理

DeepSeek-R1 的开放推理到底开放了什么:RL、蒸馏与生产成本边界

正式 R1 不是纯 RL,Distill 不是 671B 的量化副本,首发 API 也不等于权重能力;生产选型必须分别核算训练路径、接口契约、许可和任务总成本。

发布 2025/01/22更新 2025/02/10
  • DeepSeek-R1
  • 推理模型
  • 强化学习
  • 模型蒸馏
  • 模型部署
© 2026 Younis Zhang
项目复用清单LLMs