Younis AI LabAI 应用开发、RAG、Agent 与工程化实践笔记
首页文章时间线项目证据关于简历账户

Tag

Continuous Batching

共 1 篇文章。

模型部署与推理

vLLM v0.6.0 复盘:吞吐提升之后,推理服务仍要按 SLO 验收

v0.6.0 证明 CPU 调度也可能让 GPU 空等;但厂商吞吐提升不能直接换算成生产容量,服务仍需按工作负载分别验收 TTFT、TPOT、队列、拒绝与单位合格请求成本。

发布 2024/09/08更新 2024/09/27
  • vLLM
  • 推理服务
  • Continuous Batching
  • SLO
  • GPU
© 2026 Younis Zhang
项目复用清单LLMs