模型部署与推理vLLM v0.6.0 复盘:吞吐提升之后,推理服务仍要按 SLO 验收v0.6.0 证明 CPU 调度也可能让 GPU 空等;但厂商吞吐提升不能直接换算成生产容量,服务仍需按工作负载分别验收 TTFT、TPOT、队列、拒绝与单位合格请求成本。发布 2024/09/08更新 2024/09/27vLLM推理服务Continuous BatchingSLOGPU