模型部署与推理
本地模型不是下载成功就算部署:Qwen3 8B 的流式推理与任务正确性实测
14 次本地请求全部完成,TTFT P50 为 178.995 ms、输出吞吐 P50 为 14.98 token/s;含糊枚举提示连续失败,收紧字段契约后连续通过。
Tag
共 2 篇文章。
模型部署与推理
14 次本地请求全部完成,TTFT P50 为 178.995 ms、输出吞吐 P50 为 14.98 token/s;含糊枚举提示连续失败,收紧字段契约后连续通过。
模型部署与推理
本地部署不是单纯把模型跑起来,而是在成本、速度、质量和维护复杂度之间找平衡。