模型部署与推理本地模型不是下载成功就算部署:Qwen3 8B 的流式推理与任务正确性实测14 次本地请求全部完成,TTFT P50 为 178.995 ms、输出吞吐 P50 为 14.98 token/s;含糊枚举提示连续失败,收紧字段契约后连续通过。发布 2026/07/13更新 2026/07/13Qwen3OllamaInferenceBenchmark可复现实验