Younis AI LabAI 应用开发、RAG、Agent 与工程化实践笔记
首页文章时间线项目证据关于简历账户

Tag

Benchmark

共 1 篇文章。

模型部署与推理

本地模型不是下载成功就算部署:Qwen3 8B 的流式推理与任务正确性实测

14 次本地请求全部完成,TTFT P50 为 178.995 ms、输出吞吐 P50 为 14.98 token/s;含糊枚举提示连续失败,收紧字段契约后连续通过。

发布 2026/07/13更新 2026/07/13
  • Qwen3
  • Ollama
  • Inference
  • Benchmark
  • 可复现实验
© 2026 Younis Zhang
项目复用清单LLMs