Younis AI LabAI 应用开发、RAG、Agent 与工程化实践笔记
首页文章时间线项目证据关于简历账户

Tag

Inference

共 2 篇文章。

模型部署与推理

本地模型不是下载成功就算部署:Qwen3 8B 的流式推理与任务正确性实测

14 次本地请求全部完成,TTFT P50 为 178.995 ms、输出吞吐 P50 为 14.98 token/s;含糊枚举提示连续失败,收紧字段契约后连续通过。

发布 2026/07/13更新 2026/07/13
  • Qwen3
  • Ollama
  • Inference
  • Benchmark
  • 可复现实验

模型部署与推理

本地大模型部署的取舍记录

本地部署不是单纯把模型跑起来,而是在成本、速度、质量和维护复杂度之间找平衡。

发布 2026/06/27更新 2026/07/01
  • AI
  • LLM
  • Inference
  • Deployment
© 2026 Younis Zhang
项目复用清单LLMs