Younis AI LabAI 应用开发、RAG、Agent 与工程化实践笔记
首页文章时间线项目证据关于简历账户

Tag

长上下文

共 4 篇文章。

AI 工程实践

GPT-4.1 首发复盘:一百万上下文不是知识库,而是一项上下文工程预算

GPT-4.1 家族把 API 上下文窗口扩展到最多一百万 token,但容量不等于相关性、可信度和完整任务成功;生产系统仍要先选择证据、固定指令优先级,再用位置扰动、输出验证、模型路由和单位合格任务成本验收。

发布 2025/04/18更新 2025/05/02
  • GPT-4.1
  • 长上下文
  • 上下文工程
  • 代码智能
  • 模型路由

AI 变革观察

Gemini 2.5 Pro Experimental:1M 上下文为何仍不是生产承诺

Gemini 2.5 Pro Experimental 在首发日已经给出 thinking、原生多模态与 1M 上下文的强能力信号,但当时缺少 Vertex AI 可用性、正式价格和生产承诺;正确动作是建立预览评测,不是直接迁移关键链路。

发布 2025/03/28更新 2025/04/19
  • Gemini 2.5
  • 推理模型
  • 长上下文
  • 多模态
  • 生产评估

模型部署与推理

Qwen2 发布后的中文模型选型:上下文、许可证与语言质量要一起验收

Qwen2 把多尺寸中文与多语言开放权重带入选型,但 128K 宣称不等于每个模型默认原生支持,系列内许可证也不同;部署必须固定型号、配置和权利边界。

发布 2024/06/10更新 2024/06/21
  • Qwen2
  • 中文模型
  • 长上下文
  • 许可证
  • 部署评测

模型原理与推理

Gemini 1.5 Pro 的 1M 上下文意味着什么:长上下文没有自动终结 RAG

1M token 实验窗口证明长上下文成为新的系统变量,却没有证明整库直塞比检索更准、更便宜;选型必须比较完整任务的召回、干扰、延迟和缓存复用。

发布 2024/02/17更新 2024/03/22
  • Gemini
  • 长上下文
  • RAG
  • MoE
  • 评测
© 2026 Younis Zhang
项目复用清单LLMs