AI 工程实践
GPT-4.1 首发复盘:一百万上下文不是知识库,而是一项上下文工程预算
GPT-4.1 家族把 API 上下文窗口扩展到最多一百万 token,但容量不等于相关性、可信度和完整任务成功;生产系统仍要先选择证据、固定指令优先级,再用位置扰动、输出验证、模型路由和单位合格任务成本验收。
Tag
共 4 篇文章。
AI 工程实践
GPT-4.1 家族把 API 上下文窗口扩展到最多一百万 token,但容量不等于相关性、可信度和完整任务成功;生产系统仍要先选择证据、固定指令优先级,再用位置扰动、输出验证、模型路由和单位合格任务成本验收。
AI 变革观察
Gemini 2.5 Pro Experimental 在首发日已经给出 thinking、原生多模态与 1M 上下文的强能力信号,但当时缺少 Vertex AI 可用性、正式价格和生产承诺;正确动作是建立预览评测,不是直接迁移关键链路。
模型部署与推理
Qwen2 把多尺寸中文与多语言开放权重带入选型,但 128K 宣称不等于每个模型默认原生支持,系列内许可证也不同;部署必须固定型号、配置和权利边界。
模型原理与推理
1M token 实验窗口证明长上下文成为新的系统变量,却没有证明整库直塞比检索更准、更便宜;选型必须比较完整任务的召回、干扰、延迟和缓存复用。