AI 工程实践
GPT-5 首发复盘:ChatGPT 路由不是 API 模型合同,升级要按交付物回归
GPT-5 首发同时包含 ChatGPT 中由快速模型、Thinking 与实时 router 组成的产品系统,以及 API 中显式可选的 gpt-5、mini、nano 和 gpt-5-chat-latest;生产系统不能把两者当成同一交付物,必须外置任务路由并把模型、reasoning、verbosity、工具语法、预算和验证器固化为升级合同。
Tag
共 6 篇文章。
AI 工程实践
GPT-5 首发同时包含 ChatGPT 中由快速模型、Thinking 与实时 router 组成的产品系统,以及 API 中显式可选的 gpt-5、mini、nano 和 gpt-5-chat-latest;生产系统不能把两者当成同一交付物,必须外置任务路由并把模型、reasoning、verbosity、工具语法、预算和验证器固化为升级合同。
AI 工程实践
gpt-oss 把可商用的 Apache-2.0 权重、稀疏 MoE、原生 MXFP4 与 Harmony 推理协议交给部署者,但 80GB/16GB 只说明一种权重装载入口;生产显存还要支付 KV Cache、并发、工作区、运行时和安全余量,开放权重也不等于完整开源或现成托管服务。
AI 工程实践
GPT-4.1 家族把 API 上下文窗口扩展到最多一百万 token,但容量不等于相关性、可信度和完整任务成功;生产系统仍要先选择证据、固定指令优先级,再用位置扰动、输出验证、模型路由和单位合格任务成本验收。
AI 工程实践
首发 Realtime API 把音频流、对话状态与函数调用放进持久 WebSocket,但低延迟不等于可交付;生产系统还必须截断未播放状态、约束工具副作用并按完成对话核算成本。
模型部署与推理
v0.6.0 证明 CPU 调度也可能让 GPU 空等;但厂商吞吐提升不能直接换算成生产容量,服务仍需按工作负载分别验收 TTFT、TPOT、队列、拒绝与单位合格请求成本。
AI 产品与商业化
Claude 3 把旗舰、中档和轻量模型放进同一产品叙事,但首日只有 Opus 与 Sonnet 可用;企业价值来自按任务风险路由,而不是默认调用最强模型。