AI 工程实践
OpenTelemetry GenAI Trace 合同实验:Agent 成功为什么不等于业务成功
固定 6 条校准轨迹全部通过,model、retrieval、tool 各有一条可定位失败;5 个 chat span 归集 4,940 input 与 620 output tokens,合成成本为 0.02414 美元,同时证明技术成功可以对应业务拒绝或待确认。
Tag
共 11 篇文章。
AI 工程实践
固定 6 条校准轨迹全部通过,model、retrieval、tool 各有一条可定位失败;5 个 chat span 归集 4,940 input 与 620 output tokens,合成成本为 0.02414 美元,同时证明技术成功可以对应业务拒绝或待确认。
Agent 实践
固定 11 个故障场景中没有发生重复副作用,也没有在未知终态后自动重放;审批复用、绑定错位和幂等键意图冲突都在 dispatch 前关闭。
AI 变革观察
2024-2026 的核心变化不是一种模型替代另一种,而是交互、推理、行动三条反馈回路叠加;系统指标也应从首字延迟升级为每个正确且经验证任务的总成本。
Agent 实践
Agent 不是让模型无限自由行动,而是给它清晰目标、有限工具和可观察反馈。
面试准备
AI 应用开发面试要同时准备概念理解、工程落地和项目表达。
AI 工程实践
MCP 捐赠给 Linux Foundation 旗下 AAIF,增强的是项目的中立治理承诺,不是新的 wire protocol,也不是对具体 Server 的安全认证。生产系统必须把协议规范、SDK、Registry 元数据和 Server 可执行制品分开锁定,再经过来源校验、最小权限、隔离运行、业务对账和撤销。
AI 工程实践
GPT-5 首发同时包含 ChatGPT 中由快速模型、Thinking 与实时 router 组成的产品系统,以及 API 中显式可选的 gpt-5、mini、nano 和 gpt-5-chat-latest;生产系统不能把两者当成同一交付物,必须外置任务路由并把模型、reasoning、verbosity、工具语法、预算和验证器固化为升级合同。
模型原理与推理
o3 与 o4-mini 首发把推理、视觉输入和工具选择连成任务循环;生产价值仍取决于外置身份与权限、幂等执行、结果验证、完整轨迹评测和每个合格任务的成本。
Agent 实践
Responses API 把模型、工具与统一输出放到同一原语中,Agents SDK 补上编排与 tracing;真正的生产边界仍是业务状态、调用者身份、幂等执行、输出验证和人工接管,而不是一次 API 调用。
AI 变革观察
Gemini 2.0 首发把实时多模态与原生工具调用放进实验模型,但 API、早期访问和研究原型处于不同可用层;生产交付仍需业务状态机、授权、评测和版本回滚。
AI 工程实践
MCP 首发已经用 Host、1:1 Client、Server 和 JSON-RPC 统一 resources、prompts、tools,并同时包含 stdio 与 HTTP+SSE;它解决连接互操作,不自动提供 OAuth、租户授权、审批、幂等与审计。