AI 工程实践
Jaeger 停止后,三个稳定 span 均获 HTTP 200 并进入 bbolt queue。挂载同一 volume 为只读的 replacement Collector 以 exit code 1 退出,health 与第 4 批均为 ECONNREFUSED;失败前后 65,536-byte 数据库 SHA-256 一致。恢复读写后 loaded=3、sent=3,只重放第 4 批,Jaeger 最终 4 unique、0 duplicate、0 missing。
发布 2026/07/16更新 2026/07/16
AI 工程实践
64 MiB ext4 队列在 linear target 下接受三批;在线切换 device-mapper error 后,独立 block read 返回 EIO,但 Collector health 仍为 200,第 4 批收到 EROFS 503,metrics 为 accepted/refused 3/1、queue 4/20。恢复 linear 后 fsck clean、数据库哈希不变,replacement 恢复三批,只重放第 4 批后 Jaeger 4 unique、0 missing。
发布 2026/07/16更新 2026/07/16
RAG 与知识库
固定单次检索到有状态自适应检索后,答案决策准确率从 0.625 提升到 0.875,相关文档微平均召回从 0.736842 提升到 0.947368;代价是更多检索步骤和工作量,而且组合问题与两类错误作答仍未解决。
发布 2026/07/15更新 2026/07/15
AI 工程实践
应用只向 Collector 发送一次 3-span trace;故障代理第一次收到 Jaeger 200 后先证明 trace 已可查询,再断开响应。Collector 重投同一 329-byte payload,Jaeger accepted/sent 均为 6,但 Badger 最终查询仍为 3 unique / 0 duplicate。
发布 2026/07/15更新 2026/07/15
AI 工程实践
queue capacity 为 20,但 bbolt max_size 只有 65,536 bytes。前四个请求 HTTP 200,第五、第六个收到 storage available-space 503;metrics 为 accepted 4 / refused 2 / enqueue failed 2,却显示 queue 6/20。保留 volume、提高上限并重建 Collector 后只加载 4 items;定向重放被拒绝 IDs 后 Jaeger 最终 6 unique、0 missing。
发布 2026/07/15更新 2026/07/15
AI 工程实践
真实 SDK 共向 Collector 成功导出 24 个 span,Collector 分 5 批全部送入 Jaeger,20/20 条预期 trace 可由查询 API 反查;5 条 head-sampled drop、1 条 exporter 失败、6 类属性删除、技术成功但业务 rejected 和内存后端重建丢失均到达预期终态。
发布 2026/07/15更新 2026/07/15
AI 工程实践
固定 6 条校准轨迹全部通过,model、retrieval、tool 各有一条可定位失败;5 个 chat span 归集 4,940 input 与 620 output tokens,合成成本为 0.02414 美元,同时证明技术成功可以对应业务拒绝或待确认。
发布 2026/07/15更新 2026/07/15
AI 工程实践
下游不可达时,12 个单-span 请求全部从应用获得 HTTP 200,并形成 queue 12/20;bbolt 逻辑大小从 32,768 增至 262,144 bytes。单 consumer 在每次后端成功后固定等待 250 ms,用 3,129.727 ms 排空,观测 3.8342 spans/s;queue 归零后文件仍为 262,144 bytes,Jaeger 最终 12 unique、0 missing。
发布 2026/07/15更新 2026/07/15
AI 工程实践
Jaeger 停机后 7 个 span 形成 2 个 bbolt queue batches;Collector 与 Jaeger 均被 SIGKILL 并删除后,新 Jaeger 保留 3-span 基线但 queued trace 仍为 404,新 Collector 从原 volume 加载 7 items,在 accepted=0 的情况下送出 7 个唯一 span,duplicate 为 0。
发布 2026/07/15更新 2026/07/15
AI 工程实践
Jaeger 停机后,2-batch 持久队列对前两个单-span 请求返回 200,对第三个返回 503 sending queue is full;metrics 为 accepted 2 / refused 1 / enqueue failed 1。恢复只出现前两条,显式重放第三条稳定 ID 后最终 3/3 可查询。
发布 2026/07/15更新 2026/07/15
AI 工程实践
Collector queue capacity 仍是 20,file_storage 不设置 max_size,底层 64 KiB tmpfs 被真实写满。前五批 HTTP 200、第六批 503;accepted/refused 为 5/1,但 queue gauge 显示 6。停机后把 131,072-byte 稀疏 bbolt 文件按字节复制到 256 KiB tmpfs,源/目标 SHA-256 一致;replacement 恢复五批,只重放第六批后 Jaeger 6 unique、0 missing。
发布 2026/07/15更新 2026/07/15
AI 工程实践
应用一次发送 4 spans;代理只向 Jaeger 转发 root 与一个 child,拒绝另外两个并返回 HTTP 200 partial success。Collector 2500 ms 内不重试,metrics 为 accepted 4 / sent 4 / failed 0,warn 日志为 dropped_spans 2;Jaeger 最终 2 present / 2 missing。
发布 2026/07/15更新 2026/07/15
Agent 实践
3 个正确最小补丁全部被接受;只针对可见样例的补丁虽然 3/3 通过公开测试,却 0/3 通过隐藏测试。正确代码只要附带受保护文件修改也会 0/3 接受,伪造成功证据则被独立重放识别。
发布 2026/07/14更新 2026/07/14
Agent 实践
MCP 解决连接契约,OpenClaw 与 Hermes Agent 把连接扩展成个人 Agent 运行时;真正决定生产可用性的,是协议之外的身份、scope、审批、执行隔离、审计和恢复。
发布 2026/07/13更新 2026/07/13
Agent 实践
固定 11 个故障场景中没有发生重复副作用,也没有在未知终态后自动重放;审批复用、绑定错位和幂等键意图冲突都在 dispatch 前关闭。
发布 2026/07/13更新 2026/07/13
AI 变革观察
2024-2026 的核心变化不是一种模型替代另一种,而是交互、推理、行动三条反馈回路叠加;系统指标也应从首字延迟升级为每个正确且经验证任务的总成本。
发布 2026/07/13更新 2026/07/13
AI 工程实践
MCP 统一了工具连接,但不会自动提供业务授权。本实验把可信身份、租户、策略、审批和审计放在模型之外,并以最终上游状态而不是返回文字验证写操作是否被阻止。
发布 2026/07/13更新 2026/07/13
模型部署与推理
开放权重把按 Token 付费的选择权交给企业,也把容量、可靠性、许可和升级责任一并交回;正确比较单位是满足质量与 SLA 的每个成功任务总成本。
发布 2026/07/13更新 2026/07/13
模型部署与推理
14 次本地请求全部完成,TTFT P50 为 178.995 ms、输出吞吐 P50 为 14.98 token/s;含糊枚举提示连续失败,收紧字段契约后连续通过。
发布 2026/07/13更新 2026/07/13
RAG 与知识库
在这组小型固定任务上,显式领域扩展把 MRR@10 从 0.95 提到 1.00;过滤零分伪候选后,RRF 仍是 1.00 但没有任何增量收益。
发布 2026/07/13更新 2026/07/13
AI 工程实践
AI 应用不能只靠几次手动体验判断质量,至少要有可重复的样本集和失败归因。
发布 2026/07/01更新 2026/07/01
RAG 与知识库
从文档清洗、切分、向量化、召回、重排到答案生成,复盘一个 RAG 系统的工程落地过程。
发布 2026/06/30更新 2026/06/30
Prompt 工程
把 Prompt 从一次性灵感整理成可复用、可评测、可迭代的工程资产。
发布 2026/06/29更新 2026/06/30
Agent 实践
Agent 不是让模型无限自由行动,而是给它清晰目标、有限工具和可观察反馈。
发布 2026/06/28更新 2026/06/30
模型部署与推理
本地部署不是单纯把模型跑起来,而是在成本、速度、质量和维护复杂度之间找平衡。
发布 2026/06/27更新 2026/07/01
AI 工具链
AI 内容工具的重点不是替代写作,而是把低价值整理动作变成稳定流程。
发布 2026/06/26更新 2026/07/01
项目复盘
项目复盘不是流水账,而是让面试官看到问题定义、工程判断和结果验证。
发布 2026/06/25更新 2026/07/01
面试准备
AI 应用开发面试要同时准备概念理解、工程落地和项目表达。
发布 2026/06/24更新 2026/07/01
Agent 实践
GPT-5.4 首发把截图驱动的计算机操作与按需发现工具定义带入同一通用模型,但搜索到工具不等于获得权限,模型确认也不等于业务授权;生产价值取决于能否版本化目录和 schema、隔离执行、抵抗搜索污染,并从权威状态重放完整任务。
发布 2026/03/07更新 2026/03/29
开源项目研究
Hermes Agent 的关键信号不是多一个聊天入口,而是把消息、长期状态、定时任务和真实终端连接成常驻控制面;默认 local 后端在宿主登录 shell 执行,因此生产价值与风险都取决于身份、授权、隔离和恢复。
发布 2026/02/27更新 2026/03/12
开源项目研究
OpenClaw 的项目起点是 Warelay,完整名称链包含 Clawdis;它首先是单用户个人 Agent,Gateway 将渠道、工具、浏览器和设备连接起来,也把宿主执行与凭据风险集中到同一个控制面。
发布 2026/02/03更新 2026/02/19
AI 工程实践
MCP 捐赠给 Linux Foundation 旗下 AAIF,增强的是项目的中立治理承诺,不是新的 wire protocol,也不是对具体 Server 的安全认证。生产系统必须把协议规范、SDK、Registry 元数据和 Server 可执行制品分开锁定,再经过来源校验、最小权限、隔离运行、业务对账和撤销。
发布 2025/12/11更新 2026/01/14
AI 工程实践
GPT-5 首发同时包含 ChatGPT 中由快速模型、Thinking 与实时 router 组成的产品系统,以及 API 中显式可选的 gpt-5、mini、nano 和 gpt-5-chat-latest;生产系统不能把两者当成同一交付物,必须外置任务路由并把模型、reasoning、verbosity、工具语法、预算和验证器固化为升级合同。
发布 2025/08/09更新 2025/09/13
AI 工程实践
gpt-oss 把可商用的 Apache-2.0 权重、稀疏 MoE、原生 MXFP4 与 Harmony 推理协议交给部署者,但 80GB/16GB 只说明一种权重装载入口;生产显存还要支付 KV Cache、并发、工作区、运行时和安全余量,开放权重也不等于完整开源或现成托管服务。
发布 2025/08/07更新 2025/09/11
AI 工程实践
Qwen3-Coder 首发把 480B-A35B 开放权重模型、长上下文、执行反馈训练与 Qwen Code CLI 放到同一条 Coding Agent 链路;生产价值仍取决于全量权重驻留、隔离工具、真实仓库评测、人工合并和每个经验证任务的总成本。
发布 2025/07/25更新 2025/08/11
Agent 实践
2025 年 5 月 22 日可确认的是 Opus 4、Sonnet 4 多渠道上线与 Claude Code 核心产品 GA;IDE、GitHub、interleaved thinking、Files API、代码执行和 MCP connector 仍有 beta 边界。生产价值取决于执行闭环而非单次生成。
发布 2025/05/25更新 2025/06/29
Agent 实践
Codex 首发把 codex-1、独立云沙箱、并行任务与终端日志/测试引用组合成异步软件工程 Agent;生产价值仍取决于可复现环境、外部验证、冲突治理、最小权限和人工合并,而不是 Agent 是否生成了 commit。
发布 2025/05/19更新 2025/06/10
模型原理与推理
Qwen3 首发的工程价值不只是开放八组权重,而是把 thinking 与 non-thinking 放入同一系列,并提供从 0.6B dense 到 235B MoE 的部署梯度;生产收益取决于任务路由、完整 TCO 和回归评测。
发布 2025/05/02更新 2025/05/23
模型原理与推理
o3 与 o4-mini 首发把推理、视觉输入和工具选择连成任务循环;生产价值仍取决于外置身份与权限、幂等执行、结果验证、完整轨迹评测和每个合格任务的成本。
发布 2025/04/19更新 2025/05/16
AI 工程实践
GPT-4.1 家族把 API 上下文窗口扩展到最多一百万 token,但容量不等于相关性、可信度和完整任务成功;生产系统仍要先选择证据、固定指令优先级,再用位置扰动、输出验证、模型路由和单位合格任务成本验收。
发布 2025/04/18更新 2025/05/02
Agent 实践
A2A 首发用 Agent Card、JSON-RPC/HTTP/SSE 和 Task/Message/Part/Artifact 为异构 Agent 提供协作语言;它解决互操作骨架,不替企业完成身份委托、跨组织授权、幂等副作用、最终状态验证与责任划分。
发布 2025/04/12更新 2025/05/12
AI 变革观察
Gemini 2.5 Pro Experimental 在首发日已经给出 thinking、原生多模态与 1M 上下文的强能力信号,但当时缺少 Vertex AI 可用性、正式价格和生产承诺;正确动作是建立预览评测,不是直接迁移关键链路。
发布 2025/03/28更新 2025/04/19
Agent 实践
Responses API 把模型、工具与统一输出放到同一原语中,Agents SDK 补上编排与 tracing;真正的生产边界仍是业务状态、调用者身份、幂等执行、输出验证和人工接管,而不是一次 API 调用。
发布 2025/03/15更新 2025/04/04
AI 产品与商业化
Manus 首发把产品承诺从对话回答推向任务结果与 replay,但同期 waitlist 说明它不是无门槛 GA;通用 Agent 是否成立取决于可验收产物、状态账本、权限和人工接管。
发布 2025/03/08更新 2025/04/04
Agent 实践
Claude 3.7 Sonnet 把标准回答与 extended thinking 放进同一模型,并让 API 以 token budget 权衡质量、延迟和成本;Claude Code 同日只是 limited research preview,仓库级执行仍需上下文、权限、测试、diff 审查和回滚。
发布 2025/02/27更新 2025/03/07
AI 产品与商业化
Deep Research 首发把搜索、浏览、分析与带引用报告做成 5 至 30 分钟的异步任务,但当时只向 Pro 用户提供有限额度;商业价值取决于证据账本、时间边界、人工核验和每份被接受报告的成本,而不是答案长度。
发布 2025/02/04更新 2025/03/08
Agent 实践
Operator 首发把截图理解与鼠标键盘动作连成的浏览器 Agent 带入研究预览,但它当时只面向美国 Pro 用户,CUA API 仍是未来计划;生产价值取决于外置权限、关键动作审批、未知终态恢复和每个经验证任务的成本。
发布 2025/01/26更新 2025/02/07
模型原理与推理
正式 R1 不是纯 RL,Distill 不是 671B 的量化副本,首发 API 也不等于权重能力;生产选型必须分别核算训练路径、接口契约、许可和任务总成本。
发布 2025/01/22更新 2025/02/10
模型原理与推理
DeepSeek-V3 报告 671B 主模型总参数、每 token 约 37B 激活参数,以 MLA、MoE、FP8 和通信优化构成效率路线;但少量激活不消除全量权重、KV、跨卡通信和服务运维,2.788M H800 GPU-hours 也不是全部研发成本。
发布 2024/12/30更新 2025/01/22
AI 变革观察
Gemini 2.0 首发把实时多模态与原生工具调用放进实验模型,但 API、早期访问和研究原型处于不同可用层;生产交付仍需业务状态机、授权、评测和版本回滚。
发布 2024/12/14更新 2025/01/10
AI 工程实践
MCP 首发已经用 Host、1:1 Client、Server 和 JSON-RPC 统一 resources、prompts、tools,并同时包含 stdio 与 HTTP+SSE;它解决连接互操作,不自动提供 OAuth、租户授权、审批、幂等与审计。
发布 2024/11/27更新 2024/12/11
Agent 实践
Computer Use 让 Claude 通过截图、鼠标与键盘操作通用界面,但 Anthropic 首发即标注其笨拙、易错并公开较低 OSWorld 成绩;生产价值取决于隔离、域名白名单、逐步验证、审批与可恢复状态。
发布 2024/10/25更新 2024/11/25
AI 工程实践
首发 Realtime API 把音频流、对话状态与函数调用放进持久 WebSocket,但低延迟不等于可交付;生产系统还必须截断未播放状态、约束工具副作用并按完成对话核算成本。
发布 2024/10/04更新 2024/10/25
模型部署与推理
Qwen2.5 同期覆盖 0.5B 到 72B 的通用开放权重模型,并强调结构化数据理解和 JSON 输出;真正生产价值要经过语法、Schema、业务规则、幂等写入四道门,同时逐模型核验许可证。
发布 2024/09/21更新 2024/10/21
模型原理与推理
o1-preview 把更长的模型内推理过程带入产品,但首发 API 仅向 Tier 5 开放、限 20 RPM,且缺少 function calling、streaming 与 system message;正确工程动作是按难度路由并用外部验证器衡量收益。
发布 2024/09/14更新 2024/10/02
模型部署与推理
v0.6.0 证明 CPU 调度也可能让 GPU 空等;但厂商吞吐提升不能直接换算成生产容量,服务仍需按工作负载分别验收 TTFT、TPOT、队列、拒绝与单位合格请求成本。
发布 2024/09/08更新 2024/09/27
模型部署与推理
Llama 3.1 同日公开 8B、70B、405B 文本模型,把 128K、多语言与模型输出再利用带入开放权重生态;但许可证、权重存储、推理服务、数据治理和任务评测仍是五道独立上线门。
发布 2024/07/27更新 2024/08/09
AI 产品与商业化
Claude 3.5 Sonnet 以中档价格挑战上一代旗舰路由,同时用 Artifacts 预览可编辑工作区;模型能力和产品交互必须分开验收,价值要落到可合并任务成本。
发布 2024/06/22更新 2024/07/09
模型部署与推理
Qwen2 把多尺寸中文与多语言开放权重带入选型,但 128K 宣称不等于每个模型默认原生支持,系列内许可证也不同;部署必须固定型号、配置和权利边界。
发布 2024/06/10更新 2024/06/21
AI 变革观察
2024 年 5 月 13 日能确认的是多模态能力方向、现场演示和分阶段开放;公共 API 当日仍是文本与视觉模型,不能把演示直接当成交付接口。
发布 2024/05/16更新 2024/08/09
模型原理与推理
DeepSeek-V2 把 KV Cache 和激活参数直接带入产品成本讨论;MLA 与 MoE 是值得验证的架构信号,但论文节省不能未经同栈压测就写成业务账单节省。
发布 2024/05/09更新 2024/06/07
模型部署与推理
Llama 3 首发开放 8B 与 70B 权重,为私有部署提供了现实候选;但开放权重不等于 OSI 开源,128K 是词表大小而非上下文,商业决策还必须计入基础设施与运维。
发布 2024/04/20更新 2024/04/27
AI 产品与商业化
Claude 3 把旗舰、中档和轻量模型放进同一产品叙事,但首日只有 Opus 与 Sonnet 可用;企业价值来自按任务风险路由,而不是默认调用最强模型。
发布 2024/03/07更新 2024/03/23
AI 变革观察
2024 年 2 月的 Sora 首先是一项受限研究预览:它把长时序视频生成推到新的讨论位置,却没有提供公众可用接口;工程价值要通过分镜约束、人工审片和单位合格镜头成本来验证。
发布 2024/02/18更新 2024/03/09
模型原理与推理
1M token 实验窗口证明长上下文成为新的系统变量,却没有证明整库直塞比检索更准、更便宜;选型必须比较完整任务的召回、干扰、延迟和缓存复用。
发布 2024/02/17更新 2024/03/22