Agent 实践
Coding Agent 交付评测实验:可见测试通过,为什么补丁仍应被拒绝
3 个正确最小补丁全部被接受;只针对可见样例的补丁虽然 3/3 通过公开测试,却 0/3 通过隐藏测试。正确代码只要附带受保护文件修改也会 0/3 接受,伪造成功证据则被独立重放识别。
Category
共 12 篇文章。
Agent 实践
3 个正确最小补丁全部被接受;只针对可见样例的补丁虽然 3/3 通过公开测试,却 0/3 通过隐藏测试。正确代码只要附带受保护文件修改也会 0/3 接受,伪造成功证据则被独立重放识别。
Agent 实践
MCP 解决连接契约,OpenClaw 与 Hermes Agent 把连接扩展成个人 Agent 运行时;真正决定生产可用性的,是协议之外的身份、scope、审批、执行隔离、审计和恢复。
Agent 实践
固定 11 个故障场景中没有发生重复副作用,也没有在未知终态后自动重放;审批复用、绑定错位和幂等键意图冲突都在 dispatch 前关闭。
Agent 实践
Agent 不是让模型无限自由行动,而是给它清晰目标、有限工具和可观察反馈。
Agent 实践
GPT-5.4 首发把截图驱动的计算机操作与按需发现工具定义带入同一通用模型,但搜索到工具不等于获得权限,模型确认也不等于业务授权;生产价值取决于能否版本化目录和 schema、隔离执行、抵抗搜索污染,并从权威状态重放完整任务。
Agent 实践
2025 年 5 月 22 日可确认的是 Opus 4、Sonnet 4 多渠道上线与 Claude Code 核心产品 GA;IDE、GitHub、interleaved thinking、Files API、代码执行和 MCP connector 仍有 beta 边界。生产价值取决于执行闭环而非单次生成。
Agent 实践
Codex 首发把 codex-1、独立云沙箱、并行任务与终端日志/测试引用组合成异步软件工程 Agent;生产价值仍取决于可复现环境、外部验证、冲突治理、最小权限和人工合并,而不是 Agent 是否生成了 commit。
Agent 实践
A2A 首发用 Agent Card、JSON-RPC/HTTP/SSE 和 Task/Message/Part/Artifact 为异构 Agent 提供协作语言;它解决互操作骨架,不替企业完成身份委托、跨组织授权、幂等副作用、最终状态验证与责任划分。
Agent 实践
Responses API 把模型、工具与统一输出放到同一原语中,Agents SDK 补上编排与 tracing;真正的生产边界仍是业务状态、调用者身份、幂等执行、输出验证和人工接管,而不是一次 API 调用。
Agent 实践
Claude 3.7 Sonnet 把标准回答与 extended thinking 放进同一模型,并让 API 以 token budget 权衡质量、延迟和成本;Claude Code 同日只是 limited research preview,仓库级执行仍需上下文、权限、测试、diff 审查和回滚。
Agent 实践
Operator 首发把截图理解与鼠标键盘动作连成的浏览器 Agent 带入研究预览,但它当时只面向美国 Pro 用户,CUA API 仍是未来计划;生产价值取决于外置权限、关键动作审批、未知终态恢复和每个经验证任务的成本。
Agent 实践
Computer Use 让 Claude 通过截图、鼠标与键盘操作通用界面,但 Anthropic 首发即标注其笨拙、易错并公开较低 OSWorld 成绩;生产价值取决于隔离、域名白名单、逐步验证、审批与可恢复状态。