Agent 实践
Coding Agent 交付评测实验:可见测试通过,为什么补丁仍应被拒绝
3 个正确最小补丁全部被接受;只针对可见样例的补丁虽然 3/3 通过公开测试,却 0/3 通过隐藏测试。正确代码只要附带受保护文件修改也会 0/3 接受,伪造成功证据则被独立重放识别。
Tag
共 5 篇文章。
Agent 实践
3 个正确最小补丁全部被接受;只针对可见样例的补丁虽然 3/3 通过公开测试,却 0/3 通过隐藏测试。正确代码只要附带受保护文件修改也会 0/3 接受,伪造成功证据则被独立重放识别。
AI 工程实践
Qwen3-Coder 首发把 480B-A35B 开放权重模型、长上下文、执行反馈训练与 Qwen Code CLI 放到同一条 Coding Agent 链路;生产价值仍取决于全量权重驻留、隔离工具、真实仓库评测、人工合并和每个经验证任务的总成本。
Agent 实践
2025 年 5 月 22 日可确认的是 Opus 4、Sonnet 4 多渠道上线与 Claude Code 核心产品 GA;IDE、GitHub、interleaved thinking、Files API、代码执行和 MCP connector 仍有 beta 边界。生产价值取决于执行闭环而非单次生成。
Agent 实践
Codex 首发把 codex-1、独立云沙箱、并行任务与终端日志/测试引用组合成异步软件工程 Agent;生产价值仍取决于可复现环境、外部验证、冲突治理、最小权限和人工合并,而不是 Agent 是否生成了 commit。
Agent 实践
Claude 3.7 Sonnet 把标准回答与 extended thinking 放进同一模型,并让 API 以 token budget 权衡质量、延迟和成本;Claude Code 同日只是 limited research preview,仓库级执行仍需上下文、权限、测试、diff 审查和回滚。