Younis AI LabAI 应用开发、RAG、Agent 与工程化实践笔记
首页文章时间线项目证据关于简历账户

Tag

Coding Agent

共 5 篇文章。

Agent 实践

Coding Agent 交付评测实验:可见测试通过,为什么补丁仍应被拒绝

3 个正确最小补丁全部被接受;只针对可见样例的补丁虽然 3/3 通过公开测试,却 0/3 通过隐藏测试。正确代码只要附带受保护文件修改也会 0/3 接受,伪造成功证据则被独立重放识别。

发布 2026/07/14更新 2026/07/14
  • Coding Agent
  • 软件工程评测
  • 隐藏测试
  • 沙箱
  • 证据门禁

AI 工程实践

Qwen3-Coder 与 Qwen Code 首发复盘:开放权重 Coding Agent 的成本不止显存

Qwen3-Coder 首发把 480B-A35B 开放权重模型、长上下文、执行反馈训练与 Qwen Code CLI 放到同一条 Coding Agent 链路;生产价值仍取决于全量权重驻留、隔离工具、真实仓库评测、人工合并和每个经验证任务的总成本。

发布 2025/07/25更新 2025/08/11
  • Qwen3-Coder
  • Qwen Code
  • Coding Agent
  • 开放权重
  • 自托管

Agent 实践

Claude 4 与 Claude Code GA:Coding Agent 交付的不是一次补全

2025 年 5 月 22 日可确认的是 Opus 4、Sonnet 4 多渠道上线与 Claude Code 核心产品 GA;IDE、GitHub、interleaved thinking、Files API、代码执行和 MCP connector 仍有 beta 边界。生产价值取决于执行闭环而非单次生成。

发布 2025/05/25更新 2025/06/29
  • Claude 4
  • Claude Code
  • Coding Agent
  • Extended Thinking
  • 工具调用

Agent 实践

Codex 云端 Coding Agent 首发复盘:异步沙箱交付的不是一段代码

Codex 首发把 codex-1、独立云沙箱、并行任务与终端日志/测试引用组合成异步软件工程 Agent;生产价值仍取决于可复现环境、外部验证、冲突治理、最小权限和人工合并,而不是 Agent 是否生成了 commit。

发布 2025/05/19更新 2025/06/10
  • OpenAI Codex
  • Coding Agent
  • codex-1
  • AGENTS.md
  • 云端沙箱

Agent 实践

Claude 3.7 与 Claude Code 首发复盘:思考预算不等于 Agent 可靠性

Claude 3.7 Sonnet 把标准回答与 extended thinking 放进同一模型,并让 API 以 token budget 权衡质量、延迟和成本;Claude Code 同日只是 limited research preview,仓库级执行仍需上下文、权限、测试、diff 审查和回滚。

发布 2025/02/27更新 2025/03/07
  • Claude 3.7 Sonnet
  • Claude Code
  • Extended Thinking
  • Coding Agent
  • 软件工程
© 2026 Younis Zhang
项目复用清单LLMs