Agent 实践

Claude 3.7 与 Claude Code 首发复盘:思考预算不等于 Agent 可靠性

以 2025 年 2 月 24 日至 26 日的一手资料为边界,区分 Claude 3.7 Sonnet 的标准与 extended thinking、API token budget,以及 Claude Code limited research preview 的仓库执行循环。

发布:2025/02/27更新:2025/03/07
Claude 3.7 同一模型的标准与扩展思考模式位于内层,Claude Code 在外层循环读取仓库、修改文件、运行测试并交由开发者审核
图 1:本站依据 Anthropic 2025-02-24 公告重绘;它区分模型思考模式与 Coding Agent 执行循环,不代表本站运行了 Claude Code。

时间与证据

本文研究的是 Anthropic 在 2025 年 2 月 24 日同时发布 Claude 3.7 Sonnet 和 Claude Code limited research preview 的事件,信息截止到 2 月 26 日。两者交付状态不同:Claude 3.7 Sonnet 已通过 Claude 计划、Developer Platform、Amazon Bedrock 与 Google Cloud Vertex AI 提供;Claude Code 只是受限研究预览。

文章发布日期与更新日期见页首。5 月 22 日 Claude 4 与 Claude Code GA、后续 IDE、SDK、GitHub 集成和今天的命令行为都不能倒填进首发。尤其不能把“同日宣布”写成“两个产品同日 GA”,也不能把 Claude Code 写成当时开源仓库。

证据来自 Anthropic 公告及 2 月 26 日 id_ archive。官方页面会更新,历史事实以 T+2 快照为界。页面中的 Benchmark 都是 Anthropic 的报告,并包含明确 scaffold、可运行子集和评测方法差异;本文不把厂商结果写成本站复现。

本文证据等级为 sourced。没有调用 Claude 3.7 API、加入 Claude Code 预览或在真实仓库执行任务。下文关注模型思考预算与 Agent 执行系统的分层,而不是声称工具效果。

当时发生了什么

同一模型提供两种响应方式

Anthropic 将 Claude 3.7 Sonnet 描述为 hybrid reasoning model:标准模式提供接近常规模型的快速回答;extended thinking 模式在回答前进行更长的自我反思。它不是为每个任务切换到另一个名称的推理模型,而是在同一模型中选择响应方式。

通过 API,开发者还能设置 thinking token budget,在输出上限内限定最多投入多少 token。这个控制把质量、延迟与成本的权衡显式交给系统设计者。更多预算可能帮助复杂数学、代码和多约束任务,但不是单调保证:简单任务可能只增加等待,错误上下文也可能得到更完整的错误答案。

首发公告给出标准和 extended thinking 相同的基础价格:每百万输入 token 3 美元、每百万输出 token 15 美元,thinking token 计入输出。这个价格只代表当时官方条件。业务核算必须把模型可能使用的 thinking token、重试、工具与人工复核都算进去,而不是只比较输入单价。

extended thinking 并非所有产品表面完全相同:公告说明 Claude 3.7 可用于 Free、Pro、Team、Enterprise 等计划,但 extended thinking 不提供给免费层。API 控制、产品 UI 和模型能力是三层交付,不能混为一句“所有用户都能控制思考预算”。

Claude Code 把模型放入仓库循环

同一公告把 Claude Code 定义为 command-line tool for agentic coding 和 limited research preview。官方描述它可以搜索和读取代码、编辑文件、编写与运行测试、commit 与 push 到 GitHub,并使用命令行工具,同时让开发者在每一步保持知情。

这与代码补全有本质差异。补全通常根据当前文件生成局部代码;Coding Agent 需要发现仓库结构、选择文件、运行命令、解释失败、修改多个模块并验证。模型回答只是循环中的一个组件,Agent 可靠性还取决于上下文检索、工具实现、Shell 权限、依赖环境、测试、Git 状态和人工审查。

首发页面也明确列出后续计划:提高 tool call reliability、支持长运行命令、改善渲染和增强工具自我理解。这些待改进项本身说明产品仍处早期。不能用 Anthropic 内部“某些任务一次完成、节省 45+ 分钟”的案例推导任意团队的平均节省;那是官方早期观察,没有公开代表性流量和对照。

模型 Benchmark 与 Agent Benchmark 不能混用

SWE-bench Verified 测的是在 scaffold 和环境约束下解决仓库 issue。公告附录说明不同系统可能使用文件检索、best-of-N、重试或 MCTS;Anthropic 的测试也有自己的 bash、文件编辑与 planning 工具,并存在内部基础设施无法运行的子集。一个最终分数同时反映模型、工具、环境、任务选择与评分。

因此“Claude 3.7 模型得分”不能直接变成“Claude Code 产品成功率”,Claude Code 的 demo 也不能证明 API 裸模型会自主完成同样任务。工程评测必须固定完整系统,而不只写模型名。

任务判断

假设一个十人全栈团队要把 monorepo 中 60 个服务从旧日志接口迁移到新的结构化 logger,同时保持字段兼容、补测试和更新文档。任务跨文件但规则明确,适合评估 Coding Agent;直接让 Agent push 主分支则风险过高。

第一步冻结仓库 commit,在隔离 worktree 或容器中运行。Agent 只能访问任务仓库和允许的包注册表,不读取个人 SSH key、云凭据或其他目录;GitHub token 默认没有 push 主分支权限。任务定义包括允许修改的目录、禁止变更的公共 API、测试命令、超时和完成条件。

第二步建立基线。人工工程师和现有补全工具各完成一组等价服务,记录总分钟、返工、测试失败和 review 评论。Claude 3.7 标准模式与不同 thinking budget 在同样 scaffold 上运行;不能为某个候选额外手工提示后仍称公平比较。

第三步用确定性门禁验收:格式、类型、单元/集成测试、字段快照、依赖审计和 git diff 范围。通过自动门禁后仍由代码所有者 review。Agent 不可自行批准、合并或部署;任何测试环境写入使用短期凭据并在任务结束撤销。

按阶段分配思考预算

并非整个 Agent 循环都需要高预算。仓库列表和机械替换可以使用标准模式或确定性脚本;分析跨模块设计、解释复杂失败时才提高 thinking budget;生成后由测试验证。若同一失败连续两次,系统停止并转人工,而不是无限增加思考 token。

路由条件可以是影响文件数、测试类型、历史失败、依赖图深度和风险标签。记录每阶段 token 与时间,才能知道高预算是在提高成功率,还是只延长了错误探索。

工程影响

Coding Agent 是有副作用的 CI worker

应按 CI runner 管理 Claude Code:临时 worktree、最小权限用户、网络 allowlist、CPU/内存/时间配额、不可变基础镜像和任务后销毁。仓库中的 README、issue、测试输出和代码注释都是不可信数据,不能让它们修改系统权限或读取宿主秘密。

Shell 工具按命令和参数策略控制。允许 npm test 不代表允许 npm publish;允许 git commit 不代表允许 push。高风险命令使用 out-of-band 审批,审批绑定完整参数、仓库、branch、commit 和过期时间。模型不能通过另一个工具为自己授权。

Diff 与测试是权威证据

Agent 的自然语言总结不参与最终判定。系统保存 base commit、patch、命令、exit code、测试报告、生成文件和最终 tree hash。若 Agent 表示“全部测试通过”,但 runner 没有对应命令记录,则视为未验证。

测试也不是绝对正确:Agent 可能修改测试以掩盖回归。策略应限制关键 golden tests 不可修改,或由独立仓库在 Agent 完成后运行 hidden tests。代码所有者重点检查权限、数据迁移、错误处理与测试覆盖,而不是只看格式。

长任务需要恢复点

命令超时、网络断开、上下文压缩和模型错误都会中断任务。状态机记录目标、当前步骤、已修改文件、测试结果和剩余预算。恢复时先检查 worktree 是否与记录一致,再决定继续;不能把旧计划直接应用到用户新提交。

并发 Agent 需要文件或 branch 隔离,避免一个任务覆盖另一个任务的修改。合并冲突交给独立验证阶段,不能让模型在未知 base 上静默解决并 push。

商业价值

可能付费的是拥有稳定代码库、自动测试和大量重复维护任务的软件团队。Claude 3.7/Claude Code 可以增强 issue 定位、跨文件修改、测试生成和迁移草稿;它更可能缩短工程师从问题到可 review patch 的时间,而不是替代产品决策与代码所有权。

成本来自输入与 thinking token、工具运行、CI、重试、review、隔离环境和误改恢复。收益来自缩短 lead time、减少机械操作和提高历史任务覆盖。没有测试和 review 的团队无法低成本使用 Agent,因为验证负担会吞掉生成速度。

建议 8 周试点:前 4 周只跑已解决历史 issue,后 4 周生成真实低风险 PR。若完整任务首次通过率低于 60%、review 修改超过 Agent diff 的 30%、平均交付时间未减少 25%、出现 1 次越权网络或 secret 访问、Agent 修改受保护测试,或单位合并 PR 成本高于人工基线,则停止扩大权限。阈值是未来项目的可证伪条件,不是本文结果。

不应采用的场景包括缺少测试、生产凭据和开发环境混用、任务目标无法写成验收条件、高风险数据库迁移没有回滚,或监管要求不能接受外部模型处理代码。此时先改善工程基础设施,比部署 Agent 更有价值。

局限与风险

第一,本文没有运行 Claude 3.7 或 Claude Code,无法验证官方编码 Benchmark 和时间节省案例。第二,公告页面可能后续修订;历史判断以 2 月 26 日快照为边界。

第三,extended thinking 增加的 token 可能提高成本和延迟,不能保证正确。展示的思考内容也不能作为完整审计。第四,Claude Code 首发不是 GA 或开源,供应商可用性、数据处理和产品行为应单独审查。

第五,仓库内容可能触发 Prompt Injection;工具权限和 secret 隔离必须在模型外。第六,运行测试本身可能执行恶意 lifecycle script、访问网络或消耗资源,容器与 allowlist 不能省略。第七,commit/push 能力若无 branch protection 和审批,会把模型错误直接传播到协作系统。

面试表达

30 秒结论: Claude 3.7 的信号是同一模型同时支持标准回答与 extended thinking,API 可以用 token budget 权衡质量、延迟和成本;Claude Code 则把模型放进读代码、改文件、跑测试的仓库循环。但 2025 年 2 月 Claude Code 只是 limited research preview,不是 GA 或开源,Agent 可靠性还取决于权限、环境、测试、diff 审查与回滚。

3 分钟展开: 我会把 Coding Agent 当不可信 CI worker:固定 base commit,在临时 worktree 和最小权限容器运行,限制网络和命令;标准模式做机械任务,高 thinking budget 只给复杂分析;最终以独立测试、patch 和 tree hash验收。Agent 不允许自批、push 主分支或部署。商业评测看完整 issue 通过率、review 修改和单位合并 PR 成本,而不是厂商 SWE-bench 图。

如果追问“思考越久是否越好”,答案是只在部分复杂任务上可能提高质量。应该通过任务路由和外部验证找收益曲线;简单任务、错误上下文或不可验证任务可能只增加成本。

复盘

站在 2026 年回看,这次发布把两条路线放在同一天:模型内部推理预算可控,模型外部 Agent 开始承担仓库级动作。前者解决一次回答如何分配计算,后者解决多步任务如何观察、执行和验证;混淆两层会把模型能力错误当成系统可靠性。

最值得保留的工程判断是:Coding Agent 的上限由模型推动,下限由软件工程基础决定。测试、权限、可观测性和回滚越成熟,Agent 越能进入真实工作流;反之,更强模型只会更快地产生难以验证的变更。

下一步实验应选一个冻结 monorepo 迁移任务,公开 base commit、任务说明、容器、thinking budget、命令轨迹、patch、测试和人工 review。完成后才能把本篇部分判断从 sourced 提升为 reproduced

方法披露

本文使用 AI 工具协助读取 Anthropic 公告与 archive、区分模型与 Agent 层并绘制双层图;事件日期、产品状态、价格口径、能力边界和最终判断由作者核验。本文没有加入预览或运行模型,厂商 Benchmark 和案例未被改写为本站结果。

修订记录

  • 2025-02-27:初版发布;固定 2025-02-24 至 02-26 的公告与 archive,区分 Claude 3.7 正式可用和 Claude Code limited research preview,并加入 thinking budget 路由、隔离执行与可证伪试点条件。

Source ledger

来源账本

以下来源用于核对事实、日期与当时可用范围。厂商自报性能不视为本站独立复现。

  1. Claude 3.7 Sonnet and Claude Code
    Anthropic官方一手来源同期证据来源发布:2025/02/24本站核验:2025/03/07
  2. Claude 3.7 Sonnet announcement T+2 snapshot
    Anthropic (Internet Archive)历史页面存档同期证据来源发布:2025/02/26本站核验:2025/03/07

讨论

正在加载评论...