Agent 实践

Computer Use 公测复盘:截图、鼠标与真实副作用之间的安全边界

以 2024 年 10 月 22 日至 24 日的一手资料为边界,拆解 Anthropic Computer Use 的观察—动作—验证循环、低成功率、提示注入与人工接管,给出可逆任务的商业试点方法。

发布:2024/10/25更新:2024/11/25
Computer Use 从截图观察到模型决策和鼠标键盘执行,再以新截图和权威业务状态验证并决定继续、停止或转人工的闭环
图 1:本站依据 Anthropic 2024-10-22 公告与 2024-10-24 固定 demo 重绘;它解释 Agent 循环和控制点,不代表本站运行了 Computer Use。

时间与证据

本文研究的是 Anthropic 在 2024 年 10 月 22 日将 Computer Use 作为 API public beta 发布的事件,信息截止日是 10 月 24 日。文章发布日期与更新日期见页首。后来的模型、浏览器 Agent 产品和安全机制不用于扩大首发能力。

同期证据包括 Anthropic 公告、公告发布当日 archive,以及官方 quickstarts 仓库在完整 commit 8f734fd08c425c6ec91ddd613af04ff87d70c5a0 下的 Computer Use demo。公告证明 public beta、渠道和厂商评测;固定仓库证明参考 agent loop、Docker 桌面与首发风险提示。当前文档可能已经变化,因此正文只引用这个 T+2 快照的约束。

可以确认的是:开发者能够通过 Anthropic API、Amazon Bedrock 和 Google Cloud Vertex AI 使用 beta,让更新后的 Claude 3.5 Sonnet 根据屏幕截图移动光标、点击、输入。Anthropic 同时写明能力仍然 experimental、cumbersome and error-prone,并鼓励从低风险任务开始。它不是普通 Claude 用户自动获得稳定桌面控制,也不是生产 SLA。

本文证据等级为 sourced。我检查了公告与固定 demo,但没有配置 API key、运行 GUI 任务或复现 OSWorld。因此下文的成功率数字只用于说明厂商当时公开的边界,不是本站结果。

当时发生了什么

从结构化 API 走向像素级操作

传统工具调用把动作定义成 create_ticket({title, priority}),参数、权限和错误相对清晰。Computer Use 面对的是为人类设计的 GUI:模型读取截图,决定坐标、按键或文本,执行器改变桌面,再把新截图送回模型。一次业务任务可能经历几十甚至上百步,每一步都依赖前一步页面状态。

这种方式的价值是覆盖没有 API、接口成本过高或遗留系统难改造的场景。代价是语义退化成像素:按钮移动、窗口遮挡、滚动位置、分辨率、弹窗、网络延迟和 A/B 页面都会让坐标动作失效。它不是一次函数调用,而是一个必须有状态、预算和停止条件的控制循环。

首发数据已经要求克制

Anthropic 报告更新后的 Claude 3.5 Sonnet 在 OSWorld screenshot-only 类别为 14.9%,对比下一个系统 7.8%;即使领先,14.9% 也清楚表明通用计算机任务远未稳定。这个数字是 Anthropic 的 Benchmark 报告,任务、步数和 scaffold 与真实业务可能不同,本文不把它外推为生产成功率。

页面同时说明滚动、拖拽、缩放等对人类自然的动作仍是挑战。长任务还有乘法风险:即便单步成功概率看起来不低,连续很多步全对的概率也会下降。生产验收必须以整项任务最终状态为准,不能用“模型完成了大多数点击”替代订单是否真的保存正确。

官方 demo 把风险写在入口

T+2 demo 的 README 建议使用最小权限虚拟机或容器,避免给模型敏感登录信息,将互联网限制到域名 allowlist,并让人确认金融交易、接受条款等具有现实后果或需要明确同意的决定。它还直接指出网页或图片中的指令有时会覆盖用户指令,造成 Prompt Injection 风险。

这些不是可选的“安全增强”,而是 Computer Use 的基本系统条件。容器只隔离操作系统,不会自动保护容器里已登录的网站账号;域名白名单限制去哪,不限制允许网站上的恶意内容;人工确认如果只展示“是否继续”而不展示目标账户、金额和动作,也不构成有效审批。

固定 demo 还提示组件之间弱隔离:agent loop 就运行在被 Claude 控制的容器里,一次只能使用一个 session,需要时应重启或 reset。这证明它是帮助开发者理解能力的参考实现,不是多租户生产控制面。

任务判断

假设一家小型物流公司仍使用没有 API 的供应商门户。运营每天登录网页,根据内部工单查询运单状态,把结果复制回 CRM;遇到异常只生成处理草稿,不允许自动退款。团队考虑用 Computer Use 减少重复操作。

这个任务有适合的部分:读多写少、页面集合有限、结果可在 CRM 和供应商门户交叉核验。也有危险部分:浏览器持有登录态,网页内容不可信,错误点击可能取消订单或修改地址。试点应先把任务缩到“查询并生成草稿”,不开放提交、退款或账户设置。

任务状态机至少保存 taskId、当前页面、允许域名、已执行步骤、最大步骤、剩余时间、预期运单号、候选结果和人工接管原因。每一步执行前检查动作类型与坐标是否落在允许区域;每个关键页面读取可访问文本或截图,再与目标运单号比对。最终结果必须调用 CRM 或重新读取页面确认,而不是相信模型回复“完成了”。

离线评测要捕获真实页面副本或在测试站构造:正常查询、登录过期、弹窗、页面改版、慢加载、运单不存在、多个相似编号、恶意页面提示和意外下载。每个样本记录任务是否完成、错误动作、步数、人工接管点和恢复结果。只使用厂商 demo 的成功视频无法估算可靠性。

三类动作分级

级别 示例 默认策略
只读 打开页面、搜索、读取状态 在隔离 profile 与 allowlist 内自动执行,仍限制步数
可逆草稿 填写但不提交、生成 CRM 草稿 执行后截图和字段比对,用户确认前不提交
不可逆或高损失 付款、退款、删除、接受条款、发送外部消息 默认禁止;需要参数化审批与第二通道确认

审批绑定任务、用户、域名、动作、关键字段、过期时间和页面版本。模型不能调用一个“批准自己”的工具;批准后若页面状态变化,应作废而不是继续点击旧坐标。

工程影响

观察、动作与验证要分开记录

每一步日志至少包含截图 hash、页面 URL、窗口尺寸、模型版本、候选动作、策略结果、实际执行、执行后截图 hash 和业务验证结果。截图可能含个人信息,应按保留期限加密存储并最小化访问;不能为了调试无限期保存完整桌面。

模型发出的坐标需要经过工具层变换和边界检查。T+2 demo 特别讨论高分辨率截图缩放:若图像在 API 中隐式缩放而坐标不一致,会降低准确性并增加延迟。生产工具要显式记录原始与模型视图尺寸,统一坐标映射。

浏览器 profile 等于一组凭据

不要让 Computer Use 使用员工日常浏览器。为每个工作流创建专用账号与 profile,只授予查询所需权限;关闭密码管理器、个人邮箱、云盘和跨域 cookie。网络层只允许必要域名,下载目录挂载到隔离扫描区,任务结束清理临时文件。

若门户支持 API token 或只读账号,应优先使用。GUI Agent 的通用性不能成为绕过供应商正规接口、权限和服务条款的理由。界面改变时必须能够快速停用自动化,不能让 Agent 继续探索生产账号。

接管是产品能力

人工接管界面要显示当前截图、目标、已执行动作、剩余风险和建议下一步,并允许暂停、回滚或结束。接管率不是失败到可以隐藏的指标,而是容量规划输入。若高峰期 30% 任务需要人工,但值班人员只能处理 5%,自动化会形成更大的积压。

失败分类至少区分视觉定位、页面状态、登录权限、网络、模型决策、工具执行、策略拒绝和业务验证。只有分类后才能判断换模型、改 UI、加 API 或缩小任务哪个更有效。

商业价值

可能付费的是拥有大量稳定遗留 GUI、人工重复操作且暂时无法获得 API 的团队,例如物流查询、后台录入、桌面测试和内部运营。Computer Use 增强的是 RPA 难以适配的非结构化界面和长尾变化;传统选择器或 API 对稳定页面通常更便宜、更确定。

成本包括模型的截图与推理、虚拟桌面、浏览器账号、监控、人工接管、安全审查、页面变更维护和错误恢复。收益来自减少操作分钟与覆盖原本需要人读屏的长尾。正确比较单位是“每个经权威状态验证完成的任务”,不是点击次数。

建议 12 周试点:前 4 周只读测试环境,中间 4 周生产影子运行,最后 4 周只允许低风险查询。若整任务成功率低于 95%、任一高风险动作在无审批下执行、错误读取超过 1%、人工接管分钟未比原流程下降 30%、页面改版恢复超过一个工作日,或单个合格任务总成本高于人工,就终止或改为确定性 RPA。这些是未来试点门槛,不是本站实测。

不应采用的场景包括支付、医疗或法律决定;无法提供隔离账号;网站包含大量不可信第三方内容;任务不可逆且无最终状态 API;或页面本身有稳定 API/DOM 自动化方案。模型更通用不是放弃确定性接口的理由。

局限与风险

第一,本文没有运行 Computer Use,不能用官方 demo 或 OSWorld 推断目标门户成功率。第二,截图可能遗漏屏幕外内容、焦点与隐藏状态;视觉上相同的按钮可能触发不同后果。

第三,Prompt Injection 无法仅靠 system prompt 解决。网页、图片、文档和下载都应视为不可信数据;模型能读它们又能操作登录态时,必须用工具权限限制爆炸半径。第四,容器与 VM 不能撤销网站侧副作用,退款、发信和条款接受仍需要业务审批。

第五,长任务会遭遇超时、重复执行与未知终态。如果点击提交后网络断开,系统必须先查询权威状态再决定重试;盲重试可能创建重复订单。第六,首发 beta API 与 demo 都可能变化,生产要固定版本并保存回滚路径。

面试表达

30 秒结论: 2024 年 Computer Use 的突破是让模型用截图、鼠标和键盘操作通用 GUI,但 Anthropic 同时公开它易错,OSWorld screenshot-only 官方结果只有 14.9%。我会把它当受控 Agent 循环,不当稳定 RPA:专用 VM、最小权限账号、域名白名单、逐步验证、高风险审批和人工接管缺一不可。

3 分钟展开: 我会选择无 API 的物流查询作为首个任务,只开放读取和草稿。每一步记录观察、候选动作、策略、执行和新状态;最终用供应商页面与 CRM 双重核验。浏览器 profile 当作凭据管理,网页内容当作不可信输入。付款、删除、提交等动作默认拒绝。试点以整任务成功率、错误动作、接管分钟和恢复时间验收,而不是用模型点击了多少次。

若追问“放在 Docker 是否安全”,答案是否定的。Docker 能限制宿主访问,但容器内的登录账号仍能产生真实网站副作用;还需要账号权限、网络、审批、幂等与业务状态验证。

复盘

站在 2026 年回看,Computer Use 让 Agent 从“调用为机器设计的接口”进入“操作为人设计的界面”。长期价值是真实覆盖面扩大,长期风险则是系统必须处理不确定感知与真实副作用的组合。

首发材料已经给出了正确姿势:低风险任务、隔离、敏感信息最小化、allowlist 和人工确认。问题不在于安全提示够不够长,而在于这些要求是否被做成模型无法绕过的执行层约束。

下一步实验应在本地测试站建立十类页面故障和三类提示注入,固定模型与屏幕尺寸,公开任务轨迹、失败截图、接管点和最终状态。完成可复现运行后,相关结论才可升级到 reproduced

方法披露

本文使用 AI 工具协助读取 Anthropic 公告和固定 quickstart、整理闭环与风险分类并绘图;事件日期、固定 commit、OSWorld 归因、demo 风险说明和最终文字由作者复核。本文没有运行 API 或 GUI 自动化。

修订记录

  • 2024-10-25:初版发布;固定 2024-10-22 至 10-24 的公告、archive 与 demo,明确 public beta、低成功率、弱隔离、提示注入和可逆任务试点条件。

Source ledger

来源账本

以下来源用于核对事实、日期与当时可用范围。厂商自报性能不视为本站独立复现。

  1. Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku
    Anthropic官方一手来源同期证据来源发布:2024/10/22本站核验:2024/11/25
  2. Computer use announcement release-day snapshot
    Anthropic (Internet Archive)历史页面存档同期证据来源发布:2024/10/22本站核验:2024/11/25
  3. Computer use demo T+2 repository snapshot
    Anthropic官方仓库同期证据来源发布:2024/10/24本站核验:2024/11/25

讨论

正在加载评论...