Agent 实践

GPT-5.4 首发复盘:Computer Use 与 Tool Search 把授权、缓存和重放推到控制平面

以 2026 年 3 月 5 日至 7 日的一手资料为边界,拆解 GPT-5.4 原生 Computer Use、Tool Search 按需工具定义、确认策略和厂商评测,并给出授权、缓存、搜索污染、审计重放与单位任务成本方案。

发布:2026/03/07更新:2026/03/29
GPT-5.4 任务先经工具目录搜索与版本固定,再由授权控制面分流到结构化 API 或计算机操作,最终验证并记录审计事件
图 1:本站依据 OpenAI 2026-03-05 首发页与安全卡绘制的建议控制架构;日期边界为 2026-03-05 至 03-07,不是 OpenAI 官方内部架构,也不表达本站实测结果。

时间与证据

本文研究的事件是 OpenAI 在 2026 年 3 月 5 日发布 GPT-5.4,并在 API 与 Codex 中提供原生 Computer Use 和 Tool Search。同期信息截止到 3 月 7 日;文章发布日期与更新日期见页首。事实依据是首发页、2026-03-05 18:23:11 UTC 的发布日快照GPT-5.4 Thinking 安全卡及同日 19:32:07 UTC 的固定快照。后续文档、SDK 变化、价格调整和线上经验都没有倒灌进同期判断。

首发范围需要按产品面拆开。OpenAI 当日称 GPT-5.4 逐步进入 ChatGPT、API 与 Codex:ChatGPT 中名称为 GPT-5.4 Thinking;API 模型名为 gpt-5.4;GPT-5.4 Pro 同时进入 ChatGPT 与 API。原生 Computer Use 被明确放在 Codex 和 API 语境,Tool Search 由 API 引入。不能据此写成所有 ChatGPT 用户都拿到了相同的开发者工具合同。

上下文也不是一个统一的“全产品 1M”开关。首发页称 GPT-5.4 支持最高 1M token 上下文,同时明确 ChatGPT 的 GPT-5.4 Thinking 上下文保持与 GPT-5.2 Thinking 相同;Codex 的 1M 支持仍是 experimental,标准窗口是 272K,超过 272K 的请求按正常速率的 2 倍计入 usage limit。本文不把 Codex 的实验配置改写成 ChatGPT 扩容,也不把 usage-limit 规则写成所有 API 账单的统一价格规则。

本文证据等级为 sourced。我核验了两组官方页面和发布日快照,但没有保存 3 月 5 日的可调用模型快照,没有运行 Computer Use 或 Tool Search,也没有取得 OpenAI 的内部训练、目录检索、缓存或执行架构。文中的 OSWorld-Verified、WebArena-Verified、Online-Mind2Web 与 MCP Atlas 数字均是 OpenAI 报告;控制平面、代码、缓存键、评测集和扩量门槛是本站的工程设计,不是本站实验结果。

当时发生了什么

原生 Computer Use 把“建议步骤”变成可产生外部状态的动作

GPT-5.4 被 OpenAI 描述为首个具备原生 Computer Use 的通用模型。首发页列出两种工作方式:一是编写代码,通过 Playwright 等库操作计算机;二是根据截图发出鼠标和键盘指令。API 通过更新后的 computer tool 暴露这类能力。这里的“原生”表示模型发布本身针对观察界面和采取动作做了训练与工具支持,不表示浏览器、凭据、网络、审批或业务回滚由模型自动解决。

OpenAI 报告 GPT-5.4 在 OSWorld-Verified 上达到 75.0%,在同时使用 DOM 与截图交互的 WebArena-Verified 上为 67.3%,在仅使用截图观察的 Online-Mind2Web 上为 92.8%。这些成绩说明它值得进入目标环境评测,但不能转换成企业桌面自动化成功率。固定 Benchmark 不包含每家公司的 SSO、弹窗、区域化文案、慢接口、权限菜单、并发编辑、真实数据与事故责任;OSWorld 页面引用的 72.4% human performance 也不能证明模型已经普遍“超过人类操作电脑”。

首发页还称开发者可以通过 developer message 调整行为,并配置不同风险容忍度的 confirmation policy。安全卡给出了更严格的边界:模型被训练为同时遵循平台级高风险动作策略与开发者提供的确认策略;平台可更新系统级政策,开发者可以在 API 中定制确认要求,而终端用户自定义当日没有发布。确认策略属于模型行为约束,不是应用授权系统。 即使模型正确请求确认,后端仍要验证发起人、租户、资源、动作、参数、对象版本和批准是否仍有效。

Tool Search 从“预装全部 schema”转为“需要时取定义”

传统工具调用把每个工具定义都放进 Prompt。连接器只有几个时问题不明显;当系统挂接几十个 MCP server、数百个函数时,名称、说明和 JSON Schema 会在每轮占用数千甚至数万 token,也会挤压任务证据并破坏稳定前缀缓存。

首发页对 Tool Search 的描述是:GPT-5.4 先获得一个轻量的可用工具列表和搜索能力;需要某个工具时,再查找其定义,并在那一刻把定义追加到对话。这实质上把工具 schema 从静态 Prompt 依赖变成运行时发现依赖。模型输入更小,但系统多了目录版本、检索索引、排序结果、schema 取回、权限过滤和缓存失效等状态。

OpenAI 报告在 Scale MCP Atlas 的 250 个任务中,同时启用 36 个 MCP server,对比“全部函数直接放入上下文”和“全部 server 放在 Tool Search 后”两种配置;Tool Search 在相同准确率下把总 token 使用量降低 47%。这只是厂商在指定任务、server 集合和实现上的结果。生产系统若目录质量差、搜索多轮失败、schema 经常变化,或冷缓存取回很慢,节省可能被检索、重试和错误选择抵消。

“preserves the cache” 是优化信号,不是缓存正确性证明

OpenAI 称按需加载定义可以减少重复 token 并保留 cache。工程上能够直接继承的结论只有:稳定的轻量前缀比每轮注入大量动态 schema 更利于缓存。它没有替企业定义缓存键、权限隔离、撤权传播或 schema 兼容策略。

至少要区分三类对象:目录搜索结果缓存、工具 manifest/schema 缓存、模型 Prompt 前缀缓存。搜索结果与调用者可见范围有关,不能跨租户或跨权限主体复用;schema 可以按不可变版本共享,但其中不能嵌入租户秘密;Prompt cache 即使命中,也不能跳过当前时刻的授权。cache hit 只证明复用了字节或计算,不证明资源仍允许访问。

安全卡本身证明搜索和工具输出不能被信任

安全卡专门评估了连接器与 function-calling 中的已知 Prompt Injection:攻击指令被嵌在工具输出里,试图覆盖 system、developer 或 user 指令。官方同时说明这些评测是训练数据的切分,不能代表对新型攻击的泛化;GPT-5.4 reasoning 在 email connector 攻击上改善,但在 function cell 攻击上略有回退。

这组披露比“模型更抗注入”更重要。工具说明、搜索命中、网页、邮件、表格单元格、截图文字和工具返回都可能带有攻击内容;模型层成绩存在类别差异,也不能覆盖未知攻击。目录条目一旦允许第三方自由编写,就可能通过关键词堆叠冒充高相关工具,或在 description 中诱导模型绕过审批。Tool Search 缩小了上下文,却把“哪个不可信定义被加载”变成新的攻击面。

安全卡还报告了避免意外破坏性动作和 Computer Use 用户确认评测,但这些仍是厂商环境结果。模型更会区分自己与用户改动,不等于它永远能识别共享工作区的最新所有者;训练模型请求确认,也不等于批准后执行的坐标、页面或对象仍与批准时相同。

任务判断

具体任务:供应商发票差异调查与付款草稿

假设一家连锁企业的财务运营每天需要处理供应商发票差异。订单在采购 API,收货记录在仓储系统,合同在文档库,部分历史 ERP 只有网页界面。交付物是差异原因、逐项证据、建议处理方式和一张付款草稿;Agent 可以读取资料、操作隔离浏览器并创建草稿,不能提交付款、修改供应商银行账户或关闭争议单。

这个任务同时具备采用两种能力的理由。连接器数量很多,但每张发票通常只需要采购、仓储、合同和 ERP 中的两三个工具,Tool Search 可以减少无关 schema。旧 ERP 没有稳定 API,Computer Use 可以读取指定页面和填写可撤销草稿。最终金额、币种、收款方与状态又都有权威系统可回读,适合定义验证器。

但技术路径不能由模型自由选择。优先级应是:稳定只读 API 高于 Computer Use;确定性计算高于模型推断;可撤销草稿高于直接提交;无法确认页面身份、对象版本或金额时转人工。若 ERP 提供可靠 API,就不应为了展示 Computer Use 改走像素路径;若差异可由三条 SQL 规则解释,也不应让 Agent 浏览十个系统。

任务合同可以预先写成:

input:
  invoice_id + tenant + evidence_snapshot + catalog_version
allowed:
  search allowlisted tools
  read purchase / receipt / contract
  read legacy ERP in isolated browser
  create payment_draft <= approved invoice amount
denied:
  submit payment
  edit supplier bank account
  dismiss dispute
  export unrelated tenant data
completion:
  every difference has a cited authoritative record
  draft fields equal verified calculation
  authoritative system confirms status = DRAFT
  no denied action and no unexplained UI transition

在模型调用前就固定这些约束,才能区分“模型完成了调查”和“模型说自己完成了调查”。登录、MFA、CAPTCHA、银行账户变更、付款提交和页面身份不明都必须暂停;用户临时说“顺便付掉”不能扩大本次 approval scope。

最小决策表

条件 建议路径 原因
有稳定 API 且结果可校验 结构化工具 参数、权限和回执更容易验证
无 API,但界面稳定且只读/可撤销 Computer Use + 单步验证 用像素路径弥补遗留系统接口缺口
工具很多,每个任务只需少数 Tool Search + 小 top_k 避免全部 schema 常驻上下文
权限依赖用户、租户或资源状态 搜索前过滤 + 执行前重新授权 排名不能代替 ACL
动作为付款、删除、发布或身份变更 真人批准或人工执行 错误不可逆且责任必须明确
低频、界面频繁变化、没有验收状态 不采用 Agent 维护与事故成本可能高于人工

工程影响

控制架构:发现、授权、执行和验证四权分离

建议把模型放在 planner,而不是权限根节点。完整链路是:入口服务固定任务和证据快照;目录服务只返回当前主体可发现的候选;模型选择后取回不可变 schema;策略服务对规范化参数授权;执行器在 API 或隔离 Computer Use 通道执行一个受限步骤;验证器从权威系统确认结果;审计账本记录每一次转换。

工具搜索返回的是候选,不是 capability token。即使某工具排在第一,策略服务仍可能因租户、时间、数据级别、动作风险或资源版本拒绝。反过来,工具没有进入搜索结果也不应靠模型猜名称直接调用。发现权限、读取 schema 权限与执行权限要分别判断。

Computer Use 通道还要把“意图批准”和“坐标执行”拆开。批准对象应是 create payment draft for invoice X, amount Y,而不是“点击 (842, 611)”。执行前确认页面 origin、账户、发票 ID 与 DOM/截图锚点;执行后回读草稿 ID 和字段。页面变化导致坐标指向“提交付款”时,语义门禁必须阻止动作。

授权绑定的是规范化动作,不是自然语言同意

一个可消费的 approval 至少绑定:

principal + tenant + task_id
+ tool_id + schema_hash + canonical_arguments_hash
+ resource_id + expected_resource_version
+ policy_version + max_effect + expires_at + nonce

批准之后若工具 schema、金额、收款方、页面 origin、资源版本或策略任一变化,就重新评估。approval 只消费一次,执行器以 trusted session 注入身份,不接受模型参数中的 user_idroletenant 作为可信声明。平台/开发者 confirmation policy 可用于提醒模型何时停下,但真正的 allow/deny 来自独立策略服务。

缓存必须带版本和权限边界

目录结果建议按 tenant + principal_scope_hash + catalog_version + policy_version + normalized_query 建键,并在撤权时推进 revocation_epoch。不要把 A 用户搜索到的财务工具直接返回给 B 用户,也不要因为目录缓存命中而省略执行前授权。

schema 缓存按 tool_id + schema_version + schema_hash 保存不可变对象。工具作者若做破坏性修改,应发布新版本而不是覆盖旧内容;任务 trace 固定实际 hash。模型前缀缓存只放稳定策略和轻量目录元数据,不放短期凭据、审批 token 或跨租户数据。评测必须分别报告冷启动与热缓存,否则平均延迟会掩盖首个任务的 schema 取回成本。

搜索污染要在进入模型前治理

目录只接收受信注册流程发布的工具,保存 owner、签名、版本、数据分类与风险标签。索引前将可检索描述与可执行 schema 分开;限制名称碰撞、关键词重复、隐藏字符和超长 description。搜索先按租户、主体和数据边界过滤,再排序;top_k 保持小且固定,未入选工具不得被模型按名称旁路调用。

负向集至少包含:恶意 MCP server 把“忽略审批”写进 description;低权限工具冒充官方财务连接器;旧版本以关键词堆叠压过新版本;网页和表格单元格注入新工具指令;同名工具来自不同租户;权限刚撤销但搜索缓存仍热。目标不是让模型解释攻击,而是证明污染条目不能获得执行能力。

代码示意:模型只能提交候选,执行器持有权限

下面是本站的 TypeScript 架构示意,不是 OpenAI SDK 的可复制调用,也不声称复现首发 API:

type TaskContext = {
  taskId: string;
  principal: string;
  tenant: string;
  catalogVersion: string;
  policyVersion: string;
  evidenceSnapshot: string;
};

async function executePlannedStep(ctx: TaskContext, intent: string) {
  const candidates = await catalog.search({
    query: intent,
    tenant: ctx.tenant,
    principal: ctx.principal,
    catalogVersion: ctx.catalogVersion,
    limit: 5,
  });

  // The model chooses only from the ACL-filtered, versioned candidate set.
  const proposal = await planner.propose({ intent, candidates });
  const manifest = await catalog.getPinnedManifest({
    toolId: proposal.toolId,
    version: proposal.toolVersion,
    expectedHash: proposal.schemaHash,
  });
  const args = manifest.schema.parse(proposal.arguments);

  const decision = await policy.authorize({
    ...ctx,
    toolId: manifest.id,
    schemaHash: manifest.hash,
    argumentsHash: canonicalHash(args),
    expectedResourceVersion: args.expectedVersion,
  });
  if (!decision.allowed) return audit.denied(ctx, proposal, decision);

  const before = await verifier.captureAuthorityState(manifest, args);
  const receipt =
    manifest.kind === "computer"
      ? await isolatedComputer.executeOneSemanticAction({
          intent: manifest.toSemanticIntent(args),
          approval: decision.oneTimeApproval,
          allowedOrigins: decision.allowedOrigins,
        })
      : await toolExecutor.call({
          manifest,
          args,
          identity: decision.delegatedIdentity,
          idempotencyKey: ctx.taskId,
        });
  const after = await verifier.reconcile(manifest, args, receipt);

  return audit.append({ ctx, candidates, proposal, manifest, decision, before, receipt, after });
}

这里故意没有让模型持有浏览器 cookie、服务凭据或 approval 签名。catalog.search 的结果、manifest 与模型参数都按不可信输入处理;policy.authorize 使用可信会话中的主体;reconcile 从 ERP、支付或采购系统回读,而不是让模型观察自己刚写的页面后宣布成功。

审计要支持重放决定,而不只是回看一段视频

可重放 trace 至少保存:任务输入与证据快照 hash、模型标识和参数、system/developer prompt hash、目录与索引版本、规范化搜索 query、候选 ID 与原始排名、实际加载的 schema hash、模型 proposal、策略输入与 reason code、approval nonce、执行器版本、每步 observation hash、语义动作、工具回执、权威状态前后版本和验证器结果。

Computer Use 的录屏和截图有帮助,但不是完整审计。像素可能包含隐私,页面也会变化;长期记录应保存必要区域的脱敏图、完整文件的受控引用与 hash,并把动作关联到语义对象。重放分两种:decision replay 用冻结目录、schema、策略和 observation 检查当时为何选择/拒绝;effect reconciliation 查询权威系统确认副作用。对真实付款不做再次执行式重放。

超时必须进入 unknown。若点击后网络中断,不能自动再点一次;先用 task ID、草稿 ID 或幂等键查询 ERP。只有权威状态证明未创建,且 approval 仍有效,才允许重试。审计日志若只记录模型最后一句“完成”,无法恢复这种中间状态。

评测要把模型、搜索、执行与恢复拆开

建议先构造一个拟议离线集,而不是直接接生产。可以固定 180 张去标识化发票任务:60 张只需结构化工具,60 张必须经过遗留 UI,60 张包含撤权、schema 漂移、页面变更、恶意工具描述、注入式文档、超时和重复回执。每条样本固定证据快照、允许工具、禁止动作、权威答案和可接受的 needs_human

单变量矩阵至少包括:同一模型与任务比较“全部 schema 注入”和 Tool Search;同一业务步骤比较 API 与 Computer Use;同一目录比较干净索引与污染索引;同一请求比较冷/热 schema cache;同一失败比较直接重试与先对账。不得一组同时更换模型、Prompt、工具和数据后把差异归因给 Tool Search。

核心指标分五组:

  • 交付:经权威状态证明的任务完成率、证据支持率、金额与对象完全一致率、needs_human 合理率。
  • 安全:未授权副作用率、应确认动作召回率、不必要确认率、跨租户暴露数、注入或目录污染取得执行能力的次数。
  • 搜索与缓存:正确工具进入 top_k 的比例、实际选中正确率、schema 取回次数、搜索轮次、总 input token、前缀缓存命中率、撤权后的陈旧命中数。
  • 运行与恢复:P50/P95 端到端延迟、Computer Use 步数、坐标/页面漂移失败、unknown 数量与目标时间内对账率、审计字段完整率、decision replay 一致率。
  • 经济性:模型与工具费用、浏览器分钟、索引/连接器维护、失败重试、人工复核分钟,以及每个经验证合格任务的总成本。

任何未授权副作用、跨租户泄露或批准外付款都应是硬失败,不能被平均完成率抵消。OpenAI 报告的 47% token 降幅可以作为待挑战假设;只有本站矩阵在相同任务准确率下复现,才可升级为 reproduced

商业价值

可能付费的是系统碎片化、跨应用调查量大、但结果可以验收的企业团队:财务共享中心、采购运营、保险理赔、BPO、内部 IT 服务台,以及维护大量 SaaS 连接器的平台。Tool Search 可能降低大目录的上下文与维护摩擦;Computer Use 可以覆盖暂时没有 API 的长尾系统。两者增强的是“查找证据、跨系统搬运和创建草稿”,不是替代付款责任人或系统所有者。

成本不能只看模型 token:

每个经验证合格任务成本
= 模型 input / cached input / output
+ 目录索引、schema registry 与 MCP 连接器维护
+ 隔离浏览器、网络、录屏脱敏、存储与观测
+ 搜索失败、页面漂移、超时对账和重试
+ 人工确认、复核、返工与事故响应
+ 权限治理、评测、版本升级与审计摊销

收益成立需要五个条件:任务频率足以摊薄连接器与评测维护;绝大多数动作是只读或可撤销草稿;最终状态可从权威系统检查;人工当前确实花大量时间在切换系统而不是专业判断;错误样本能进入回归。Tool Search 节省的 token 若只占总成本很小,或者 Computer Use 每周因 UI 变化返工,商业价值就不会成立。

建议做 8 周受控试点。前两周冻结任务集、目录、schema 和人工基线;第 3 至 4 周只做离线搜索与 UI 沙箱;第 5 至 6 周影子调查真实任务,不写业务系统;第 7 至 8 周只允许创建付款草稿并逐条人工批准。扩量门槛可预先设为:未授权副作用与跨租户暴露均为 0;所有 unknown 在 30 分钟内对账或升级;经验证完成率不低于人工基线;人工处理分钟下降至少 20%;单位合格任务成本低于节省的人工与等待成本。这些都是待验证目标,不是现有成绩。

不应采用的场景包括:稳定 API 或规则流程已经低价解决;任务低频且页面频繁改版;无法隔离凭据与租户数据;结果没有权威状态;必须毫秒返回;或一次误操作就会产生不可撤销的高额损失。此时 Computer Use 只是把接口缺失转化成更难测试的像素依赖,Tool Search 也只是给过大的工具目录增加一个概率检索层。

未来 6 至 18 个月的判断是:Tool Search 类按需 schema 机制可能成为大型 Agent 平台的常规能力,Computer Use 会主要补足没有 API 的长尾界面,而不是取代稳定 API。成立条件是工具目录能够版本化、权限与检索解耦、观察/动作有标准 trace,且模型在真实 UI 变化下的人工接管率持续下降。若连接器标准化速度快于 Computer Use 稳定性提升,或审计与维护成本长期高于人工切换成本,这个判断失效。

局限与风险

第一,本文没有调用 GPT-5.4,也没有复现原生 Computer Use、Tool Search、1M 上下文或 token 效率。所有性能数字均来自 OpenAI 首发页;MCP Atlas 的 47% 只覆盖该页面描述的 250 个任务、36 个 server 与两种配置,不能承诺任意企业目录同样节省。

第二,Computer Use Benchmark 是固定环境。截图分辨率、DOM 可用性、浏览器状态、网络、地区、A/B 页面和身份验证都会改变结果。模型能发出鼠标键盘动作,不代表动作具有业务语义、幂等性或可撤销性。

第三,安全卡的 Prompt Injection 数据来自训练数据切分,官方明确说不能代表对新攻击的泛化,并报告不同攻击面的改善与回退并不一致。不能用单个平均安全分数取消目录治理、内容隔离、独立授权与负向测试。

第四,developer message 中的 confirmation policy 仍由模型遵循。平台级策略可以更高优先级,但企业审批必须由模型外的策略和身份系统执行;自然语言“用户同意了”不是授权凭据。

第五,按需 schema 会引入目录和版本竞态。搜索时是 v3、执行前被覆盖为 v4,或撤权后旧结果仍在 cache,都可能造成审计不一致。只有不可变 manifest、hash、短期 cache 和执行前重新授权能收敛。

第六,完整 Computer Use 轨迹可能收集密码、个人信息、邮件和合同。录屏不能无限保留;需要字段级脱敏、最小化采集、访问审计、保留期限和删除证明。为了可重放而保存更多数据,本身会增加风险。

第七,本文严格停在 2026 年 3 月 7 日。ChatGPT 上下文当日未扩大,Codex 的 1M 仍是 experimental;后续模型、SDK、工具协议、价格、Benchmark 修订和产品开放范围都属于新事件,应单独复核,不能反向改写首发状态。

面试表达

30 秒结论: GPT-5.4 把原生 Computer Use 和 Tool Search 放进同一次通用模型发布。前者让模型能根据截图或 Playwright 操作界面,后者从预装全部 schema 改为需要时搜索并加载定义。它们减少了遗留 UI 和大工具目录的接入摩擦,却把目录版本、授权、缓存污染、审批和审计重放变成控制平面责任;搜索到工具不等于有权调用,模型请求确认也不等于业务批准。

3 分钟架构: 我会先固定任务、主体、租户、证据与目录版本,搜索只在 ACL 过滤后的工具中进行;选中后取不可变 schema,用规范化参数向独立策略服务申请一次性 approval。稳定 API 优先,遗留 UI 才进入隔离 Computer Use,每次只执行一个语义动作,并在前后核对 origin、对象和权威状态。Trace 保存 query、排名、schema hash、策略 reason、observation hash、回执和业务版本,超时进入 unknown 先对账。评测比较全 schema 与 Tool Search、API 与 UI、冷/热 cache 和干净/污染目录,按经验证任务成本而非 token 单价验收。

若追问“官方说 Tool Search preserves the cache,为什么还要自己设计缓存”,答案是厂商说明的是 Prompt token 与稳定前缀收益,不知道企业的租户、撤权和 schema 版本;cache hit 不能跳过当前授权。若追问“模型会按 confirmation policy 停下,为什么还要 policy engine”,答案是确认是概率行为,授权是确定性业务决定,二者失败责任和证明标准不同。

若追问“OSWorld 75% 是否可以直接替换 RPA”,答案是否定的:那是 OpenAI 在指定 Benchmark 下的报告,企业环境还有身份、页面漂移、并发状态、异常恢复和合规。RPA、API 与 Computer Use 应按任务选择,不能把模型能力榜当部署 SLA。

复盘

GPT-5.4 首发的工程信号不是“模型终于会点鼠标”,而是 Agent 的依赖从静态 Prompt 继续外移。工具定义可以运行时发现,界面可以成为执行面,模型可以在更长任务中选择动作;相应地,目录、schema、权限、缓存、审批、观测和业务状态都必须版本化。

Tool Search 降低上下文负担,同时让搜索排序影响可执行路径;Computer Use 扩大系统覆盖,同时把坐标错误变成业务副作用。两者共同要求一个不受模型文本控制的 control plane。全栈工程中的 API 合同、ACL、缓存失效、数据库乐观锁、幂等键、浏览器测试与审计事件,正好迁移为 Agent 系统的核心能力。

下一步可复现实验应固定可获得的 GPT-5.4 模型标识、SDK、Prompt、200 个版本化模拟工具和 60 个任务,对比全部 schema 与 Tool Search;另用本地确定性 ERP 测试页构造 30 个 Computer Use 任务,注入页面位移、弹窗、撤权、恶意工具描述、超时和提交后断线。保存原始 trace、token、缓存状态、截图 hash、权威结果和人工修订分钟。只有完整实验可以从干净基线重放且门禁通过,本文才有资格从 sourced 升级为 reproduced

方法披露

本文使用 AI 工具辅助抽取首发页与安全卡结构、检查 T+2 边界、设计控制平面代码和绘制原创架构图;作者逐项核对事件日期、发布面、Computer Use、Tool Search、上下文边界、厂商评测条件、安全卡限制和最终判断。文章没有调用 GPT-5.4、没有操作真实业务系统,也没有把官方演示或 Benchmark 写成本站实验。

文中的发票任务、180 条离线集、200 个模拟工具、60/30 个后续实验任务、8 周试点、指标与阈值均为可证伪的实验设计,不是已经取得的客户数据、性能结果或商业收益。

修订记录

  • 2026-03-07:初版发布;固定 2026-03-05 至 03-07 的首发页与安全卡证据,拆分原生 Computer Use、按需 Tool Search 与企业控制面,补充授权绑定、缓存版本、搜索污染、审计重放、任务级评测和商业门槛。

Source ledger

来源账本

以下来源用于核对事实、日期与当时可用范围。厂商自报性能不视为本站独立复现。

  1. Introducing GPT-5.4
    OpenAI官方一手来源同期证据来源发布:2026/03/05本站核验:2026/03/29
  2. Introducing GPT-5.4 release-day snapshot
    OpenAI (Internet Archive)历史页面存档同期证据来源发布:2026/03/05本站核验:2026/03/29
  3. GPT-5.4 Thinking deployment safety card
    OpenAI官方一手来源同期证据来源发布:2026/03/05本站核验:2026/03/29
  4. GPT-5.4 Thinking safety card release-day snapshot
    OpenAI (Internet Archive)历史页面存档同期证据来源发布:2026/03/05本站核验:2026/03/29

讨论

正在加载评论...