AI 产品与商业化

Claude 3 系列的真正信号:模型路由开始成为产品架构

以 2024 年 3 月 4 日至 6 日的一手资料为边界,区分 Claude 3 Opus、Sonnet、Haiku 的发布状态,并用企业工单任务推导质量、延迟与成本路由方法。

发布:2024/03/07更新:2024/03/23
企业任务先按风险和复杂度分类,再路由到快速、中档或高能力模型并通过验证与升级闭环
图 1:本站依据 Anthropic 2024-03-04 Claude 3 公告重绘;图示为任务路由设计,不代表 Anthropic 官方架构或本站性能数据。

时间与证据

本文研究的是 Anthropic 于 2024 年 3 月 4 日发布 Claude 3 系列。同期观察截止到 3 月 6 日。根据发布页与发布日快照,Opus 与 Sonnet 当日进入 Claude.ai 和 API,Haiku 被描述为即将推出,而不是首日可用。后来加入的 Tool Use、citations、Computer Use 或更大的上下文配置不能倒灌进这次发布。

Anthropic 用 Opus、Sonnet、Haiku 构成能力、速度与价格梯度,并报告新系列支持视觉输入。页面中的 Benchmark、速度、准确率与拒答改善都是厂商报告;本文没有保存 2024 年模型快照并在同一数据集上复测,因此证据等级为 sourced。历史页面可能变化,恢复首发语境时以 2024-03-04 14:36:50 UTC 的快照为准。

这篇文章不把“系列中存在三个名称”误写成“三个模型都已可调用”,也不把产品层的 Claude.ai 可用性与 API 契约混为一谈。首日工程决策能依赖的是 Opus、Sonnet 的实际开放声明和当时公开价格;Haiku 只能进入待验证配置,不应作为已经上线的生产降级路径。

当时发生了什么

Claude 3 的变化不只是一款旗舰模型超过上一代。更重要的是厂商明确把一个模型家族组织成不同服务档位:Opus 面向高复杂度任务,Sonnet 平衡能力与速度,Haiku 主打轻量快速。过去团队常用“最新版模型”作为单一配置,这次发布让模型选择更接近数据库读写分离或多级缓存:任务不必全部走最昂贵路径。

视觉输入也扩大了可处理对象。企业工单不再只有文本,还可能包含表单截图、发票、图表和设备照片。但“能看图片”不等于具有可靠 OCR、空间定位或合规审查能力。图片质量、缩放、遮挡和敏感信息都会改变结果,必须用目标文件评测。

官方还讨论了拒答与准确率改进,但这类指标要保留实验条件。减少不必要拒答可能改善可用性,却不能推出模型在企业策略下总会正确拒绝危险任务。模型自己的拒答只是一个信号,最终权限仍应由应用层执行。

因此,这次发布的工程信号是:模型路由成为一等系统组件。路由不仅按 token 价格,还要结合任务风险、复杂度、截止时间、可验证性和失败后的升级成本。模型家族提供候选档位,企业需要自己定义决策函数。

任务判断

设想一家 B2B 软件公司的客服团队每天处理三类工单:密码重置与套餐说明等标准问题;需要阅读日志和截图的故障定位;涉及退款、合同或数据删除的高风险请求。目标是在不降低准确性和审计能力的前提下缩短首次响应。

最省事的方案是全部调用 Opus,但它未必有最佳单位经济性。标准 FAQ 的答案可以由检索、规则和中档模型完成;复杂故障才需要更强推理;退款与删除即使使用旗舰模型也不能自动执行。相反,全部走 Sonnet 也不能仅凭平均 Benchmark 保证少数复杂任务。

当时可落地的路由实验应固定 Opus 与 Sonnet 两条可用路径,Haiku 保持 announced,待真实接口开放后再加入。入口分类器只使用低风险元数据和问题特征,不能让模型自行提高权限。路由结果必须通过任务级评测:标准问题检查政策引用和一次解决;故障工单检查根因证据与有效排障步骤;高风险工单检查是否正确升级人工。

一个可证伪的策略是:默认 Sonnet;当检索证据冲突、问题跨越多个服务、或验证器未通过时升级 Opus;任何产生不可逆业务副作用的请求都进入人工批准。若固定评测证明升级后正确率没有提高,或者等待和成本超过收益,就应移除升级;若 Sonnet 在某类任务持续失误,则该类应前置到 Opus 或规则流程。

不能把“模型自评置信度高”当作路由依据。可靠信号应来自可观察条件,例如检索覆盖、引用一致性、JSON schema 校验、工具只读结果和历史任务标签。自评可以作为弱特征,但不能单独批准退款或删除。

工程影响

模型网关应保存每次决策的原因,而不是只有最终模型名:

interface RoutingDecision {
  taskType: "faq" | "incident" | "high-risk";
  risk: "low" | "medium" | "high";
  candidateModels: string[];
  selectedModel: string;
  reasonCodes: string[];
  policyVersion: string;
  evaluationSetVersion: string;
  requiresHumanApproval: boolean;
}

配置中的模型必须对应带日期的能力快照。2024 年 3 月 4 日,Haiku 不能标记为 available。如果 SDK 或供应商后来复用了名称,历史日志仍应保留当时具体 snapshot 或观测日期,防止复盘时把新版本性能归给旧决策。

路由架构至少有四个环节:任务分类、能力与策略过滤、模型执行、结果验证。分类错误要单独统计,因为最终回答错误可能来自路由而非模型;验证失败必须允许升级或转人工,但要限制最大重试,防止两个模型互相调用造成成本失控。

成本模型也要包含失败与升级:

每个成功解决工单成本
= 首次模型调用
+ 升级模型调用
+ 检索和工具成本
+ 人工接管时间
+ 错误答复的返工与风险

如果廉价模型导致更多升级,名义 token 价格降低不一定带来总成本降低。相反,旗舰模型即使单次更贵,只要显著减少高价值故障的平均处理时间,也可能值得。必须按任务类型分桶,不能用全站平均掩盖长尾风险。

视觉输入需要独立预处理:文件病毒扫描、EXIF 清理、区域裁剪、OCR 对照和敏感信息遮盖。应用层要记录原图哈希和派生图版本,模型不能直接读取超出工单权限的附件。前端则应展示模型引用的截图区域与转人工状态,而不是只给一个流畅答案。

商业价值

愿意为模型路由付费的是拥有显著任务分层和调用规模的客服、文档处理、软件研发、保险与运营团队。它增强的是现有工作队列:简单任务自动草拟,复杂任务获得更强模型,高风险任务保留人工批准。价值来自把昂贵能力放到边际收益更高的位置。

收益成立需要稳定的任务标签、可自动验证的部分结果、足够请求量和可比较的模型档位。每天只有少量请求、所有任务都必须人工签字、或错误成本极高且无法自动验证的场景,不应为复杂路由平台投入过多。

企业的长期资产是路由策略、失败集、人工接管原因、真实解决时长和回归评测,而不是某个模型名称。供应商换代后可以用同一数据重算阈值。预测的 6 至 12 个月窗口内,若模型差价、任务分布和验证器共同使每个成功任务成本下降,路由创造价值;若供应商价格趋同或分类错误抵消收益,单一路线可能更简单可靠。

局限与风险

本文没有复现 Claude 3 历史 API,官方 Benchmark 不能直接代表中文客服、内部日志或截图任务。发布页只给出厂商选择的汇总指标,无法推导全部失败分布。Haiku 当时未上线,也就没有首日可用性证据。

路由增加系统复杂度:分类器、策略版本、回退和多模型日志都可能出错。低价模型的错误若没有验证器,会在规模上放大;旗舰模型也可能产生高置信错误。多模型还扩大数据处理方与区域合规面,必须在候选过滤阶段限制供应商。

此外,视觉能力可能让团队误把模型当 OCR 或事实核验器。金额、合同条款和身份信息应由专用解析与人工复核确认。本文提出的工单策略是实验设计,不是生产结果。

面试表达

30 秒版本: Claude 3 发布对我最重要的信号是模型家族路由,而不只是 Opus 的能力。首日 Opus 与 Sonnet 可用,Haiku 仍是即将推出。我会按任务风险与可验证性路由,默认中档模型,验证失败或复杂问题再升级,高风险副作用始终人工批准,并用每个成功工单总成本判断是否值得。

追问版本: 若问如何避免路由器本身犯错,我会保存策略版本与原因码,按任务类型统计分类错误,用检索覆盖和 schema 校验等可观察信号触发升级,而不是模型自信度。若 Opus 升级没有带来任务正确率提升,就通过评测移除,而不是迷信旗舰名称。

复盘

2024 年 3 月之后,模型迭代越来越快。把模型硬编码在业务服务中会让价格和能力变化直接冲击产品。路由层的真正作用是把任务合同与供应商解耦:模型是可替换执行器,风险、验证和人工批准属于企业控制面。

同期能够成立的是“Opus/Sonnet 已可用,模型家族提供分层信号”;不能成立的是“Haiku 已首日上线”或“一个官方 Benchmark 足以决定全部任务”。后续工具调用与更长上下文应作为新事件评测,不倒填到 Claude 3 首发。

方法披露

本文使用 AI 工具协助整理来源、构造路由反例和绘制原创机制图;作者核对发布状态、日期、限定语与商业判断。未运行历史模型,所有架构与指标均标为工程设计。

修订记录

  • 2024-03-07:初版发布;固定 2024-03-04 至 2024-03-06 的 Claude 3 首发边界,明确 Haiku 尚未上线,并建立以任务风险、验证和总解决成本为核心的路由框架。

Source ledger

来源账本

以下来源用于核对事实、日期与当时可用范围。厂商自报性能不视为本站独立复现。

  1. Introducing the next generation of Claude
    Anthropic官方一手来源同期证据来源发布:2024/03/04本站核验:2024/03/23
  2. Claude 3 announcement release-day snapshot
    Anthropic (Internet Archive)历史页面存档同期证据来源发布:2024/03/04本站核验:2024/03/23

讨论

正在加载评论...