AI 产品与商业化
Claude 3 系列的真正信号:模型路由开始成为产品架构
以 2024 年 3 月 4 日至 6 日的一手资料为边界,区分 Claude 3 Opus、Sonnet、Haiku 的发布状态,并用企业工单任务推导质量、延迟与成本路由方法。
时间与证据
本文研究的是 Anthropic 于 2024 年 3 月 4 日发布 Claude 3 系列。同期观察截止到 3 月 6 日。根据发布页与发布日快照,Opus 与 Sonnet 当日进入 Claude.ai 和 API,Haiku 被描述为即将推出,而不是首日可用。后来加入的 Tool Use、citations、Computer Use 或更大的上下文配置不能倒灌进这次发布。
Anthropic 用 Opus、Sonnet、Haiku 构成能力、速度与价格梯度,并报告新系列支持视觉输入。页面中的 Benchmark、速度、准确率与拒答改善都是厂商报告;本文没有保存 2024 年模型快照并在同一数据集上复测,因此证据等级为 sourced。历史页面可能变化,恢复首发语境时以 2024-03-04 14:36:50 UTC 的快照为准。
这篇文章不把“系列中存在三个名称”误写成“三个模型都已可调用”,也不把产品层的 Claude.ai 可用性与 API 契约混为一谈。首日工程决策能依赖的是 Opus、Sonnet 的实际开放声明和当时公开价格;Haiku 只能进入待验证配置,不应作为已经上线的生产降级路径。
当时发生了什么
Claude 3 的变化不只是一款旗舰模型超过上一代。更重要的是厂商明确把一个模型家族组织成不同服务档位:Opus 面向高复杂度任务,Sonnet 平衡能力与速度,Haiku 主打轻量快速。过去团队常用“最新版模型”作为单一配置,这次发布让模型选择更接近数据库读写分离或多级缓存:任务不必全部走最昂贵路径。
视觉输入也扩大了可处理对象。企业工单不再只有文本,还可能包含表单截图、发票、图表和设备照片。但“能看图片”不等于具有可靠 OCR、空间定位或合规审查能力。图片质量、缩放、遮挡和敏感信息都会改变结果,必须用目标文件评测。
官方还讨论了拒答与准确率改进,但这类指标要保留实验条件。减少不必要拒答可能改善可用性,却不能推出模型在企业策略下总会正确拒绝危险任务。模型自己的拒答只是一个信号,最终权限仍应由应用层执行。
因此,这次发布的工程信号是:模型路由成为一等系统组件。路由不仅按 token 价格,还要结合任务风险、复杂度、截止时间、可验证性和失败后的升级成本。模型家族提供候选档位,企业需要自己定义决策函数。
任务判断
设想一家 B2B 软件公司的客服团队每天处理三类工单:密码重置与套餐说明等标准问题;需要阅读日志和截图的故障定位;涉及退款、合同或数据删除的高风险请求。目标是在不降低准确性和审计能力的前提下缩短首次响应。
最省事的方案是全部调用 Opus,但它未必有最佳单位经济性。标准 FAQ 的答案可以由检索、规则和中档模型完成;复杂故障才需要更强推理;退款与删除即使使用旗舰模型也不能自动执行。相反,全部走 Sonnet 也不能仅凭平均 Benchmark 保证少数复杂任务。
当时可落地的路由实验应固定 Opus 与 Sonnet 两条可用路径,Haiku 保持 announced,待真实接口开放后再加入。入口分类器只使用低风险元数据和问题特征,不能让模型自行提高权限。路由结果必须通过任务级评测:标准问题检查政策引用和一次解决;故障工单检查根因证据与有效排障步骤;高风险工单检查是否正确升级人工。
一个可证伪的策略是:默认 Sonnet;当检索证据冲突、问题跨越多个服务、或验证器未通过时升级 Opus;任何产生不可逆业务副作用的请求都进入人工批准。若固定评测证明升级后正确率没有提高,或者等待和成本超过收益,就应移除升级;若 Sonnet 在某类任务持续失误,则该类应前置到 Opus 或规则流程。
不能把“模型自评置信度高”当作路由依据。可靠信号应来自可观察条件,例如检索覆盖、引用一致性、JSON schema 校验、工具只读结果和历史任务标签。自评可以作为弱特征,但不能单独批准退款或删除。
工程影响
模型网关应保存每次决策的原因,而不是只有最终模型名:
interface RoutingDecision {
taskType: "faq" | "incident" | "high-risk";
risk: "low" | "medium" | "high";
candidateModels: string[];
selectedModel: string;
reasonCodes: string[];
policyVersion: string;
evaluationSetVersion: string;
requiresHumanApproval: boolean;
}
配置中的模型必须对应带日期的能力快照。2024 年 3 月 4 日,Haiku 不能标记为 available。如果 SDK 或供应商后来复用了名称,历史日志仍应保留当时具体 snapshot 或观测日期,防止复盘时把新版本性能归给旧决策。
路由架构至少有四个环节:任务分类、能力与策略过滤、模型执行、结果验证。分类错误要单独统计,因为最终回答错误可能来自路由而非模型;验证失败必须允许升级或转人工,但要限制最大重试,防止两个模型互相调用造成成本失控。
成本模型也要包含失败与升级:
每个成功解决工单成本
= 首次模型调用
+ 升级模型调用
+ 检索和工具成本
+ 人工接管时间
+ 错误答复的返工与风险
如果廉价模型导致更多升级,名义 token 价格降低不一定带来总成本降低。相反,旗舰模型即使单次更贵,只要显著减少高价值故障的平均处理时间,也可能值得。必须按任务类型分桶,不能用全站平均掩盖长尾风险。
视觉输入需要独立预处理:文件病毒扫描、EXIF 清理、区域裁剪、OCR 对照和敏感信息遮盖。应用层要记录原图哈希和派生图版本,模型不能直接读取超出工单权限的附件。前端则应展示模型引用的截图区域与转人工状态,而不是只给一个流畅答案。
商业价值
愿意为模型路由付费的是拥有显著任务分层和调用规模的客服、文档处理、软件研发、保险与运营团队。它增强的是现有工作队列:简单任务自动草拟,复杂任务获得更强模型,高风险任务保留人工批准。价值来自把昂贵能力放到边际收益更高的位置。
收益成立需要稳定的任务标签、可自动验证的部分结果、足够请求量和可比较的模型档位。每天只有少量请求、所有任务都必须人工签字、或错误成本极高且无法自动验证的场景,不应为复杂路由平台投入过多。
企业的长期资产是路由策略、失败集、人工接管原因、真实解决时长和回归评测,而不是某个模型名称。供应商换代后可以用同一数据重算阈值。预测的 6 至 12 个月窗口内,若模型差价、任务分布和验证器共同使每个成功任务成本下降,路由创造价值;若供应商价格趋同或分类错误抵消收益,单一路线可能更简单可靠。
局限与风险
本文没有复现 Claude 3 历史 API,官方 Benchmark 不能直接代表中文客服、内部日志或截图任务。发布页只给出厂商选择的汇总指标,无法推导全部失败分布。Haiku 当时未上线,也就没有首日可用性证据。
路由增加系统复杂度:分类器、策略版本、回退和多模型日志都可能出错。低价模型的错误若没有验证器,会在规模上放大;旗舰模型也可能产生高置信错误。多模型还扩大数据处理方与区域合规面,必须在候选过滤阶段限制供应商。
此外,视觉能力可能让团队误把模型当 OCR 或事实核验器。金额、合同条款和身份信息应由专用解析与人工复核确认。本文提出的工单策略是实验设计,不是生产结果。
面试表达
30 秒版本: Claude 3 发布对我最重要的信号是模型家族路由,而不只是 Opus 的能力。首日 Opus 与 Sonnet 可用,Haiku 仍是即将推出。我会按任务风险与可验证性路由,默认中档模型,验证失败或复杂问题再升级,高风险副作用始终人工批准,并用每个成功工单总成本判断是否值得。
追问版本: 若问如何避免路由器本身犯错,我会保存策略版本与原因码,按任务类型统计分类错误,用检索覆盖和 schema 校验等可观察信号触发升级,而不是模型自信度。若 Opus 升级没有带来任务正确率提升,就通过评测移除,而不是迷信旗舰名称。
复盘
2024 年 3 月之后,模型迭代越来越快。把模型硬编码在业务服务中会让价格和能力变化直接冲击产品。路由层的真正作用是把任务合同与供应商解耦:模型是可替换执行器,风险、验证和人工批准属于企业控制面。
同期能够成立的是“Opus/Sonnet 已可用,模型家族提供分层信号”;不能成立的是“Haiku 已首日上线”或“一个官方 Benchmark 足以决定全部任务”。后续工具调用与更长上下文应作为新事件评测,不倒填到 Claude 3 首发。
方法披露
本文使用 AI 工具协助整理来源、构造路由反例和绘制原创机制图;作者核对发布状态、日期、限定语与商业判断。未运行历史模型,所有架构与指标均标为工程设计。
修订记录
2024-03-07:初版发布;固定 2024-03-04 至 2024-03-06 的 Claude 3 首发边界,明确 Haiku 尚未上线,并建立以任务风险、验证和总解决成本为核心的路由框架。
Source ledger
来源账本
以下来源用于核对事实、日期与当时可用范围。厂商自报性能不视为本站独立复现。
讨论