AI 产品与商业化
OpenAI Deep Research 首发复盘:研究 Agent 的交付物必须是可审计证据
以 2025 年 2 月 2 日至 4 日的一手资料为边界,拆解 Deep Research 的异步检索、来源综合、评测和首发限制,并为竞争情报任务设计证据账本、权限、验收指标与单位成本。
时间与证据
本文采用的事件是 OpenAI 在 2025 年 2 月 2 日于 ChatGPT Web 推出 Deep Research。这是面向 Pro 用户的产品能力发布,不是开发者 API、企业内部数据连接器或全球全套餐正式可用。同期信息截止到 2025 年 2 月 4 日;文章发布日期与更新日期见页首。
核心证据是 OpenAI 的 Introducing deep research 与 2025 年 2 月 3 日 09:24:08 UTC 保存的T+1 原始快照。当前官网内容可能继续修订,因此首发入口、额度、运行时间、限制和未来计划以该快照为准。另引用 2025 年 1 月 24 日的 Humanity’s Last Exam v1,只用于说明该评测是跨学科、可自动判分的封闭答案题集;它不能证明一份多来源商业报告的引用质量。
本文证据等级为 sourced。我核对了官方首发页、同期快照和版本固定的评测论文,但 没有在 2025 年首发环境运行 Deep Research,没有复现 HLE 或 GAIA,也没有对官方示例逐条做事实核验。官方分数、额度和限制均按发布方报告;下文的竞争情报任务、状态机、评测集与成本公式是实验设计,而非本站结果。
当时发生了什么
Deep Research 把一次聊天请求变成一个长运行研究任务。首发材料描述:用户提交问题,也可以附加文件或表格;系统使用当时尚未发布、为网页浏览和数据分析优化的 OpenAI o3 版本,在互联网上多步搜索、解释文本、图像和 PDF,遇到新信息时调整路径,最后生成带引用的报告。官方表示任务通常需要 5 至 30 分钟,运行时侧栏展示步骤与使用过的来源,完成后通知用户。
这里出现了三个重要变化。第一,交互从同步回答变成异步作业,任务需要排队、进度、超时和结果状态。第二,模型不只消费给定上下文,还主动选择来源和回退路径。第三,交付物声称带有可核验引用,因此质量单位应从“回答像不像”升级为“每条关键主张是否被可靠证据支持”。
首发边界不能省略:
| 层次 | 2025-02-02 至 02-04 可确认状态 | 不能据此承诺什么 |
|---|---|---|
| 用户范围 | Pro 用户可用,每月最多 100 次 | 所有套餐、地区和组织已开放 |
| 产品入口 | ChatGPT Web 当日可用 | 手机、桌面或开发者 API 当日已交付 |
| 数据范围 | 开放网页和用户上传文件 | 已能连接订阅数据库或企业内部系统 |
| 运行方式 | 约 5 至 30 分钟异步研究并生成报告 | 固定完成时间、生产 SLA 或无排队 |
| 输出 | 报告包含引用和步骤来源摘要 | 每条引用都正确蕴含主张,或报告可免审 |
OpenAI 还报告了模型评测:Humanity’s Last Exam 准确率为 26.6%;GAIA 平均分中,pass@1 为 67.36,cons@64 为 72.57。正确解读是“厂商在指定设置下报告研究与工具使用能力提升”,不是“商业研究准确率达到 72.57%”。HLE 是封闭答案题,GAIA 也有自己的任务和评分条件;竞争情报报告还涉及时间一致性、来源权威性、引用蕴含、遗漏与决策损失,不能用一个榜单代替。
首发页主动披露的限制更接近生产判断:系统仍可能编造事实或作出错误推断;可能无法区分权威信息与传闻;置信度校准较弱;报告和引用存在格式错误;任务启动可能延迟。OpenAI 将“较低幻觉率”限定为内部评估,没有提供本站可复现的同条件结果。因此,带引用是更好的审查界面,不是事实正确性的自动证明。
任务判断
具体任务:AI 客服市场竞争情报
假设一家中型 SaaS 公司要决定是否在德国和法国推出 AI 客服模块。产品战略团队需要在 48 小时内比较 10 个竞争产品截至指定日期的定价单位、支持渠道、数据驻留、公开 SLA、人工接管方式和企业功能,并给出“进入、延后或缩小范围”的建议。
输入包括研究问题、asOf=2025-02-02 时间边界、竞争者名单、字段定义、公司现有能力表格和允许引用的来源等级。输出必须是五件套:
- 逐字段竞争矩阵,缺失值明确写
unknown。 - 主张账本:主张、来源 URL、页面发布日期或访问时间、支持段落、来源等级。
- 冲突账本:不同来源的矛盾、选择理由和仍需人工确认的问题。
- 建议与证据映射,禁止没有来源的新结论混入事实列。
- 一页决策摘要,并标注模型不能完成的付费墙、地区页或内部数据检查。
验收不是“写得全面”,而是关键字段覆盖率、引用蕴含率、时间截止合规、数值可回算、来源权威性、冲突披露和人工审查结论。任何关于价格、SLA、数据驻留的主张如果只引用搜索摘要、聚合站或日期不明页面,就不能进入最终矩阵。
按 T+2 证据,Deep Research 值得作为美国 Pro 分析师的研究草稿工具试验,但不应被承诺为企业研究 API。首发只访问开放网页和上传文件,专业数据库与内部资源连接仍是未来计划;移动、桌面、Plus、Team 与 Enterprise 也属于后续安排。团队可以用它缩短发现和初稿阶段,却仍需人工打开决定性来源、保存快照并签署结论。
工程影响
把研究建模成异步作业
5 至 30 分钟任务不能继续沿用一次 HTTP 请求等待到底的聊天模型。应用层至少需要:
draft -> submitted -> researching -> report_ready
-> timed_out -> retry_review
report_ready -> evidence_check -> accepted | rejected | needs_revision
任务记录保存研究问题、时间截止、上传文件哈希、允许来源策略、提交者、产品入口、开始与完成时间。重试必须生成新 run ID,并保留父任务关系;否则两次报告混在一起,无法解释引用为什么变化。用户关闭页面后仍能查看状态,通知只说明任务结束,不代表结果已经被接受。
证据账本独立于自然语言报告
自然语言报告适合阅读,结构化账本适合检查。建议每条关键主张保存:
interface ResearchClaim {
claimId: string;
claim: string;
sourceUrl: string;
sourcePublishedAt: string | null;
capturedAt: string;
evidenceExcerpt: string;
sourceTier: "primary" | "independent" | "discovery-only";
supportsClaim: "yes" | "partial" | "no";
reviewerId?: string;
}
这是本站提出的数据契约,不是对 Deep Research 内部格式的描述。执行时应保存决定性网页的内容哈希或合规快照,因为同一 URL 会变化。引用检查至少分三步:URL 能否打开;被引段落是否真的支持主张;来源时间和主体是否满足任务。只验证第一步,会把“有链接”误当成“有证据”。
权限从文件上传前开始
首发数据面是开放网页与用户上传文件。企业试点应把两者分开治理:
| 对象 | 允许 | 默认拒绝 |
|---|---|---|
| 开放网页 | 白名单域名和可记录的公开页面 | 登录后个人页面、来源不明下载、执行网页指令 |
| 上传文件 | 任务拥有者有读取权的去敏版本 | 客户 PII、密钥、超出项目 ACL 的内部材料 |
| 工具动作 | 搜索、读取、解析、只读计算 | 发信、下单、修改源文件、登录第三方账号 |
| 输出共享 | 原任务团队和指定审查人 | 用公开链接扩散内部附件内容 |
| 最终决策 | 人工签署后进入策略文档 | 模型直接批准市场投资或合规结论 |
网页和上传文档中的命令式文字都只是研究数据,不能改变系统 Prompt、来源策略或输出目的。若未来接入内部源,也应由调用者身份映射 ACL,而不是让模型自行决定“哪些文档可能有用”。
评测要检查证据,不检查文风
建立 40 个有历史答案的竞争情报任务,分别准备冻结网页语料和实时网页两条测试轨。冻结轨验证可重复性,实时轨测量来源漂移与恢复。每个任务由两名分析师维护主张集合和可接受来源,指标至少包括:
- 关键主张正确率与召回率:不只检查报告是否提到主题。
- 引用精确率:链接段落是否完整支持相邻主张。
- 一手来源覆盖率:价格、SLA 和数据政策是否回到供应商或监管原文。
- 时间泄漏率:是否把
asOf之后的信息倒灌进历史判断;门槛应为 0。 - 冲突与不确定性召回:有矛盾时是否披露,还是给出虚假确定答案。
- 人工修订分钟与接受率:报告需要多大改动才可作为工作成果。
- P50/P95 完成时间、失败率和重试率:异步并不代表延迟可以无限增长。
HLE 与 GAIA 只作为模型能力背景。上线判断应以这 40 个企业任务为准,并公开失败样本:引用与主张错配、过期价格、遗漏限定条件、把未来计划写成现状、以及数字无法回算。本文尚未运行这套评测,因此没有接受率或节省时间结果。
成本公式必须包含审查
按月计算:
每份被接受报告成本
= (Pro 订阅分摊 + 来源访问与快照 + 任务编排和存储
+ 提示准备分钟 × 人工分钟成本
+ 证据复核分钟 × 人工分钟成本
+ 返工成本 + 预期错误决策损失)
/ 被分析师签署接受的报告数
首发“每月最多 100 次”是容量上限,不是 100 份合格交付,也不是单次价格。被拒绝、超时和重复研究仍进入成本分子。只有当被接受报告的总成本持续低于人工基线,且关键错误没有增加,效率叙事才成立。
商业价值
最可能付费的是金融、科研、政策、工程、采购和产品战略团队,因为这些岗位已经为材料发现、交叉核验与报告初稿支付高额人工成本。Deep Research 增强的是研究员的搜索宽度和初稿速度;最终责任仍在能够判断来源质量与业务语境的人。
建议采用 90 天可证伪试点:前 30 天用历史任务离线评分;中间 30 天与人工流程并行但不进入决策;最后 30 天只让达到引用和时间门槛的报告进入正式审查。收益公式是:
单份净价值
= 人工基线研究分钟 × 人工分钟成本
- 每份被接受报告成本
- 因漏项、错误来源或过期信息产生的预期损失
成立条件是人工复核分钟明显下降、关键主张质量不降、引用可追溯且配额满足任务量。若分析师仍需从头重做、开放网页覆盖不了决定性数据库、实时页面无法满足历史截止,或者错误决策损失远高于节省,就应退回确定性数据库查询、专业检索或人工研究。
可积累的护城河不是“会使用 Deep Research”,而是企业自己的问题模板、来源分级、历史主张集、冲突处理规则和审查反馈。模型或产品入口变化时,这些任务资产仍可用于比较。
不适用场景
不适合秒级新闻响应、必须穷尽检索的系统综述、未经专家签署的医疗/法律/投资结论,以及只能在付费数据库或内部系统完成的任务。首发没有内部数据连接器,因此不能宣称自动理解企业知识库。需要发送邮件、修改记录或执行采购的任务也不属于研究交付,应交给独立、受权限控制的行动系统。稳定结构化数据若能用 SQL 或官方 API 得到,不应为了“Agent 化”改成网页研究。
局限与风险
第一,本文未复现 Deep Research。官方示例可能经过选择,HLE 与 GAIA 分数来自发布方设置;它们不能证明本站竞争情报任务的正确率、引用质量或成本。
第二,引用存在不等于引用正确。来源可能只部分支持结论、已经更新、引用二手转述,或缺少关键限定词。审查界面必须把主张与证据段落并排,而不是只展示脚注数量。
第三,首发页明确承认幻觉、错误推断、来源权威性判断和置信度校准仍有问题。研究 Agent 的流畅长文会放大自动化偏见,因此“不确定”和“找不到”必须成为可奖励输出。
第四,上传文件扩大数据治理范围。文件可能含 PII、商业秘密和提示注入;上传者有权读取,不代表模型输出的所有接收者也有权读取。需要输入分类、最小化、保留期和输出访问控制。
第五,开放网页会变化,付费墙、地区限制和 robots 规则也会造成系统性盲区。没有保存检索时间与决定性页面,未来无法复核一条结论当时为何成立。
第六,官方页面把更多套餐、应用端、内部数据源和更经济的小模型写成未来计划。本文不使用这些后续能力定义 2 月 2 日的首发范围,也不对当前产品状态作推断。
面试表达
30 秒结论: 2025 年 2 月 2 日的 Deep Research 把检索、浏览、分析和引用报告变成 5 至 30 分钟的异步 Agent 任务,但首发只向 Pro 用户提供有限额度,仍有幻觉、来源权威性和置信度问题。我的工程重点是任务状态、证据账本、文件 ACL 和引用评测;商业指标是每份被分析师接受的报告成本,不是生成了多少页。
3 分钟架构: 用户提交带 asOf 的竞争情报任务和去敏附件,任务服务保存输入哈希与来源策略。研究完成后先进入 report_ready,证据处理器把关键主张、URL、时间和支持段落结构化;规则检查时间泄漏、来源等级和数字回算,分析师再接受或退回。开放网页只读,附件继承项目 ACL,模型无发信或修改权限。离线评测检查主张正确率、引用精确率、一手来源覆盖、冲突召回和人工修订分钟,成本包含订阅、快照、审查、返工和错误损失。
若追问“官方 HLE 26.6% 为什么还不能直接用”,答案是 HLE 测封闭答案的跨学科难题,不测竞争报告的来源时效、引用蕴含、完整性和业务损失;企业仍需自己的任务集。若追问“报告有引用是否能免审”,答案是否定的:链接可访问、段落支持主张、来源适用且时间正确,是四个独立检查。
复盘
站在 2026 年回看,T+2 最重要的信号是研究型 Agent 已经不再像一次聊天调用:它有分钟级运行、动态信息路径、文件输入、过程状态和可审查交付物。这要求后端工程从请求响应转向作业编排,也要求内容质量从自然语言评价转向主张级证据。
当时最容易误判的是“更长、更有引用”等于“研究员级正确”。首发材料自身已经列出幻觉、来源权威性和校准弱点;成熟判断应是它扩大了可委派的发现与综合范围,但没有转移最终责任。另一个需要纠正的想象,是把未来的内部数据连接和多端开放倒填到当日产品,这正是时间边界要阻止的错误。
下一步可复现实验应固定 40 个历史任务、网页快照和答案账本,比较人工、普通搜索增强模型与研究 Agent。原始报告、引用判定、人工修改和成本都应保存。完成同条件运行前,本文继续保持 sourced,不使用“提高数倍效率”之类未经证明的结论。
方法披露
本文使用 AI 工具辅助检索 Internet Archive CDX、抽取首发页结构并整理任务和指标;事件日期、T+2 快照、HLE v1、开放范围、官方分数归因和最终判断由作者复核。本文没有运行 Deep Research、没有上传企业文件、没有复现 HLE/GAIA,也没有验证 OpenAI 示例报告中的事实。
修订记录
2025-02-04:初版发布;固定 2025-02-02 至 02-04 的首发页与 T+1 快照,区分 Pro Web 产品和未来能力,并给出竞争情报任务的状态、证据、权限、评测与成本契约。
Source ledger
来源账本
以下来源用于核对事实、日期与当时可用范围。厂商自报性能不视为本站独立复现。
讨论