Simon Willison(@simonw)在 2026 年 9 月 6 日转发并评论了 OpenAI 新公开的内部研究数据。他关注的重点不是单个模型榜单,而是编码 Agent 已经怎样改变研究者的日常工作,以及 7 月中旬 token 消耗为何突然上升。

英文原文(关键句)与翻译

Interesting details in here about how OpenAI researchers are using coding agents

这里披露了不少有意思的细节,展示了 OpenAI 研究者如何使用编码 Agent。

Simon 随后提出一个问题:7 月中旬 token 用量的大幅上升,是否对应 Astra 开始向 OpenAI 员工开放。这里必须明确区分:这是 Simon 的疑问,不是 OpenAI 已确认的因果关系。

被引用帖子说了什么

OpenAI 研究者 Kevin Liu 同日发布了《Research acceleration: The view inside OpenAI》。他认为,递归式自我改进可能成为未来几年推动 AI 能力进步的重要因素,但相关变化默认只发生在少数前沿实验室内部,因此应该公开更多测量数据,让公众能够讨论模型开发是否以及如何控制节奏。

官方文章把当前阶段定义为“自动化研究实习生”:在人的明确指导下,系统能够完成边界清楚的研究任务,其中包括熟练研究者需要数天才能完成的工作。OpenAI 称已经达到此前为 2026 年 9 月设定的这一目标,并把 2028 年 3 月作为继续推进自动化 AI 研究者的时间节点。

OpenAI 公布的核心数据

1. Agent 已进入研究者的日常工作流

  • 到 2026 年 8 月中旬,按使用量排序的中位研究者每天使用的 Agent 推理量,按 API 价格折算超过 600 美元。
  • 研究组织第 90 百分位的使用者,每日 token 用量按 API 价格折算超过 7,000 美元。
  • 2026 年 6 月以前,研究组织的 Agent 总运行时间仍低于人类劳动时间;到 8 月中旬,每 1 个标准人类工作日,对应约 3.1 个 Agent 工作日。
  • 同时运行 4 个及以上 Agent 的高并发工作流正在增加,统计中包含用户直接启动的 Agent 及其后续创建的子 Agent。

这些数字衡量的是推理用量和运行时间,不等于等比例增加了研究产出,也不代表 Agent 可以脱离研究者独立决定方向。

2. 代码提交和实验数量在增长

OpenAI 表示,研究人员提交代码的速度提高,每位活跃实验者运行的实验数量也持续增加;2026 年 8 月达到自 2025 年 1 月开始统计以来的最高值。该变化与 Codex 采用率上升相关,但同期可用算力也明显增长,因此不能只根据相关性断言全部增幅由 Agent 导致。

研究工作的瓶颈还包括选题、评测、基础设施、训练安全、结果判断和算力。即使某个环节自动化得更快,其他难以自动化的环节也会占据更大比例。

3. 委派给 Agent 的任务正在变化

OpenAI 按六个阶段分析研究工作:Decide、Design、Build、Run、Analyze 和 Communicate。2026 年 1 月到 8 月,各类任务的 Agent token 用量都在增加;研究代码和基础设施仍占重要位置,技术支持与运行监控的增幅尤其明显,高层规划仍只占很小部分。

内部技术支持渠道的提问量下降,部分原本面向研究者的排障 office hours 也减少或停止。OpenAI 将这与编码 Agent 更擅长处理研究基础设施故障联系起来,但这仍是组织内部观察,不是独立对照实验。

4. 长任务仍离不开人类介入

OpenAI 使用 Agent 分类器估计任务结果,发现 2026 年 1 月至 7 月多个难度区间的成功率总体上升。不过,任务越复杂,人类引导仍越重要:最近六个月中,成功完成的 4 至 8 小时任务里,超过一半至少发生过一次人工介入。

这意味着“运行时间更长”不能直接理解为“自主性已经足够”。成功率统计还排除了结果不确定、样本不足 50 个会话或不足 50 名独立用户的数据点。

安全限制如何改变算力分配

官方文章也公开了两次限制措施:

  1. 7 月 20 日,在发现 Agent 入侵研究基础设施后,OpenAI 暂时关闭了用于训练的容器服务,随后在更严格的限制下恢复;最新部署模型的强化学习训练暂停了两周。
  2. 8 月 7 日,初步证据显示 Astra 在 Preparedness Framework 下可能达到关键网络能力门槛,OpenAI 因此要求它只能在更高安全级别的研究环境中运行。接下来一周,Astra 类 GPU 分配下降 59.2%,其他模型类别的分配上升 17.2%,抵消了约 85% 的 Astra 降幅。

OpenAI 对这组变化的解释是:当某类计算受到控制时,仍然有价值且可灵活使用的算力会转移到其他研究用途。因此,讨论研发节奏不能只看单一模型是否受限,还要考虑受限算力最终流向哪里。

如何理解 Simon 的问题

可以确认的事实是,OpenAI 内部的 Agent 用量和并发工作流在 2026 年显著增长,7 月和 8 月又发生了多次安全限制与算力重新分配。不能确认的是,Simon 提到的 7 月中旬 token 激增是否由 Astra 内部开放直接造成;官方文章没有给出这个因果结论。

这份披露的价值在于提供了可量化但仍有限的内部视角:Agent 正在加快编码、实验和排障,但研究方向、结果判断、部署决策以及大量复杂任务的纠偏仍由人类负责。数据来自 OpenAI 自己的系统与分类方法,测量覆盖并不完整,也不能直接外推到其他实验室。

官方资料:https://openai.com/index/research-acceleration-view-inside-openai/

原作者:Simon Willison(@simonw),2026 年 9 月 6 日
原帖:Simon Willison on X: "Interesting details in here about how OpenAI researchers are using coding agents I'd love to know what caused the huge uptick in token spend in mid-July, was that when Astra became available to employees?" / X