Sam Altman 转发并称这是 OpenAI 首席科学家 Jakub Pachocki 的一篇重要文章。文章《An Alien Mind》讨论的不是一次产品发布,而是能力继续扩张时,实验室如何判断模型仍可被对齐、监控,以及何时应放慢训练。
英文原帖与中文翻译
An important post from Jakub:
Jakub 的一篇重要文章:
原帖引用的 Jakub Pachocki 动态写道(关键原文):
I wrote about the state of AI, why I’m concerned about the next few years, and the choices we need to make to keep the future…
我写下了对 AI 现状的看法、为何担忧未来几年,以及为了把未来继续掌握在人类手中,我们需要作出的选择……
文章提出了什么
Jakub Pachocki 在 OpenAI 官方文章中回顾称,团队在 2023 年的 RLSlow 研究里看到扩大推理模型训练的早期信号。三年后,推理模型已能操作电脑、与人和其他 AI 协作并承担研究任务;他据内部结果判断,能力进展可能延伸至递归自我改进(RSI)。这是作者的判断,不是已经由公开实验独立证明的时间表。
文章把对齐分为两层:
- 目标对齐:模型是否努力完成被交付的目标,包括遵循指令层级、理解人的意图和协作。
- 价值对齐:面对模糊、冲突、陌生或对抗环境时,模型是否仍能从高层原则稳定泛化。
作者认为,当前依赖奖励和偏好模型的训练在平均情形下有效,但覆盖不到的环境仍可能暴露脆弱性;仅依赖预训练中表现“对齐”的人格或数据分布,也可能在持续优化压力下发生偏移。
为什么监控会成为瓶颈
OpenAI 的一项主要押注是思维链监控:只优化最终结果、尽量不直接监督语言化推理过程,以减少模型学习隐藏不当推理的训练激励。文章同时列出这条路线正在变难的三个原因:
- Agent 的推理越来越多地与人类沟通、其他 AI 和工具调用混合,监督边界变得模糊;
- 模型更善于推理和操纵自己的推理过程;
- 预训练能力增强后,模型即使不依赖显式语言化推理也会变得更强。
作者提出可继续探索思维链可监控性,以及把思维链监控与能够读取网络内部激活的监控方法结合。但原文没有给出一套已验证、可保证更强模型安全的完整方案。
防御与减速之间的张力
文章认为,继续训练更强模型最有力的理由之一,是用它们强化关键基础设施并抵御恶意或失配 Agent;但“需要更强模型来防御”不能成为不受约束扩张的理由。作者主张把安全信心作为规模化训练的约束,将准备框架或负责任扩展政策逐步变成由第三方审计、政府机构或国际组织执行的共同门槛。
他给出的路线是两者结合:一方面让自动化研究集中攻克对齐、监控和人类留在自我改进闭环中的方法;另一方面在证据不足时协调减速。文章最后明确表示,作者目前不认为任何实验室已经充分解决对齐与监控问题,并希望在共同安全门槛建立前,自愿放缓会更常见。
如何核对与阅读边界
- Sam Altman 的 X 帖只作“重要文章”推荐,具体技术和政策主张来自 Jakub Pachocki 的官方长文。
- 可核对文章的六个章节:未知智能、目标/价值对齐、泛化监控、可扩展防御、RSI 节奏与下一步。
- 关于未来能力、RSI 速度及防御需求的判断包含作者观点和未公开内部结果;原文没有提供足以独立复现实验结论的数据集、评测配置或完整统计。
- 文中的对齐风险、网络安全风险和政策建议不等同于对具体事故概率的量化预测。
原作者:Sam Altman(@sama),引用 Jakub Pachocki(@merettm),2026 年 9 月 6 日
原帖:Sam Altman on X: "An important post from Jakub:" / X