Sebastian Raschka 在一篇长文中梳理了 GPT-6 Astra 的近期观察、循环 Transformer(recurrent depth)的计算方式,以及这种架构与推理轨迹可见性之间是否存在直接联系。
英文原帖(节选)与中文翻译
I put together a mega write-up on GPT-6 Astra & looped transformers. How looped transformers / recurrent depth works, cost-tradeoffs, whether it hides reasoning traces
我整理了一篇关于 GPT-6 Astra 与循环 Transformer 的长篇分析,讨论循环 Transformer/递归深度的工作方式、成本权衡,以及它是否会隐藏推理轨迹。
原帖还说明,文章配有大量图示,并回顾了近期循环 Transformer 研究。
文章要点
1. 评测与 Agent harness 的边界
Raschka 认为 Astra 在编码、数学、图形任务和计算机操作方面表现突出,但也提醒读者区分厂商自评与独立评测。对于 Agent 类基准,同一个模型在不同 harness 下可能表现不同;共享 harness 更接近同条件比较,却也可能低估针对主要 harness 训练和优化后的模型。
2. 循环 Transformer 如何工作
循环 Transformer 会让中间表示多次通过同一组 Transformer block,并在每次通过时复用权重。以文中 Nanbeige4.2-3B 的例子为例:22 个 block 连续运行两遍,相当于 44 次 block application,但第二遍不增加另一套独立权重。
这种设计减少的是需要存储的独立 block 参数,而不是免费增加计算:前向传播仍需完成全部 block application,反向传播也要穿过所有重复步骤。由于不同循环接收到的隐藏状态不同,每一遍仍需要各自的 KV cache;直接共享 KV cache 虽能减小缓存,但文中引用的实验显示性能会下降。
3. 固定循环与按 token 路由
文章比较了多种设计:Universal Transformer 可根据学习到的停止概率决定循环次数;Mixture-of-Recursions 使用小型路由器,依据 token 的上下文表示分配不同递归深度。后者类似 MoE 路由,但选择的是同一共享 stack 要运行几次,而不是选择不同专家。
文中引用的实验表明,循环次数越多并不一定越划算。以 Nanbeige 为例,两遍是作者报告的较优权衡;第三遍只有较小收益,却增加训练开销并降低优化稳定性。训练循环架构时,从头训练也优于把已有模型直接改造成循环结构。
4. Astra 是否采用循环架构仍未获官方确认
Raschka 明确把 Astra 使用循环 Transformer 视为尚未证实的报道,而不是既定事实。OpenAI 首席科学家关于 Astra 计算图深度的公开说明并不能单独证明它采用了循环架构,也可能由更多普通 Transformer block 解释。作者判断,即使 Astra 确实使用循环设计,其主要性能提升仍更可能来自训练配方和数据改进,而不是只由这一架构变化造成。
5. 循环计算不等于隐藏推理轨迹
推理模型通常在生成最终答案前产生 token 级中间步骤;这些步骤可以充当草稿纸并提供额外计算。循环 Transformer 则在网络内部增加同一 token 的 block application。两者处于不同层次,因此不能仅凭内部循环就推断外部推理轨迹被隐藏。
文章指出,在相同准确率下,更强模型可能用更短的推理轨迹,因为它减少了错误与回溯;较短不自动等于较不忠实。Astra 的系统卡虽然报告了推理轨迹可监控性下降和内容缩短,但尚无证据证明循环架构是根因。作者认为真正需要验证的是:循环模型是否比常规模型更频繁地产生误导性的推理轨迹,目前没有强证据支持这一点。
6. 近期研究给出的更窄结论
文章回顾了 latent reasoning、SMELT 和 full-bandwidth transformer 等研究。SMELT 在所研究的计算范围内,通过缩放曲线估计达到同等验证损失可减少约 6.8%–18% 的训练计算;这支持循环设计在固定计算预算下可能带来小幅建模收益,但不代表所有规模和训练方案都成立。另一项 latent feedback 实验在基础模型上缩短了 MATH500 推理轨迹,同时保持或提高准确率,但该效果在指令微调后消失,而且实验没有证明更短轨迹更不忠实。
作者:Sebastian Raschka(@rasbt)
日期:2026 年 9 月 9 日
原始 X:Sebastian Raschka on X: "I put together a mega write-up on GPT-6 Astra & looped transformers. How looped transformers / recurrent depth works, cost-tradeoffs, whether it hides reasoning traces, with lots of figures and a tour of recent looped transformer research." / X
作者文章:GPT-6 Astra, Looped Transformers, and Hidden Reasoning