**
OpenAI 将 GPT 6 Astra 描述为其迄今为止能力最强、对齐度最高的模型。
Greg Brockman 更进一步,表示将 Astra 视为人工通用智能的早期形态是合理的。
该模型还成为首个突破 OpenAI 网络安全关键阈值的模型。据该公司称,它能够在有限的人类指导下发现先前未知的漏洞,并构建可用的利用程序。
这些说法引人注目,但它们并非此次发布中最重要部分。
真正的变化在于架构。
传统语言模型通过固定的 Transformer 模块序列传递信息,并生成下一个 Token。而 Astra 可以在向用户显示一个单词之前,多次通过相同的计算模块处理其内部状态。
它不仅仅是生成更长的思维链。
它在回答之前会花更多时间思考。
1 现代语言模型的工作原理
想象一下输入:
Everest is...
模型需要预测接下来会发生什么。
其注意力机制决定了上下文中哪些部分重要。单词 Everest 会激活相关概念,如山脉、海拔、喜马拉雅山脉、尼泊尔、西藏、登山和探险。
然后,模型将这些关联与周围上下文结合起来。在大多数情况下,像 "the highest mountain on Earth" 这样的续写变得高度可能。
在传统 Transformer 内部,这种表示会通过一系列模块移动。每个模块将其转换一次,并将结果传递给下一个。
如果一个模型包含 40 个模块,隐藏状态会依次通过所有 40 个模块。最终的表示被转换为下一个 Token 的概率分布。
更多模块通常意味着更大的计算深度。更深的模型可以在确定答案之前执行更多转换。
但增加模块也会增加参数数量、内存需求和训练成本。
通常的假设很简单:如果你想要一个更深的模型,你需要构建一个更大的层堆栈。
循环架构改变了这一原则。
2 循环架构改变了什么
根据 The Information 的报道,GPT 6 Astra 使用了循环 Transformer 架构。
OpenAI 尚未发布完整的技术规格,因此确切的实现细节仍属保密。但通用机制已从公开研究中得到充分理解。
模型不是将隐藏状态仅通过每个模块一次,而是可以将结果返回到计算模块并再次处理。
将其视为内部草稿。
模型生成一个初步表示,再次通过相同的权重发送,进行优化,并重复该过程数次。只有在循环完成后,下一个可见的 Token 才会出现。

参数数量保持不变。权重仍在一个模块内,计算量随循环次数增加,只有最终的 Token 被输出。
关键细节在于参数数量不一定增加。
相同的权重在每次传递中被重复使用。
增加的是计算量。
在传统 Transformer 中,一个 Token 通过一系列不同的模块。在循环 Transformer 中,它可以多次通过相同的共享结构。
模型通过计算变得更深,而无需通过参数数量变得更大。
这创造了一个新的权衡:
- 更多参数需要更多内存
- 更多循环需要更多计算
- 一个模型可以在不同任务上花费不同数量的计算
最后一点尤其重要。计算深度可以在不创建新模型的情况下改变。
3 循环深度如何训练
仅仅将 Transformer 模块放入循环中是不够的。
如果一个模型在训练期间总是恰好执行 32 次传递,它可能会学会依赖每一步的位置。第一次传递可能学习一个功能,第十次另一个,而第三十二次可能成为一个固定的输出层。
结果将是一个伪装成循环的传统 32 层网络。
研究人员通过在训练期间改变循环传递的次数来解决这个问题。
最清晰的演示之一来自循环深度模型 Huginn。其创建者在大约 8000 亿个 Token 上训练了一个 35 亿参数的网络。
在每个训练步骤中,循环次数从均值接近 32 的分布中采样。一个示例可能接收四次传递,另一个 17 次,另一个 40 次,另一个接近 90 次。
模型无法预先知道哪次传递将是它的最后一次。
因此,它必须学习比固定操作序列更通用的东西。
它必须学习如何改进其当前的内部状态。

arXiv 上循环深度论文的摘要
通过数十个循环步骤进行训练会产生另一个问题:内存。
标准反向传播需要存储每个循环的中间激活。经过足够多的重复,内存成本变得巨大。
Huginn 研究人员使用了一种实用的折衷方案。前向传播可以运行多个循环,但梯度仅通过最后八次计算。
更早的传递仍然影响最终结果,但它们的完整激活历史不必保留在内存中。
这类似于截断的时间反向传播。区别在于循环发生在计算深度上,而不是序列中的单词之间。

循环次数在每个训练步骤中被采样,而梯度仅通过最后八次传递计算。
模型并非被教导执行 32 次操作的固定序列。
它被教导无论过程何时停止,都要将其隐藏状态移向有用的答案。
这改变了深度的含义。
深度不再仅仅是工程师在训练前选择的属性。它可以在推理过程中成为一个变量。
4 推理过程中的自适应计算
目前大多数推理控制都在可见 Token 的层面上运行。
如果要求模型思考更长时间,它会生成更长的思维链,使用更多输出 Token,或创建额外的中间文本。
循环架构提供了一种不同的机制。
内部传递的次数可以在不修改权重且不强制模型编写更长解释的情况下改变。
一个简单的任务可能接收四次循环。
一个困难的数学证明可能接收 32 次。
一个复杂的编码问题可能接收 64 次。
模型保持不变。只有内部计算量发生变化。

权重保持不变。只有用于处理每个 Token 的内部传递次数发生变化。
公开的循环深度实验已经显示出预期的模式。
性能在最初的循环中迅速提升。然后增益变小,直到曲线接近平台期。
这表明隐藏状态正在收敛。
早期传递进行大的修正。后期传递优化更小的细节。最终,额外的计算停止产生有意义的改进。
未来的系统可以自动检测那个时刻。
模型不是为每个提示分配固定的循环次数,而是可以继续处理,直到其隐藏状态变得足够稳定。简单的 Token 将是廉价的。困难的 Token 将获得更多计算。
这将创造真正的自适应计算深度。
思考更长时间不再意味着写更多内容。
5 研究与早期实际成果
重用 Transformer 层并非新想法。
Universal Transformers 在 2018 年引入了循环处理。ALBERT 通过跨层共享权重减少了参数数量。Mixture of Recursions 探索了通过不同计算量路由 Token。
开源的 Nanbeige4.2 3B 模型提供了一个特别直接的例子。
其配置包含 22 层和 num_loops: 2。实际上,模型会两次通过这些层。它拥有大约 22 层网络的参数数量,但大约有 44 层网络的计算深度。

Hugging Face 上的 Nanbeige4.2 3B 配置
二十二层,num_loops: 2,以及 Apache 2.0 许可证。该机制已经在一个开放模型配置中可见。
多年来,循环 Transformer 设计一直是有趣的研究想法,而非主导方法。
缺失的因素是强有力的扩展证据。
9 月 1 日,一组研究人员发表了 SMELT,这是一项旨在比较循环和传统 Transformer 在匹配条件下的研究。
他们控制了参数数量、训练计算量和 KV 缓存大小。在这些约束下,循环模型需要少 6.8% 到 18% 的训练计算量才能达到相同的性能水平。
最大的增益出现在代码上。

arXiv 上 SMELT 论文的摘要
在计算量、参数和 KV 缓存匹配的情况下,循环节省了 6.8% 到 18% 的训练计算量,代码上的增益最强。
研究人员还观察到注意力行为的变化。
在传统 Transformer 中,序列中最早的 Token 通常成为注意力汇点。即使它们的语义重要性有限,它们也会获得不成比例的注意力。
在第二次通过相同模块后,模型的注意力转向了更相关的 Token。
第二次循环不仅仅是重复第一次。它使用第一次传递的结果作为更选择性处理的基础。
SMELT 并不证明每个未来的模型都应该是循环的。它确实表明在匹配主要实验条件后,循环仍然具有竞争力。
问题不再是循环深度是否可行。
问题是它能扩展到什么程度。
6 可解释性与控制
使循环具有吸引力的相同架构特性也使模型监控复杂化。
使用显式思维链推理,至少一些中间步骤以可读文本的形式出现。研究人员可以检查它们,搜索可疑模式,并将陈述的推理与最终答案进行比较。
循环模型可以在隐藏激活中执行更多处理,而无需生成任何文本。
Buck Shlegeris 和 Ryan Greenblatt 认为这可能会降低思维链监控的有用性。如果更多处理转移到隐藏计算中,可见的解释可能揭示更少关于模型如何得出结果的信息。
Sebastian Raschka 提供了一个重要的反驳观点。
重用权重并不会自动创建秘密或不可访问的认知。内部激活仍然可以使用可解释性工具进行研究。主要区别在于模型可能需要更少的可见中间 Token,因为在生成开始之前发生了更多计算。
OpenAI 首席科学家 Jakub Pachocki 也表示,Astra 的计算图大致保持在 GPT 4 深度的两倍以内,并且循环被有意限制以保持监控能力。
这表明是一个克制的实现,而不是无限的循环过程。
思维链首先并不能保证是模型内部计算的忠实记录。系统因产生有用的答案而获得奖励,而不是为每个隐藏操作提供科学准确的报告。
涉及 OpenAI、Anthropic 和 Google DeepMind 的研究表明,模型的解释可能省略重要因素,事后合理化决策,或呈现比实际影响结果的路径更清晰的路径。
循环架构使这种区别更难被忽视。
可见的推理可能是一个界面。
主要计算可能发生在模型内部,在任何文本出现之前。
7 GPT 6 Astra 的结果
GPT 6 Astra 最引人注目的基准测试结果是 ARC AGI 3 上的 99.9%。
这个数字听起来几乎是最终的,但它很大程度上取决于测试的运行方式。
Simon Willison 强调,99.9% 的结果来自 OpenAI 的自定义 Provider Adapter 测试框架。在标准 ARC Prize 测试框架下,同一模型得分 62.7%。
模型没有改变。
评估环境改变了。

同一模型在两个不同的运行成本下产生两个不同的分数。
OpenAI 运行成本约为 19,000 美元。标准运行成本约为 26,000 美元。
显著更高的分数也是由更便宜的设置产生的。
这并不一定使结果无效。自定义适配器可能更有效地与模型交互,或暴露通用评估框架遗漏的能力。
但标题数字不能与产生它的条件分开解释。

GPT 6 Astra 在 ARC AGI 3 上
一个模型,两个评估框架,以及 37.2 个百分点的差距。
其他评估则不那么戏剧性。
在 Artificial Analysis Intelligence Index 上,Astra 的得分大致与 GPT 5.6 Sol 相当,比 Claude Fable 5.1 低约五分。
其更实际的优势可能在于 Agent 任务上的效率,它可以在较低成本下达到竞争性能。
基准测试展示了模型能做什么。架构有助于解释这些能力来自何处以及它们可能如何发展。
8 这对 AI 的未来意味着什么
多年来,扩展语言模型主要意味着添加参数、添加数据以及构建更大的固定 Transformer 模块堆栈。
每一代新模型都变得更大、更昂贵、运行要求更高。
GPT 6 Astra 指向了另一条路径。
模型可以重用相同的参数,为困难任务分配更多计算,并在产生第一个单词之前优化其内部表示。
这将模型大小与其推理深度分离。
系统不是遵循一条固定的计算路径,而是可以根据特定问题的难度调整工作量。
这可能会改变模型性能和使用 AI 的经济性。相同的智能可以在快速且廉价的模式下运行以处理简单请求,然后在任务真正需要更多推理时增加其计算深度。
循环正在回归语言模型。这一次,它主要不是在单词之间运行,而是在创建单词的过程中运行。
下一代系统可能不仅仅因为包含更多参数而变得更强大。
它们的决定性优势可能是知道何时已经找到了好的答案,以及何时值得再绕内部循环一次。
来源
- OpenAI 宣布 GPT 6 Astra
- Greg Brockman 谈 GPT 6 Astra 和 AGI
- GPT 6 Astra 与网络安全关键阈值
- Ilya Sutskever 推荐的深度学习阅读清单
- The Verge 关于 Astra 和循环 Transformer 的报道
- 通过潜在推理扩展测试时间计算
- Mixture of Recursions
- Hugging Face 上的 Nanbeige4.2 3B
- SMELT:计算匹配 MoE 循环 Transformer 的扩展定律
- 围绕 Astra 推理架构的 AI 安全担忧
- Sebastian Raschka 对 Astra 和循环 Transformer 的分析
- 思维链可监控性
- Simon Willison 对 GPT 6 Astra 的分析





