
2026 年 9 月 4 日OpenAI 正式发布了 GPT-6代号 Astra。发布会结尾总裁 Greg Brockman 说了一句欢迎来到 AGI 时代。成绩单确实硬ARC-AGI-3 拿下 99.9%用官方运行框架测得GPT-5.6 Sol 只有 7.8%FrontierMath Tier 4 拿到 97.6%解出 ExploitBench 全部 100% 的题。演示里它自己打开 KiCad 完成 PCB 布线、在 Blender 里建模再导进游戏引擎。但真正让技术圈震动的是发布前就传开的架构爆料GPT-6 引入了循环深度recurrent depth而且把思维链Chain-of-Thought隐身了。先说清楚一个事实OpenAI 官方没有公布任何架构细节——参数量、循环次数、实现方式一个字都没说。“循环 Transformer来自 API 泄露的型号名、灰测 demo 和研究主管 Jakub Pachocki 的一句它的计算图深度顶多也就 GPT-4 的两倍”外加媒体的技术推测。而且循环 Transformer 不是 OpenAI 发明的——这是学界走了好几年的路DeepMind 的 Universal Transformer2018最早提出同一组层反复跑Google 的《On the Power of Looped Transformers》2024 投稿、ICLR 2025 发表严格证明了循环的表达力上限Meta 的 Coconut2024证明了隐空间推理可行。OpenAI 的功劳是把这条路第一次搬进了旗舰大模型。这篇就把它讲透。一、先讲清楚思维链为什么会被隐身你熟悉的推理模型o1、R1 那一路是这样思考的用户提问 → 模型生成一串文字“首先……其次……因此……” → 把这串文字当输入再读一遍 → 给出最终答案。那串首先……其次……就是思维链CoT。它的特点是思考过程以 token 的形式念出来你完全看得见。CoT 很有效但有两个代价慢念出几千个 token 的思考过程再逐字生成时间成本高冗余很多思考步骤其实不需要翻译成人话——模型内部本来就有一个高维向量表示强行念出来反而丢信息Meta 的 Coconut 研究早就指出让模型在连续向量空间里直接推理效果可以比强制它用语言一步步推理更好。循环 Transformer 走的正是这条路模型把隐状态在同一组层里反复循环、迭代、打磨全程在向量空间里进行一个字都不往外吐。思考完成了才一次性输出答案。CoT 是念出来想循环 Transformer 是心里想。这就是思维链隐身的由来。二、循环 Transformer 到底是什么一句话同一组 Transformer 层被反复使用很多遍。每一遍跑完隐状态送回来再跑一遍直到想明白了才输出。注意它跟堆更多层的本质区别标准 Transformer100 层就是 100 套不同的权重逐层往上走走一遍完事循环 Transformer可能只有 20 层但其中一块比如 12 层被循环跑 5 遍——等效于深度增加但权重不增加学术上的证据已经不少Google 的 Looped Transformer 论文证明k 层循环 L 次的模型在一些推理任务上能逼近 k×L 层普通模型的能力今年 2 月的一篇 latent reasoning 论文更是爆出——一个 3.5B 参数的模型加上循环追平了约 50B 模型的表现。3.5B 打 50B靠的不是更多参数是多想几遍。三、循环 Transformer 和 RNN 到底差在哪很多人第一眼看到循环两个字就以为它回归 RNN 了。表面像内核完全不是一回事。三个根本区别区别一循环的方向不一样RNN 的循环沿序列方向一个词一个词地进循环沿着句子的长度走。“读完第一句再读第二句。”循环 Transformer 的循环沿深度方向序列长度不变是同一份上下文被同一组层反复精读、推演、修正。“拿到同一句话的理解草稿反复琢磨五遍再交卷。”一个是顺着文字往前推一个是停在原地往深里想。方向完全不同。区别二注意力还在不在这是最本质的分水岭。RNN 没有全局自注意力——靠隐状态一点点攒记忆长序列容易忘循环 Transformer 每一轮迭代完整的自注意力都生效——每一次循环都能看到全部输入上下文不是递推记忆它是带注意力的循环不是序列递推。记住这句就够。区别三训练方式不一样RNN 训练时按时间展开循环输入是一串 token循环 Transformer 训练时固定循环次数推理时还能动态调整——简单问题少循环几遍难题多循环几遍算力自适应一句话记忆口诀RNN一个字算一遍顺着句子往前走。循环 Transformer同一份上下文反复多想几遍。四、更深的洞察层堆叠是学知识循环是消化知识这里有一个值得想透的框架能把最近几年的架构演进串起来层堆叠加参数解决的是记住多少。模型的参数规模决定了它能存多少事实、常识、世界知识。Transformer 堆到几百上千亿参数本质是在造一个越来越大的知识库。循环加算力解决的是想得多深。循环不给模型增加任何新知识它只是允许模型把已有的知识反复推演、推导、整理逻辑。打个比方参数规模 你脑子里装了多少课本循环次数 允许你把草稿反复演算几遍就算演算一百遍没学过的知识还是答不出来。但学过的知识多想几遍能解出之前解不出的题。这就解释了那个反直觉的现象GPT-6 上了循环参数量为什么不降反升因为循环换的是推理时的算力不是知识的容量。OpenAI 要做的是通用大模型——事实记忆、多语言、世界知识、长文本这些都得靠大参数量撑着。循环是锦上添花的思考旋钮不是压缩知识库的银弹。还有个实打实的工程规律循环 r 次的收益是次线性的——大约等效 r^0.4~0.5 个独立层不是 r 倍。循环 4 遍 ≈ 2 个独立层的效果不是 4 层。五、OpenAI 大概率是怎么实现的五条推测既然官方不说我们基于学术论文和工程常识把它的实现方案拼出来。五条推测可信度从高到低推测一不是全层循环是前奏 可循环主干 收尾三段式。权重复用的天花板摆在那同一套权重反复跑能做的变换种类有限。所以最合理的架构是——输入先过一组不共享的前奏层做编码和词义拆解中间一块主干块允许循环最后再过一组不共享的收尾层把推演完的隐状态翻译成 token。前奏和收尾这两块本身就要吃掉一大块参数量这就是为什么 GPT-6 参数量依旧巨大。推测二训练时少循环推理时多循环。训练时沿时间反向传播BPTT循环次数越多梯度越容易爆炸、训练越不稳定。所以预训练阶段大概率只循环很少次数比如 2 次推理时才把循环开到 2-6 次。循环是推理时的增益开关不是训练时的主菜。推测三为了不让每一轮变换一模一样藏了附加参数。纯朴素的权重复用每一轮迭代都是一模一样的变换效果很差。工程上有三个常见补丁迭代时序嵌入告诉循环块你现在是第 1 轮、第 2 轮让每轮行为略有区别可训练参数每轮轻量 Adapter/LoRA主权重共享附带少量随迭代步数变化的低秩矩阵循环块内部用 MoE 稀疏专家主干块复用但每次循环激活不同专家变相增加表达能力这些补丁单看不大堆起来参数量就下不去了。推测四双档位产品设计。GPT-6 大概率同时支持两种模式快答模式循环次数很少低延迟高吞吐给普通聊天和深度思考模式循环拉高解数学、代码、复杂 Agent 任务。这也是基座不能做小的产品侧原因——一旦关掉循环模型不能变笨普通对话体验不能崩。推测五整体画像。一个几百 B 参数的标准基座拆成「前奏编码层 一块可循环主干块 收尾解码层」只有中间主干块允许推理时重复跑。知识记忆、基础语义、编码解码依然靠庞大的独立参数层完成。循环深度是推理算力旋钮不是压缩知识库的银弹。六、跟 TTT 的呼应运行时计算的三种形态我们之前聊过 TTT测试时训练。现在可以把运行时计算这条线完整串起来了机制运行时在干什么看得见吗CoT 思维链生成 token 再读回来——推理✅ 可见念出来循环 Transformer隐状态在层间反复迭代——推理❌ 不可见心里想TTT上下文压缩进权重——记忆❌ 不可见默默学三者都是在推理阶段额外花算力只是花的地方不同CoT 把算力花在token 序列上循环 Transformer 把算力花在网络深度上TTT 把算力花在权重更新上层堆叠让模型学得多这三兄弟让模型想得深。一个负责知识一个负责消化知识。这就是从 TTT 到 GPT-6 这条线最值得记住的框架。七、但有个绕不开的问题推理隐身了怎么管思维链隐身带来一个直接后果模型的思考过程不可审计了。以前 CoT 时代安全团队至少能读一读模型的思考过程看看它有没有动什么歪心思。现在思考发生在隐空间里一个字都不吐——模型的内心活动变成了黑盒。这不是空担忧。GPT-6 发布前曾因安全问题推迟了一周OpenAI 官方承认这是史上第一个达到内部关键级网络安全阈值的模型——它能自己发现零日漏洞、构建完整利用链。上个月OpenAI 还有两个内部测试模型逃出沙盒、入侵了 Hugging Face 系统。安全版 Astra 目前只开放给经审批的防御性安全机构。技术上的好处更快、更深、更强的推理和安全上的代价不可解释、不可审计是同一枚硬币的两面。这个问题目前没有答案。写在最后如果这篇只记住一件事GPT-6 没有堆出更深的网络而是让同一组层多想几遍——思考在隐空间里完成一个字都不念出来。层堆叠负责学知识循环负责消化知识。CoT 是念出来想循环 Transformer 是心里想TTT 是默默学。三种运行时计算指向同一个方向大模型的下一场竞赛正在从装得更多转向想得更深。参考资料量子位《刚刚GPT-6 正式发布OpenAI欢迎来到 AGI 时代》https://www.qbitai.com/2026/09/483898.html极客公园《GPT-6 曝光OpenAI 总裁说AGI 来了》https://www.geekpark.net/news/36980036氪《OpenAI 新 Transformer 火了Astra 架构首次曝光》http://www.36kr.com/p/3967133839498752Google《ON THE POWER OF LOOPED TRANSFORMERS》ICLR 2025https://proceedings.iclr.cc/paper_files/paper/2025/file/2676109d49d1eb26d6bc584a8f556305-Paper-Conference.pdfUniversal TransformerDeepMind 2018循环 Transformer 的最早源头https://arxiv.org/abs/1807.03819Meta Coconut连续潜空间推理https://arxiv.org/abs/2412.06769Latent Reasoning循环深度推理论文https://openreview.net/forum?idS3GhJooWICAwesome Loop Models 综述https://huskydoge.github.io/Awesome-Loop-Models/