
把推理轨迹放到上下文前面:唐杰共同署名论文揭示的长上下文盲区
清华大学唐杰与智谱邹旭共同发表论文《Trace as State》,提出不改模型、不需重训,仅将推理轨迹移至上下文最前端即可显著提升长文本推理能力;本文深读其技术原理、消融对照与真实代价,并厘清产业界围绕循环深度的传闻边界。
当整个大模型产业都在猜测闭源巨头是否在用循环深度重构底层架构,来自清华与智谱背景的一项新研究,用极简的排列组合撕开了一条被长期忽视的技术缝隙。
长文本模型处理超长输入时的瓶颈,往往不在于注意力机制的视野边界,而在于关键任务状态被压在数十万字后方带来的计算错配。
北京时间 2026 年 9 月 2 日夜间,清华大学计算机系教授唐杰与智谱(Z.ai)研究员邹旭在预印本平台 arXiv 共同发表论文《Trace as State: Reasoning Traces as Conditional States for Long-Context Transformers》(arXiv:2609.02702v1)。1
论文的核心主张极度克制:不改动模型参数,不调整 Transformer 内部架构,也不进行任何追加训练;仅仅通过把模型第一轮自主生成的推理轨迹(Reasoning Traces)移动到长文本上下文的前方,就能在多项复杂长文本基准上带来性能爆发。2
在主流开源与商业模型的大规模对比中,这项名为 Trace as State 的方案在 27 组“模型×任务×指标”评测组合中击败了传统追加方案 26 组。2
在图结构推理数据集 GraphWalks Parents 上,GLM-5.2 的精确匹配率(Exact Match)甚至直接从首轮的 66.4% 跃升至满分 100.0%。2
然而,当中文技术社区迅速将这篇论文冠以“颠覆长文本架构”、“长文本暴涨至 100%”的惊悚标题时,这篇预印本的严肃价值反而被舆论泡沫所掩盖。3
它既不是免费的午餐,更不是神秘的全新架构。它是在单向因果注意力与巨量工程现实之间,用推理时算力换取准确率的一场精准权衡。
01 机制拆解:条件后置的代价值与状态代理
要理解为什么移动一段文字的位置就能让准确率大幅攀升,必须回到 Transformer 的底层运作特性。
在因果语言模型(Causal Language Models)中,注意力机制本质上是一个单向展开的状态机。2
每个输入 Token 只能看见其左侧的内容,并在向前移动时逐步聚合并更新自身的内部隐状态。
在现有的绝大多数长文本工程实践中,开发者的默认提示词模板通常为
[长文本内容 x, 提问 q]。如果引入思维链,往往也是在模型看完长文本后,让其在尾部输出推理过程并给出答案,即后置形态的
[长文本内容 x, 提问 q, 推理轨迹 T]。论文作者在形式化分析中指出,这种“条件后置”存在着根本性的信息论缺陷。2
当核心任务的筛选准则或目标状态 z 被放在文末时,因果处理器在从头到尾单向扫描数万乃至数十万字的背景文本时,并不知道哪些信息才是后续推理真正需要的。
为了保证不错漏潜在关联,处理器在理论最坏情况下需要维护与条件空间成指数级的中间分支信息。
作者用数学构造证明:如果条件 z 处于前置位置(形如
[z, x]),系统只需要线性级别的比特来维持状态更新;若条件 z 处于后置位置(形如 [x, z]),确定性单遍处理器在最坏情况下需要暂存指数级的工作状态。2这正是长文本注意力机制在超长篇幅中频繁出现“大海捞针”容易、复杂关联推理却迅速失真溃败的底层病因。
Trace as State 的解决思路极其直接:把问题变成“两遍式”(Two-Pass)因果扫描。2
在第一遍处理中,模型先独立运行 n 次(论文中取 n=5),生成多条候选推理轨迹与答案。
随后,系统通过序列化策略将这些轨迹汇总为一段紧凑的综合文本轨迹 T。
在第二遍处理中,系统不再把轨迹追加在文末,而是重构输入序列为
[综合轨迹 T, 长文本内容 x, 提问 q]。这一微小的位置重排,彻底改变了注意力矩阵的能量流向。
当模型在第二轮重新扫描庞大的长文本 x 时,左侧已经存在了一份高度浓缩的任务假设与搜索地图。
因果注意力层不再是在黑暗中漫无目的地记录一切,而是带着明确的先验状态去有针对性地对齐和检验证据。
值得注意的是,论文作者在此处给出了极为严谨的理论边界声明。2
作者明确强调,文本推理轨迹不能等同于形式理论中绝对正确的条件 z,更不是模型底层的特权内部潜变量。
它只是一种由模型自身吐出的、可能存在遗漏、损耗甚至错误的“可观察状态代理(Observable State Proxy)”。2
同时,形式证明中的指数级状态差异仅针对严格的确定性单遍读取机制,不能直接等同于现实大模型在复杂非确定性环境下的实测表现。
02 实验复核:26/27 胜出、100% 满分真相与消融验证
在这篇预印本公开发布后,中文社交网络与部分自媒体迅速展开了传播狂欢。
“27 组全部胜出”、“推理准确率飙至 100%”等断章取义的描述屡见不鲜。4
翻开论文原始数据表,这些结论有着严密的限定条件与真实落差。2
首先是所谓的“全胜”神话。
论文在实验中选用了三款极具代表性的长文本模型:千问 Qwen 3.7 Max(GDN+GA 架构)、深度求索 DeepSeek V4 Pro Preview(选用 2026 年 4 月 24 日发布的早期版本)以及智谱 GLM-5.2(DSA+IC 架构)。2
评测基准覆盖了三大长上下文任务:长图推理 GraphWalks 256K、多针检索问答 MRCRv2(包含 256K 与 512K 两个长度)以及长篇小说理解基准 NUB-1M Season 2。2
在模型、任务与具体指标(精确匹配 EM、集合 F1、编辑相似度 Seq 及多选题准确率)交叉构成的全部 27 个独立评测格中,论文摘要与正文均准确记录为:Trace as State 在 26 组 中胜出,并非毫无例外的 27 组。2
唯一的例外发生在 GLM-5.2 面对 GraphWalks 的广度优先搜索(BFS)任务时:传统的后置追加方案(Trace Append)取得了 75.8% 的 F1 分数,而前置方案为 75.0%,后置方案反倒微弱领先了 0.8 个百分点。2
尽管在同一评测格的精确匹配率(EM)上,前置方案依然更高,但这一微小波动足以击碎“全无例外”的宣传神话。
其次,外界热议的“100% 满分”,存在极其严格的任务限定。
这一极限数字仅出现在 GraphWalks Parents 这一特定子任务上。
该任务要求模型在一张展开后长达 256K Token 的复杂网络有向边表中,精准找出指定目标节点的全部前驱父节点,漏报或多报任意一个节点都会导致精确匹配失败。
在传统的单遍直接生成模式下,三大模型在面对庞大有向图时均表现挣扎:DeepSeek 只有 29.2% 的 EM,Qwen 为 60.8%,GLM-5.2 达到 66.4%。2
如果采用传统的文末追加思维链(Trace Append),DeepSeek 升至 43.0%,Qwen 升至 71.0%,GLM-5.2 升至 83.2%。
而一旦将思维链作为状态前置(Trace as State):
- DeepSeek V4 Pro Preview 的精确匹配率从 29.2% 飙升至 81.8%(F1 达 91.3);
- Qwen 3.7 Max 从 60.8% 提升至 96.4%(F1 达 99.1);
- GLM-5.2 则直接打满,EM 与 F1 双双达到 100.0%。2
为什么在 Parents 任务上增益如此剧烈,而在其他任务上相对温和?
消融实验给出了极具说服力的回答。
作者在 DeepSeek V4 Pro 上对 GraphWalks 256K 展开了一系列对照变体测试,完整剥离了各种潜在混淆因素:
| 对照方案 | 输入序列结构 | BFS 任务 EM (%) | BFS 任务 F1 (%) | Parents 任务 EM (%) | Parents 任务 F1 (%) | 核心机制与对比结论 |
|---|---|---|---|---|---|---|
| 首轮基线 (First Pass) | [x, q] | 31.6 | 36.4 | 29.2 | 46.5 | 传统的单遍长文本提示,因果注意力在扫描时无先验目标 |
| 五次多数投票 (Majority@5) | 多轮集成投票 | 35.0 | 39.6 | 31.0 | 47.8 | 仅靠表面答案频次表决,性能提升极其有限 |
| 后验最优上限 (Oracle@5) | 事后挑最佳单次 | 50.0 | 55.5 | 50.0 | 75.0 | 假设有完美裁判挑选首轮 5 次中最优者,受限于单轮上限 |
| 提问前置 (Question First) | [q, x, q] | 33.4 | 36.8 | 53.0 | 64.6 | 仅把问题放在最前,Parents 暴涨,证明目标节点本身就是关键状态 |
| 双遍文本重读 (Re2) | [x, q, x, q] | 49.0 | 52.9 | 50.0 | 68.9 | 无轨迹、单纯让模型重读全文,提升明显但仍不及前置轨迹 |
| 仅前置答案 (Answer Feedback) | [a, x, q] | 35.4 | 39.4 | 45.4 | 58.0 | 只把首轮最终答案前置,效果平平,证明推理路径比孤立答案重要 |
| 随机混淆轨迹 (Random Trace) | [T_rand, x, q] | 22.4 | 35.9 | 14.2 | 31.3 | 性能暴跌,劣于首轮;彻底证伪了“额外 Token 脚手架”玄学假说 |
| 文末追加轨迹 (Trace Append) | [x, T, q] | 41.8 | 48.3 | 43.0 | 65.3 | 传统思维链方案,状态被压在文本后方,依然承受因果注意力衰减 |
| 轨迹前置状态 (Trace as State) | [T, x, q] | 58.8 | 65.9 | 81.8 | 91.3 | 全面超越 Oracle@5,证明第二轮因果扫描实现了全局综合与纠错 |
这份消融数据沉重打击了业内的两种常见偏见。
第一种偏见认为,给模型输入更多 Token 本质上只是提供了一个“思维脚手架”或缓冲池。
Random Trace 的对照直接击碎了这种说法:一旦喂给模型同任务其他题目的错误轨迹,模型的表现立刻出现雪崩式下滑(Parents EM 跌至 14.2%,远低于没有任何轨迹的 29.2%)。
这证明模型是真的在强依赖前置轨迹中蕴含的特定图拓扑与逻辑推演线索。
第二种偏见认为,两轮推理只是在对首轮结果做多轮重采样。
消融表显示,Trace as State 的表现(EM 81.8%)大幅甩开了事后挑选最优单次的 Oracle@5(EM 50.0%)。
这意味着第二轮因果扫描并不是简单地挑出某条轨迹里的现成答案,而是站在 5 条探索路径的肩膀上,在重读原始长文本时完成了交叉验证、证据补全与逻辑提纯。
03 路线分岔:显式回灌 vs 循环深度传闻,以及智谱的第三条轴
在更广阔的技术视野下,清华与智谱团队选择在这个时间节点发布《Trace as State》,恰好与全球 AI 产业关于“下一代 Transformer 架构与计算范式”的激烈博弈撞在了一起。
伴随 Astra 的发布,科技媒体 The Information 刊发深度报道,声称 Astra 背后采用了一种被称为循环深度(Recurrent Depth 或 Looped Transformer)的全新秘密技术。7
根据传闻描述,模型不再单纯依靠堆叠物理网络层,而是在产出每一个 Token 之前,让隐层向量在一组共享权重的 Transformer 块中循环迭代多次,在潜在空间(Latent Space)中直接完成深度思考。
然而,严谨的事实核查要求我们必须对产业传闻与官方确认做出清晰的切割。
查阅 OpenAI 官方部署安全中心发布的完整版《GPT-6 Astra 系统卡》(System Card)及技术介绍页面,官方自始至终未曾确认过任何关于“循环深度”、“Looped Transformer”或共享层循环的底层架构细节。8
在系统卡的全文检索中,类似词汇唯一出现的地方甚至只是生物安全章节中提及的“recurrently mutated genes”。
著名机器学习学者塞巴斯蒂安·拉施卡(Sebastian Raschka)随即发表长文,对这种神化循环深度的传闻进行了有力降温。9
拉施卡指出,循环深度并不是某种颠覆物理法则的魔法,它只是在发出下一个 Token 前在隐藏态中做额外计算,不仅无法简单等同于“隐藏思维”,在工程上反而会面临隐藏态数值崩溃与层内循环收益快速递减的物理约束。
而在中国本土,循环深度有着更硬性的官方语境。
在 2026 年 8 月 31 日举行的智谱 2026 年中期业绩电话会上,创始人、清华大学教授唐杰在阐述未来技术战略时公开指出:模型能力的 Scaling 不仅意味着扩大基座参数规模,还可以通过增加“有效计算深度”来实现。3
唐杰当时透露,智谱也在推进利用 Loop Transformer 让模型在思考过程中想得更深、从而压低推理成本的相关研究。
正是在这一背景下,《Trace as State》的问世呈现出了极为耐人寻味的技术分岔:
| 评估维度 | 传统长文本单遍方案 (Direct Pass) | 显式轨迹文末追加 (Trace Append) | 显式轨迹前置状态化 (Trace as State,本论文) | 隐空间循环深度架构 (Looped Depth,Astra 坊间传闻) |
|---|---|---|---|---|
| 信息载体 | 无中间状态,纯文本单次映射 | 显式自然语言文本 | 显式自然语言文本(状态代理) | 连续潜变量激活态(Latent States) |
| 架构改动要求 | 无改动(现有标准因果模型) | 无改动(现有标准因果模型) | 完全零改动(仅调整输入 Token 顺序) | 高(需重新设计层内循环与训练优化器) |
| 重训与适配成本 | 无 | 无 | 零重训,纯推理时算法(Inference-time) | 极高,需重新进行大规模预训练与退火 |
| 长图推理能力 (Parents EM) | 弱 (GLM 66.4% / DS 29.2%) | 中等 (GLM 83.2% / DS 43.0%) | 极强 (GLM 100.0% / DS 81.8%) | 未公开(缺乏经过独立验证的公开基准) |
| 首字输出延迟 (TTFT) | 低(标准 Prefill) | 低 | 翻倍增加(需完整执行首轮探索与序列化) | 理论可动态可调,但单步隐层循环开销显著增加 |
| 多轮 KV-Cache 兼容度 | 极佳(静态上下文长久缓存) | 良好(前缀长文本可稳定复用) | 极差(破坏性击穿,每题均需重新 Prefill) | 良好(标准前缀缓存机制依然成立) |
| 安全审查与过程可监控性 | 弱(无推理过程可查) | 强(可逐字审计文末思维链) | 极强(推理状态以纯文本形式前置暴露) | 极度黑盒化(过程沉淀于隐层,监控探针难以捕获) |
| 证据与落地状态 | 行业绝对现状 | 行业标准最佳实践 | 论文实验已验证(arXiv:2609.02702v1 预印本) | 仅见于媒体报道与坊间推断,官方从未确认 |
这一矩阵清晰展现了两种完全不同的技术哲学。
循环深度试图在微观上改造模型的神经突触,把计算折叠进模型内部的潜空间,追求更紧凑的模型体积与可能的推理速度,但必须承担昂贵的重训成本与黑盒化风险。
而 Trace as State 是一次彻底的“黑客式外挂”:它承认现有大模型架构的不可更改性,利用宏观系统工程上的多轮输入重排,把显式生成的自然语言思维链强行降维改造成驱动因果注意力的控制状态。
04 落地代价与安全启示:KV-Cache 损耗与可监控性的一体两面
任何不谈代价的算法提升都是工程耍流氓。《Trace as State》的作者在论文末尾的“局限性”(Limitations)章节中,极其克制且诚实地指出了这项技术的两大现实死穴。2
第一个死穴,是对大模型推理核心基础设施 KV-Cache 复用机制的直接破坏。
在大模型商业化推理集群中,降低长文本成本的关键命脉在于“前缀缓存(Prefix Caching)”。
当数百位用户围绕同一份数十万字的技术手册、财报或代码库发起提问时,推理引擎只需要在显存中计算并缓存一次这段超长背景的 Key/Value 状态向量,后续的所有请求都可以跳过耗时且昂贵的 Prefill 阶段,以极低成本直接进入解码。
然而,Trace as State 要求把针对具体问题动态生成的综合轨迹 T 强行塞在长文本 x 的最前面(序列变为
[T, x, q])。这意味着,输入序列的最左侧前缀变成了随题目实时变动的随机变量。
在因果注意力机制下,左侧前缀的改变会导致其后方长达数十万字的所有 Token 内部隐藏态全部发生改变。
原本可以跨请求、跨会话长久驻留显存的巨额长文本 KV-Cache 在瞬间全盘失效。
每来一个新问题,推理服务器都必须把整篇几十万字的长文本重新从头到尾完整计算一遍 Prefill。
这不仅会让首字生成时间(TTFT)出现灾难性暴增,更会使公有云推理提供商的硬件吞吐量发生雪崩。
第二个死穴,是高昂的计算放大倍率。
为了生成那段高质量的前置轨迹 T,系统必须在第一轮完整运行 5 次推理,并施加严格的字符截断(论文中截断至前 50,000 字符)。
正如公众号“技术尺度”在深度复盘中所指出的:这种两阶段前置方案虽然显著拉高了难例的极限准确率,但每道题的 Token 消耗量与算力开销成倍放大,与产业界追求压低推理单价的商业化方向背道而驰。3
但如果把视线从工程账本移开,投射到 AI 安全与对齐的全球治理语境中,Trace as State 却展现出了一种意外的制度性光芒。
就在几天前的 2026 年 9 月 6 日,OpenAI 首席科学家雅库布·帕乔茨基(Jakub Pachocki)在其长篇署名文章《An Alien Mind》中发出了极度严肃的行业警告。10
帕乔茨基指出,随着前沿模型能力的爆炸式加速,行业对显式思维链(CoT)的可监控性依赖正在急剧递减。
模型在更高维度的强化学习驱动下,开始展现出操纵内部思维记录、隐藏真实意图的潜在倾向;而如果在底层采用潜在循环计算,人类对模型推理过程的外部审计窗口将被彻底关死。
OpenAI 官方在 GPT-6 Astra 的安全报告中同样承认:相较于前代,Astra 的过程可监控性已经出现了实质性下降。8
恰恰在这一安全悬崖边,《Trace as State》提供了一个极其珍贵的技术样本:
它证明了即便在最具挑战性的超长上下文复合逻辑任务中,人类依然不需要滑向不可解释的潜在黑盒计算。
通过把可读、可查、可验证的自然语言思维轨迹提炼为状态并重新前置,因果模型同样能够爆发出匹敌乃至超越极限采样的纠偏能力。
在这个框架下,任何一段被用作状态代理的推理轨迹,都是白纸黑字呈现在输入序列之中的。
外部安全网关、合规探针与人类审计员,可以在第二轮因果计算发起前,对这段前置状态实施拦截、比对、清洗甚至红队注入。
这是一种将模型认知过程完全置于阳光下的“可审计推理”。
05 检验这项技术的三个可观察指标
一项来自学术预印本的技术主张,要真正变成影响产业与研究路线的实质力量,往往需要经历严酷的工业检验。
对于关注大模型架构与长文本落地的决策者而言,未来 6 到 12 个月内有三个明确的时间尺度观察点:
第一个指标,是国产主流推理平台是否会推出支持两阶段前置的专用 API 封装。
鉴于唐杰兼具清华学者与智谱领军人物的双重身份,智谱的 Bigmodel 开放平台以及阿里云百炼等基础设施,是否会在 API 端原生提供自动化的一键 Trace as State 模式?
如果在工程层面能够引入分块并行计算或针对前置轨迹的差分缓存优化,将该方案的推理开销压制在商业化可承受区间,这项技术才可能从论文 Demo 真正走向生产环境。
第二个指标,是未来长文本评测基准对“提示词序列鲁棒性”的制度化引入。
Trace as State 揭示了单向因果注意力在长上下文排列顺序上的极端脆弱性。
未来的长文本评测基准(如长文本理解排行榜、复杂工具调用基准),是否会强制将
[Context, Query]、[Query, Context] 与 [Trace, Context, Query] 等不同顺序排列纳入评分矩阵?这不仅是衡量模型智力的标尺,更是倒逼模型研发团队在预训练阶段消除“条件后置注意力衰减”的技术驱动力。
第三个指标,是全球前沿实验室对隐空间循环深度的官方揭秘。
在接下来的学术会议(如 NeurIPS 或 ICLR)以及前沿技术白皮书中,OpenAI 是否会打破沉默、正式公开 Astra 在隐藏层推理与架构循环上的真实实现?
当隐空间循环深度与显式状态前置这两种路线的真实算力成本与性能收益被完全摊在桌面上时,行业才会最终见证:解决长文本复杂认知的终极答案,究竟是藏在不可见的潜在层回环里,还是写在被人类清清楚楚看见的那几行前置轨迹之中。
References
- 1
- 2Trace as State HTML Fulltext
arxiv.org
- 3技术尺度:唐杰新论文提到Loop Transformer,但讲的另一种Loop
mp.weixin.qq.com
- 4智猩猩AI:唐杰新作!不改模型不做训练,GLM-5.2长上下文推理精确匹配率飙到100%
mp.weixin.qq.com
- 5Path to Astra
openai.com
- 6
- 7
- 8GPT-6 Astra System Card
deploymentsafety.openai.com
- 9Sebastian Raschka:Debunking OpenAI Astra and Looped Transformers
sebastianraschka.com
- 10An Alien Mind
openai.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
