回环·装机(ReDepth)

回环·装机(ReDepth)

一首硬核学术 rap,讲清如何把预训练 Qwen2.5-0.5B 改装成可重复运行的 latent 回环:6M LoRA 也能装机,但深度选择和多机制共存仍是边界。

0:00 / 3:09
这首歌选自 2026 年 8 月 13 日 arXiv cs.CL new listing;论文摘要页记录的 v1 提交日期是 2026 年 7 月 31 日。它问的不是「模型能不能多想」,而是:能不能把一个已经训练好的 Transformer,改装成同一段计算反复运行的回环机器?12
方法很具体:Qwen2.5-0.5B-Instruct 的 24 层被切成 Prelude、12 层共享的 Recurrent Block 和 Coda;后续 loop 重新注入 Prelude 表征,用 bridge 把输入锚回原来的流形。序列长度不变,也不增长 KV cache;每个 loop 在 latent state 里推进一步。先用中间步骤监督装上「执行规则」的机制,再撤掉中间标签,仍有 625/640(97.7%)的中间状态保持正确,额外继续迭代的状态有 357/384(93.0%)给出正确 continuation。3
数字最适合在通勤路上记成三句:6M 参数的 rank-16 LoRA 也能装上回环,与 180.6M full-block 版本在总体合成任务上接近(83.76% 对 84.04%);监督深度之外的有效 frontier 约为训练支持的 1.44–1.50 倍;在同一组冻结任务上,full-block recurrent 的总准确率 84.04%,serialized scratchpad 是 72.10%,深度 11–14 的尾部则是 53.13% 对 2.54%。A100、batch size 1 的测量里,深度 14 的 recurrent 路径为 301.8 ms,scratchpad 为 2,283.5 ms,论文报告前者约快 7.6 倍。这个比较是注册的 system-level 对照,不是把训练 token、FLOPs、优化历史全部对齐后的架构因果实验。3
这不是「通用推理已解决」:当前 learned depth selector 只在 768 行里选对 70 行(9.11%);controlled relay / pointer 表面达到 86% / 79%,但不是广泛自然推理 benchmark;逆向 operation 单独训练可到 63/64,和旧机制一起保留却撞上 catastrophic interference。论文还明确未证明 GPQA、数学、代码等外部 benchmark 上的优势。作者 Mark Shapiro 是 arXiv 唯一署名作者;论文页没有单独标注通讯作者或该论文所属机构。其 ORCID 公开记录显示目前任职 Tempus Labs、Chicago,职务为临床研究 SVP & GM,但这不是论文页标注的作者单位,不能直接当作论文归属。24
适合早高峰听:先抓住钩子「重复一块,深度翻倍」,再记住真正的边界——回环能装进预训练模型,能把 procedure 推过训练深度;但深度怎么选、多个 procedure 怎么共存,仍然是下一轮硬仗。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content