ENTD 揭示 LLM 训练的长尾:高频高熵前缀仍难以拟合

ENTD 揭示 LLM 训练的长尾:高频高熵前缀仍难以拟合

一篇 2026 年 7 月的 arXiv 预印本把训练语料的经验下一词分布作为参照,在 Pythia 70M–2.8B 上发现平均训练损失掩盖了样本级长尾:2.8B 模型约 20% 的分层样本几乎贴合,而高频高熵前缀仍难以拟合。

先把「学会」写成一个可测量的问题

预训练的目标是让模型给出下一词概率。对训练语料中的一个上下文,论文先统计它在语料里实际接过哪些 token,以及每个 token 出现的频率,得到经验下一词分布,简称 ENTD。它可以看作训练交叉熵在函数空间里的理想参照:如果模型拥有足够自由度,并且只关心训练语料中的这些上下文,ENTD 就是损失的全局最优解。1
问题因此变得具体:模型的下一词分布,离同一上下文在训练语料中的经验分布有多远?Zachary Izzo 在 NEC Labs America 的这篇预印本中,用总变差距离(TV)逐个前缀比较两者。TV 为 0 表示两组分布完全一致,接近 1 则表示几乎没有重叠。1
原文入口:arXiv:2607.14306。论文发表于 2026 年 7 月 15 日,目前仍是预印本。
这一步把「模型记住了多少训练数据」换成了更细的问题:哪些上下文已经被拟合成了接近语料的分布,哪些上下文即使在训练集里出现过很多次,模型仍然给出了过窄或偏离的预测?

ENTD 让平均损失露出长尾

论文使用 Pythia 系列的 base model,覆盖 70M 到 2.8B 参数,并利用 Pythia 提供的训练中间 checkpoint,观察差距随训练推进的变化。模型使用 The Pile 训练,评估前缀也来自训练语料。作者构造了两个分层样本:一个按任意语料位置统计 ENTD,共 83,963 个前缀;另一个只按训练窗口对齐位置统计 ENTD-T,共 56,052 个前缀。分层的目的,是避免评估集几乎全被只出现过一次的长前缀占据。1
2.8B 模型最后一个 checkpoint 的结果很能说明问题:分层评估样本中,约 20% 的前缀与 ENTD 的 TV 不超过 0.0093,几乎可以视为重合;但剩余样本的 TV 从接近 0 一直延伸到接近 1。也就是说,平均训练损失下降并不意味着所有上下文都以相似速度、相似方式被学会。1
论文把低 TV 样本检查为高频、低熵的模板化文本,例如 LaTeX 前缀、HTML 头部、许可协议和枚举。它们在语料中反复出现,而且后续 token 几乎固定,模型容易把下一词分布压到正确位置。高 TV 样本则分成几类:有些前缀只出现一两次,ENTD 本身就受到有限样本噪声影响;另一些前缀在语料中出现了上万次,却对应多个高概率续写,模型仍然只偏向少数几种延续。1
ENTD 与 ENTD-T 的 TV 差距分布,按模型规模和训练 checkpoint 展开
图中左侧是模型与标准 ENTD 的差距分布,右侧是模型与训练位置对齐的 ENTD-T 的差距分布。1
对高频前缀单独看,ENTD 的熵与最终 TV 的 Spearman 相关达到 0.80。这里的含义不是模型在高熵文本上只取得了更高的交叉熵,而是它连真实的「不确定性形状」都更难复现:语料允许多个续写,模型却更倾向于给出较窄的分布。作者将其视为 Transformer 归纳偏置的候选信号,但没有把它写成已经证实的单一机制。1

训练位置没有留下预期中的痕迹

训练数据通常按长度为 2048 的上下文窗口切成 batch,模型实际计算损失的是窗口内的前缀。论文因此定义了 ENTD-T,只统计这些训练对齐位置上的经验分布。直觉上,模型应该更接近 ENTD-T,而不是统计所有位置的标准 ENTD。
结果正好相反:在相同的 ENTD-T 评估前缀上,模型与标准 ENTD 的 TV 均值、中位数和高端尾部通常都更低。作者又把统计位置改成 offset 1 和 offset 1024,发现不同 offset 的差距分布几乎重合。模型输出表现出强的位置不变性,尽管这种不变性并不是 batch 训练直接要求的。1
不同训练位置 offset 下的 ENTD-T 差距分布
这四组小提琴图比较了不同模型规模与 checkpoint 下的 offset 0、1、1024,分布几乎重合。1
这项结果需要两层解读。第一,ENTD-T 每个上下文可用的计数平均只有 ENTD 的 1/2049,统计噪声明显更大;模型更接近 ENTD,部分可能只是因为 ENTD 的估计更稳定。第二,附录中的短程过拟合实验显示,当模型只反复训练两个 batch 时,预期的 batch 对齐效应确实出现了。因此,完整训练后的结果更像是「位置效应很弱,加上标准 ENTD 样本量更大」,而不是已经证明 Transformer 内部实现了某个独立的位置不变电路。1

softmax bottleneck 解释不了全部偏差

另一个候选解释是 softmax bottleneck。Transformer 最终通过 residual stream 与 unembedding 矩阵的乘积产生 logits,因此输出 logits 的秩受模型维度限制。若训练语料的经验下一词分布本身需要很高秩,模型可能只是被输出层表达能力卡住。
作者做了一个反事实对照:直接对评估样本的 ENTD 训练一个只受秩约束的 logits 近似器,不要求它经过 Transformer 的中间计算。对于 2.8B 模型,近似器使用 rank-2560,得到的 TV 差距低于真实模型在训练末期的差距。至少在这批约 8.4 万个评估前缀上,ENTD 可以被低秩 logits 较好近似,softmax bottleneck 不能独自解释模型为什么把分布拟合得更窄。1
这不是对 Transformer 内部原因的直接定位。低秩近似是在有限评估集上训练的,而真实模型在整个训练过程中处理了约 300B 次预测,论文也明确指出,当评估样本继续扩大时,低秩结构是否保持仍是开放问题。更稳妥的结论是:输出空间还有足够的低秩表达余量,剩余差距可能来自 Transformer 的架构归纳偏置、优化过程或数据本身,但当前实验没有把这些因素单独分离出来。1

这项工作把「数据中心解释」推进到哪一步

传统 mechanistic interpretability 常从模型内部出发,追踪神经元、特征、注意力头或跨层路径。ENTD 走的是另一条入口:它先从训练数据定义一个可计算的目标分布,再检查模型在哪些上下文上偏离这个目标。这个参照物不告诉我们某个 token 概率由哪条电路产生,却能先把「模型没有学会」拆成几种可区分的情况:
  • 低频前缀的高 TV,可能主要是 ENTD 计数不充分,不能直接当作模型失忆。
  • 高频、低熵的模板化前缀,往往接近确定性记忆,模型容易拟合。
  • 高频、高熵的自然文本前缀,暴露出模型对多种合理续写的分布拟合能力不足,相关性在高频样本中达到 0.80。
  • 训练随机性会贡献一部分模型间差距,但在更大模型中,它相对模型与 ENTD 的系统性差距变小。1
它的边界同样清楚。实验只覆盖 Pythia 的 70M 到 2.8B base model,尚未验证 frontier model;严格的 ENTD 只对训练语料中出现过的上下文成立,不能直接解释未见输入;分析对象是单步下一词分布,也不能直接推出长文本生成时的行为。论文还是预印本,作者把更大模型、其它开源模型和未见输入列为后续方向。1
这项工作的价值不在于已经找到了某个「记忆电路」,而在于提供了一个更硬的外部对照:先判断模型究竟在哪些数据分布上偏离,再去追问偏离是由有限样本、优化随机性还是内部表示造成。对可解释性研究来说,这比只报告一个整体 loss 更接近机制问题的入口。

相似内容

  • 登录后可发表评论。
More from this channel