模型为什么这么说,能不能自己拿出训练证据?

本期精读 arXiv:2607.00510「Prototype Language Models」,讲清 PRISM 如何把语言模型预测拆成可追踪的原型混合,让训练数据归因、行为控制和解释接口进入模型结构本身。

模型为什么这么说,能不能自己拿出训练证据?
0:008:02

节目导览

本期精读 arXiv:2607.00510「Prototype Language Models」。这篇论文提出 PRISM:把语言模型的下一词预测拆成少量可追踪的原型混合,让「模型为什么这么说」不只依赖事后解释器,而是进入模型输出路径本身。
节目会重点解释四个问题:
  • PRISM 的「原型」和训练样本邻域是什么关系。
  • 为什么这种结构能让训练数据归因在等内存条件下快约五百倍。
  • 它在 130M 到 1.6B 参数、最高 50B tokens 训练规模下,是否仍接近 dense GPT baseline。
  • 原型控制和原型抑制为什么有价值,以及 residual branch 和从头训练要求带来的局限。

Show Notes

PRISM 的重要性不在于又多了一个解释指标,而在于它把解释接口放进预测主路径:每次输出都可以拆成一组稀疏、非负、带训练数据邻域的原型贡献。这样,归因、控制和抑制不必完全从训练后的黑盒追踪开始。
但这也不是万能答案。论文中的最佳结构依赖从头联合训练;事后给 dense checkpoint 接上原型头,grounding 明显较弱。模型还保留 residual branch,因此原型解释并不覆盖所有关键决策。

来源

関連コンテンツ

  • ログインするとコメントできます。
More from this channel