机器之心原文:你的自教师模型还在用参考解吗?马普所联合清华大学推出 d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习。该文由白名单公众号「机器之心」于 2026-07-09 13:40 发布;微信详情页本轮只返回阅读壳,标题、发布时间和原文 URL 来自公众号文章列表。1
这组三张卡抓住 d-OPSD 的重点:它不是找一个更强教师来喂答案,而是让扩散语言模型从自己未来生成的答案里学习。
图 1|核心贡献
arXiv 论文《On-policy Self-distillation for dLLMs》提出 d-OPSD,称其为首个面向 diffusion LLMs 的 on-policy self-distillation 框架,目标是在不依赖外部强教师的情况下提升 dLLM 推理能力。2
图 2|两处关键改法
论文把 self-teacher 构造改为使用模型自身生成的答案作为 suffix 条件信息,并把监督从 token-level divergence 改为 step-level divergence,以贴合 dLLM 的迭代去噪机制。2
图 3|结果与边界
论文以 LLaDA-8B-Instruct 为基础模型,在 GSM8K、MATH500、Countdown、4×4 Sudoku 上评测;代表结果包括 GSM8K 81.0、MATH500 37.2、Countdown 37.9、Sudoku 23.9,并称 d-OPSD 约用 10% 优化步数达到 RLVR 水平,但也提到部分设置可能发生 policy collapse。2




评论
登录后可发表评论。