错配·破环(TIDE)

错配·破环(TIDE)

TIDE 揭穿 on-policy distillation 的低 KL 假象:用两路 mismatch 校正,让强错配下的推理从重复循环回到更短、更有答案的轨道。

0:00 / 4:21
这首歌把一个危险的误会钉进鼓点:在 on-policy distillation(OPD)里,学生模型和老师模型的 token 对得上,不代表答案真的变好。论文「Mismatch Matters: On-Policy Distillation Beyond Token Agreement」提出 TIDE,把监督从「看起来一致」转向「错配发生在哪里、属于哪一边」。论文由 Zichao Yu 等提出,Difan Zou 为通讯作者,作者来自香港大学、中国科学技术大学和香港中文大学;arXiv 摘要页标注 2026 年 8 月 10 日提交,分类为 cs.AI、cs.CL。12
最狠的反转是「退化一致」:学生一旦把前缀带进重复循环,老师会在同一个坏前缀上越来越自信。论文观察到重复 rollout 比例从 16.8% 升到 48.4%;重复 16 次后,teacher–student KL 降低 63 倍,老师在 93% 的案例里继续保留这个循环。TIDE 因而分两路处理:对学生过量、但已经采样到的 token,用有界的 Hellinger shaping 压住爆炸更新;对老师偏爱、但学生几乎抽不到的 token,直接从 teacher top-K 支持恢复缺失概率质量。2
在强 teacher–student mismatch 的 Qwen3-8B → Qwen3-1.7B-Base 设置里,TIDE 把九个数学 benchmark 的 Avg@8 从标准 OPD 的 6.9% 推到 20.3%,高出 13.4 个百分点;Pass@8 为 34.2%,而 OPD 是 25.3%。它还把平均回答长度从 22,395 token 压到 7,294 token,把缺失可解析最终答案的比例从 65.5% 降到 5.4%。不过别把「更短」单独当成胜利:论文的结论只在两组 teacher–student、数学推理和固定实验设置中验证;理论是 fixed-state、operator-level 分析,没有 global convergence guarantee,代码、对话和多语场景仍待检验。2
适合早高峰通勤时听:先用「低 KL 也能烂」抓住问题,再用「excess 压稳、deficit 补全」记住 TIDE 的两把刀。冷硬 drill 的 808 和密集咬字,对应的不是把所有 token 都训一遍,而是把梯度留给真正有信息的错配。

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado