
AI 论文早报|7 月 29 日:模型训练、代理评测与视觉自博弈的 5 个新信号
5 篇 7 月 28 日提交的 arXiv 预印本,覆盖大模型训练、MoE 适配、桌面代理评测、驾驶自博弈和图像视频生成。
今日看点
今天选的 5 篇论文,刚好落在模型能力的几个「卡脖子」位置:训练时如何把学生从错误推理里拉回来,推理时如何把算力花在真正不确定的 token 上,桌面代理能否确认自己刚才的动作有没有生效,以及视觉模型怎样在更快生成和更长时间行动之间取得平衡。
- 训练:Relay-OPD 让教师模型在学生走偏时短暂接管,1.7B 学生模型相对标准 OPD 平均提升 5.73%,训练轨迹长度减少超过一半。1
- 效率:CARE 根据路由器的不确定性决定调用多少个 LoRA 专家,在更少激活专家的情况下达到固定 4 专家基线的表现。2
- 代理可靠性:Desktop-Delta Bench 显示,最好的模型在桌面状态排序任务上的 exact match 也只有 65.1%(无干扰项)和 65.7%(有干扰项)。3
- 视觉控制:Pictura 用自车视角训练驾驶策略,单张 H100 每秒可跑 50 万个 agent step,训练规模达到 500 亿步。4
- 生成加速:PDD 让图像和视频扩散模型用 4 到 8 次函数评估完成生成,并在 LTX-2.3、Wan 14B 和 Qwen-Image 上报告了 SOTA 结果。5
1. 让学生模型在走偏后把接力棒交回来
论文:Pass the Baton: Trajectory-Relayed On-Policy Distillation · 2026 年 7 月 28 日提交 · 大模型训练 / 自然语言处理
问题背景
On-policy distillation(在学生自己的生成轨迹上做蒸馏)能让监督更贴近学生实际会犯的错误,但也有一个很具体的失败模式:学生在推理前缀里一旦走错,后面会沿着错误方向继续生成,教师给出的监督因此变得不可靠,计算也被浪费掉。
方法要点
论文提出 Relay-OPD。它先检测教师和学生在失败前缀上的延续差异:教师倾向于改道,学生却倾向于沿原方向继续。触发后,教师短暂接管,生成一段 teacher leg,再把生成权交回学生继续训练。干预预算是有限的,重点放在较早、较关键的位置,避免训练轨迹过度偏离学生自身策略。1
结果亮点
实验使用 Qwen3-4B-Instruct-2507 作为教师,训练 Qwen3-0.6B 和 Qwen3-1.7B Non-Thinking 学生模型,在 8 个数学推理基准上测试。1.7B 学生相对标准 OPD 平均提升 5.73%,相对 FastOPD 平均提升 1.49%;每个基准都拿到最好或第二好的结果,训练轨迹长度则减少超过 50%。0.6B 学生也保持了一致提升。1
为什么值得看
它把「蒸馏」从全程模仿改成了关键时刻纠偏,适合继续追踪小模型推理能力能否靠更精细的训练调度获得提升。论文目前是 arXiv 预印本,摘要给出了总体提升,但没有在摘要中展开每个基准的完整数值表。
2. 不确定的 token,多分一点专家预算
论文:Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA · 2026 年 7 月 28 日提交 · 机器学习 / 参数高效微调
问题背景
MoE-LoRA 通常给每个 token 固定调用 k 个专家。可是 token 的难度并不一样:简单 token 可能被过度计算,真正含糊或困难的 token 又可能拿不到足够的专家意见。
方法要点
CARE 把路由器的输出分布当作不确定性信号:权重集中,说明路由器更自信;权重平坦,说明多个专家都不太确定。它按路由权重从高到低累积专家,直到达到一个 nucleus 式阈值;如果已选专家之间意见分歧,再小幅扩大集合。一个 budget thermostat 负责校准阈值,让平均激活专家数对齐目标预算。整个规则不增加参数,只需一次前向传播。2
结果亮点
在 LLaMA-3.1-8B 和 Qwen2.5-7B 上,论文覆盖 8 个常识推理基准,以及数学、代码和知识任务。作者报告,CARE 在匹配计算量下优于固定 top-k 的 MoE-LoRA;在激活更少专家时,仍能达到固定 k=4 基线的表现,还改善了分布外检测。摘要没有给出统一的平均提升百分比,因此这里不把「更省」写成具体速度数字。2
为什么值得看
它提供了一个很实用的推理预算分配思路:不是让所有 token 平均享受同样的模型容量,而是把额外专家留给路由器自己拿不准的地方。后续要重点看完整论文里的任务级开销、阈值校准方式和不同模型规模下的稳定性。
3. 桌面代理真的看懂了自己刚才做了什么吗
论文:Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions? · 2026 年 7 月 28 日提交 · 计算机视觉 / Computer-Use Agent 评测
问题背景
现有桌面代理评测常看两件事:单帧里能不能找到按钮,长任务最后有没有完成。但真实交互还缺一层:模型要判断刚才的点击、拖拽或输入,是否真的造成了预期状态变化。推理、远程输入、应用渲染和截图捕获是异步的,下一张截图可能延迟、短暂、被遮挡,甚至与动作无关。3
方法要点
Desktop-Delta Bench 收集了多应用 Linux 轨迹,专门测三类能力:状态确认、变化来源追踪、结合上下文控制。基准包含两个任务:463 个三帧时间排序实例,其中 105 个带跨轨迹干扰项;以及 1,550 个 before-after 动作对,覆盖 5 类动作及其 payload。数据总量为 2,013 个经人工核验的实例,覆盖约 15 个应用和 50 个任务领域。3
结果亮点
论文评测了 8 个闭源和开源模型家族。排序任务中,最佳模型的 exact match 只有 65.1%(无干扰项)和 65.7%(有干扰项)。加入任务上下文后,干扰项识别提高 6.9 个百分点,但无干扰项的 exact match 反而下降 2.2 个百分点。单动作任务里,click 的 F1 为 0.96,drag 的 F1 为 0.76,说明判断动作类别比定位动作位置更难。3
为什么值得看
它把「代理有没有完成任务」拆成了一个更能指导改进的中间问题:代理是否知道自己正在看到哪一次状态变化。这个诊断层如果被纳入训练和评测,可能比继续堆最终任务成功率更能暴露桌面操作中的脆弱点。
4. 用自车视角做大规模驾驶自博弈
论文:Pictura: Perspective-View Self-Play at Scale for Driving · 2026 年 7 月 28 日提交 · 计算机视觉 / 自动驾驶
问题背景
许多驾驶自博弈系统依赖位置、速度等特权向量观测,甚至能看到被遮挡的交通参与者。这样的策略在模拟器里表现不错,却和真实车辆只能通过车载摄像头获得部分视野的情况存在表示差异。直接把特权策略蒸馏给摄像头模型,又可能让学生模仿一些自己根本看不到、无法解释的决策。
方法要点
Pictura 是一个 GPU 加速的多智能体驾驶模拟器,每一步都渲染每个智能体的自车视角图像。作者用普通 PPO 做 perspective-view self-play,训练 Alberti,不使用特权观测。这样做的核心变化不是换一个更大的策略网络,而是把训练时的输入改成部署时真正能看到的视角。4
结果亮点
单张 H100 上,Pictura 最高可运行 500K agent-steps/s,即每秒生成约 2M 张图像。训练规模达到 500 亿 agent steps,约 3,500 万公里的驾驶。把 Waymo Open Motion Dataset 的布局重新渲染到 Pictura 后,Alberti 可以 zero-shot 迁移,并且优于使用特权向量观测的对照智能体。4
为什么值得看
这篇的重点是把「从特权信息学出来,再迁移到视觉」改成「一开始就用部署视角学」。如果仿真器的渲染和训练吞吐能复现,视觉驾驶自博弈的实验规模会有明显扩展空间;但 zero-shot 结果仍依赖重新渲染后的布局,不能直接等同于真实道路测试。
5. 让扩散模型一次网络评估多走几步
论文:Parallel Decoding Distillation for Fast Image and Video Generation · 2026 年 7 月 28 日提交 · 图像与视频生成
问题背景
扩散模型和 flow matching 模型通常要经过多轮迭代采样,视频生成尤其容易被推理速度拖住。现有加速蒸馏方法常用变分 score distillation 或对抗损失,训练难度较高,也可能出现 mode collapse,表现为视频多样性下降、运动不足。
方法要点
Parallel Decoding Distillation(PDD)是一种基于轨迹的蒸馏方法。它让网络一次评估预测多个去噪步骤,学习平均速度的表示,而不是用 JVP 或有限差分去回归速度导数。方法兼容预训练模型,并支持变化的 function evaluations(NFE),因此可以在速度和质量之间调节。5
结果亮点
论文在 LTX-2.3 Text-to-Video/Audio、Wan 14B Text-to-Video 和 Qwen-Image Text-to-Image 上,以 4 到 8 次 NFE 报告了 SOTA 结果,同时报告生成视频多样性明显提升。摘要没有提供统一的速度倍数或各数据集的具体指标,因此这篇更适合作为方法方向的快速筛选,而不是据此下生产级性能结论。5
为什么值得看
它同时碰到了生成模型部署的两个痛点:采样步数太多,以及加速后容易牺牲动作和多样性。能否在 4 到 8 次网络评估下稳定保留视频运动,是后续读完整实验时最该核对的地方。
一句话收束
References
- 1Pass the Baton: Trajectory-Relayed On-Policy Distillation
- 2Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA
- 3Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?
- 4Pictura: Perspective-View Self-Play at Scale for Driving
- 5Parallel Decoding Distillation for Fast Image and Video Generation
Related content
- Sign in to comment.
