窗口:2026 年 7 月 20 日至 26 日。
这周的五篇论文,关注点从「怎么训练 agent」一路落到「模型如何看、生成、压缩和辅导」。每张卡片只留一个研究线索,配文补上它在前人路线里的位置。
01|OpenForgeRL:把训练搬进真实的 Agent Harness
过去的 agent 训练大多围绕模型本身展开,但 Claude Code、Codex 一类系统真正运行时,还包着多轮上下文、工具调用、子代理和外部环境。论文指出,常见的开放训练栈很难直接表达这种有状态、多进程的 inference harness。OpenForgeRL 用 proxy 记录 harness 的模型调用,再把每次 rollout 放进独立远程容器,接到标准 RL 代码库上。它在 ClawEval、OSWorld-Verified、Online-Mind2Web 和 WebVoyager 上报告了 31.7 pass³、37.7、63.0 和 72.3 等结果;错误恢复仍然偏弱。1 2
这条线往前推的地方,是把「可训练对象」从裸模型扩成了真实运行时。以后比较 agent,不看 harness,结论可能并不完整。
02|MIRROR:同一道题,让文字和图像互相教
视觉语言模型在几何题上经常出现一种不稳定:同一道题,换成文字、图像或图文组合,模型的表现会变。MIRROR 把三种视图配成 ODA-Data,先找出当前最会解的视图,再用它给弱视图的 on-policy rollout 做 reverse-KL 指导,避免把不同模态简单混在一起训练。以 Qwen3-VL-4B Instruct 为 base,论文报告 GeoInt pass@1 从 58.62 提升到 66.15,ODA-Train 上同时能解的题目增加 8.95%。3 4
它的切入点很具体:模态差异不必先被抹平,也可以变成 teacher selection 的自监督信号。
03|SANA-Video 2.0:25% 的 Softmax,换来更长更快的视频
视频扩散 Transformer 想处理更长、更高分辨率的序列,纯 full-softmax 的代价会快速上升;纯线性注意力又容易丢掉全局 token 交互。SANA-Video 2.0 从头训练 5B 和 14B 混合架构,让 75% 的层使用 gated linear attention,25% 的层作为 gated softmax anchor,再用 Block Attention Residuals 把前面刷新过的表示传给后层。论文报告 81 帧版本 VBench Total 为 84.30,720p/60s 的 compiled DiT forward 比匹配的 full-softmax baseline 快 3.2 倍。5 6
这不是把昂贵的全局交互全部删掉,而是只在关键位置保留它。
04|MXSens:别让每一列参数都背同样的精度
4-bit 推理的麻烦来自 outlier,但 outlier 的严重程度并不均匀,模型不同层、不同列对量化误差的敏感度也不同。MXSens 用列级 Hessian 敏感度和层级输出误差,给 MXINT block 分配 4、6、8 bit,不需要重新训练。论文在 LLaMA-2-70B 的 W4A4KV4 设置下报告 WikiText-2 PPL 3.77,并估计在平均约 4.03 bit 时,内存增加低于 1%,延迟开销约 3%。7 8
量化的研究重点由「统一降精度」移向「把精度花在最敏感的列上」,这是硬件约束和模型误差之间更细的折中。
05|AI Assistants Overassist:AI 助手为什么总想抢答?
AI 辅导的即时目标是把当前题做对,学习的目标却是让人下次能独立解决。AI Assistants Overassist 提出 Int-Bench,让学生模型解题、教师模型观察推理并决定何时介入,覆盖代码调试、数学和脑筋急转弯。研究发现,LLM 比人类更早、更频繁介入,也更常给出接近完整答案;标准条件下的介入频率约为 0.90,但对新问题的迁移提升并不显著。9 10
这篇把「答对」和「学会」拆开测量,也提醒产品设计:提示的时机和分量,本身就是能力的一部分。
本期观察:五篇论文都在减少一个粗粒度假设。训练 agent 不只训练模型,跨模态推理不只追求统一,视频注意力不只在全量 softmax 与全量线性之间二选一,量化也不该把所有参数视为同样脆弱,AI 辅导更不能把即时正确率当成学习完成。




Comments
Sign in to comment.