本期说明
本期覆盖北京时间 2026 年 7 月 27 日至 7 月 30 日。三篇论文均为 7 月 27-28 日首次提交的 v1;7 月 29-30 日新提交论文尚未形成更强的白名单平台直接讨论,因此本期采用近 72 小时回看。三篇都找到 X/Twitter 具体原帖,未发现对应的 Reddit / Hacker News 直接讨论,互动指标保持 X 平台原生口径,不跨平台相加。
01|PDD:并行解码蒸馏
论文:Parallel Decoding Distillation for Fast Image and Video Generation,arXiv:2607.26004v1,首次提交于北京时间 7 月 29 日 01:20。
作者与机构:Neta Shaul、Chao Liu、Arash Vahdat、Julius Berner。论文 HTML 列出 NVIDIA 与 Weizmann Institute of Science;可用摘录未完整展开逐作者机构编号,其中 Neta Shaul 另列 Weizmann Institute of Science。以下不补写未明确给出的个人归属。
它做了什么:PDD(Parallel Decoding Distillation)把扩散 / flow matching 模型的轨迹蒸馏成并行解码器,一次网络评估预测多个去噪步骤,并支持可变 NFE。
论文报告的结果:在 LTX-2.3 文生视频/音频、Wan 14B 文生视频和 Qwen-Image 文生图上,以 4-8 NFE 达到论文所称的 SOTA;同时报告生成视频多样性提升。Qwen-Image 的 4 NFE 结果中,PDD Midpoint 的 OneIG-EN / DPG-Bench / GenEval 为 0.538 / 88.66 / 0.86。
边界:大规模文本到图像 / 视频实验依赖 data-free training;除 ImageNet-256 外的 data-dependent setting,论文列为 future work。也就是说,少步数结果不能直接解释成所有训练条件下都成立。
社区信号: X 原帖 为 @ArashVahdat 发布。页面显示 10,753 views、192 likes、33 reposts、5 replies、158 bookmarks;这是本组三篇中互动更强的一条直接帖,指标按 X 页面显示保留。
来源:arXiv 论文页 · NVIDIA 项目页
02|MAPD:把多智能体轨迹压成协议
论文:From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search,arXiv:2607.24280v1,首次提交于北京时间 7 月 27 日 19:27。
作者与机构:Junlin Liu、Jiangwang Chen、Zixin Song、Shuaiyu Zhou、Chunji Lv、Hank Wu、Kailin Jiang、Jinyang Wu、Bohan Yu、Chenxi Zhou。论文摘录明确列出:Chunji Lv - Beijing Institute of Technology;Hank Wu - East China Normal University;Kailin Jiang - University of Science and Technology of China;Jinyang Wu - Tsinghua University;Bohan Yu、Chenxi Zhou - University of Chinese Academy of Sciences。Junlin Liu、Jiangwang Chen、Zixin Song、Shuaiyu Zhou 的机构在可用来源中未提供,不能据姓名或团队背景补全。
它做了什么:离线多智能体系统先分解问题、检索证据、修复失败搜索,再把探索轨迹整理为结构化 JSON protocol。训练时,protocol 只进入 student policy 的 privileged branch,并与 token-level self-distillation(OPSD)和稀疏 GRPO 一起优化。
论文报告的结果:覆盖 7 个知识密集型 QA benchmark:NQ、TriviaQA、PopQA、HotpotQA、2WikiMultihopQA、MuSiQue、Bamboogle。Qwen3-1.7B 的平均成功率为 39.4%,Qwen3-4B 为 44.4%;相对最强 baseline SDAR,论文给出的平均提升为 4.8% 和 3.3%。protocol 预先合成并缓存,不增加推理时延。
边界:训练只使用 NQ 与 HotpotQA 的训练集,7 个评测集里有 5 个完全未见于训练;student 最多 4 个 interaction turns,每次检索返回 local wiki-18 的 top-3 passages。这里的 OOD 结果不能替代更开放检索环境下的验证。
社区信号: X 原帖 为 @_akhaliq 发布。页面显示 16,212 views、25 likes、10 reposts、1 reply、27 bookmarks;浏览量有,但点赞和回复较少,标为弱互动信号。
03|HiFi-UMI:机器人自由数据也能做 post-training
论文:HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone,arXiv:2607.25895v1,首次提交于北京时间 7 月 28 日 23:52。
作者与机构:论文作者署名显示为 Simple AI;作者列表为 Yuteng Wei、Jinming Ma、Jiawei Wang、Weitao Zhou、Yushen Zuo、Ke Rui、Minglei Li、Jinhao Zhang、Zhikang Pan、Xiang Wang、Haoran Jia、Huan Du、Zicheng Zeng、Jun Ma、Guiyu Qin、Di Zhang、Xiaofei Li。可用 arXiv / HTML 文本未提供机构字段,因此机构记为「未提供」,不从项目页或常识推断。
它做了什么:HiFi-UMI 将头戴式离线立体惯性 SLAM、原生双手相对位姿、微秒级 GPIO 同步、每只手两枚约 200° 广角相机,以及六阶段数据流水线组合起来,目标是仅用高保真 robot-free UMI 数据完成 zero-robot post-training。
论文报告的结果:workspace-local end-effector accuracy 为 33 mm;最强策略在精密插入任务达到 85%。使用同一数据源的 4,000 小时预训练后,10 个未见任务的 action error 降低 41%,StarVLA-QwenPI 的真实机器人成功率再提升 18.1 个百分点。与 teleoperation baseline 的差值分别为 StarVLA-QwenPI -2.5pp、OpenPI-pi0.5 +3.1pp、LingBot-VA -0.6pp。
边界:实验限于 3 种 backbone、4 个桌面操控任务和各自的部署协议;论文没有严格消融来分离 fidelity、sample count、scene coverage 的作用。VLA 与 WAM 的绝对成功率也不能直接横比。
社区信号: X 原帖 为 @_akhaliq 发布。页面显示 10,207 views、23 likes、4 reposts、1 reply、11 bookmarks;点赞和回复较少,标为弱互动信号。




Comments
Sign in to comment.