arXiv AI 前沿日报|8 月 5 日:运行时编辑、世界模型体检与机器人数据

本期精选 Harness-R1、WorldExam 与 Ego2Robot:分别从运行时修补、世界模型反应性评测和人类视频合成机器人数据,拆开看模型之外的三种增量。

本期按北京时间 2026 年 8 月 5 日 08:15 截止:WorldExam 与 Ego2Robot 的 arXiv v1 首次提交日为 8 月 4 日;Harness-R1 首次提交于 8 月 3 日 22:12,作为 72 小时回看。三篇都有可打开的 X 讨论原帖,但截至核验时没有对应的 Reddit / Hacker News 直接帖;不同平台的互动数字不相加。

1. Harness-R1:失败轨迹先改运行时

核心问题:Agent 做错事,不一定要先改模型权重;也可能是运行时没有在正确的生命周期节点提供提示、拦截或恢复逻辑。Harness-R1 冻结目标 Agent,训练一个基于 Qwen3.5-9B 的 9B「harness engineer」,让它根据失败轨迹修改可执行运行时。1
方法分两步:877 条经验证的冷启动 SFT 样本,再用约 1,500 个失败 batch packet 做在线 GRPO;每次生成 K=8 个候选 patch,用同批任务重跑后的成功率变化 ΔB(P) 给奖励。唯一 patch 动作是 add_code_hook,可挂在初始化、决策前、动作前和动作后四个生命周期节点,并用 AST 检查拒绝 import、IO、动态执行和信息泄漏。2
在 WebShop 500、ALFWorld 500、DBBench 300 个任务上,冻结目标成功率从 44.3% 提到 53.6%;supervised-only engineer 为 46.4%,固定编辑器 GLM-5.2 为 48.8%。20 个未见目标配置平均提升 7.06 个百分点,但有回退:论文只验证了 vanilla 目标到直接 SFT 后目标的单步适配,奖励来自同批任务重跑,也不保证 patch 没有回退。2
作者:Shuai Shao、Kangning Zhang、Qingyao Li、Shijian Wang、Hao Wang、Wenxiang Jiao、Yuan Lu、Yi Guo、Weiwen Liu、Weinan Zhang。机构为上海交通大学、小红书(Xiaohongshu Inc.)、东南大学;Shijian Wang 标注东南大学,其余作者标注上海交通大学和/或小红书。3
社区信号集中在 X:@dair_ai 的原帖显示 67 赞、72 收藏、7 转发、8 回复、4,767 浏览;@gm8xx8 的原帖显示 31 赞、29 收藏、4 转发、1,821 浏览。两帖都是第三方讨论,不是作者/团队原帖。45

2. WorldExam:把「看起来真实」拆成四层

核心问题:视频世界模型画面逼真、能听懂显式指令,是否就能对场景变化作出自然反应?WorldExam 用 Visual Quality、Control Adherence、Spatial Consistency、World Reactivity 四层诊断这个问题,覆盖 1,474 个测试用例、8 个任务、20 个模型,并统一比较 camera-driven、action-driven、language-driven 三种范式。6
静态场景轨中,NeoVerse 的 Overall 为 85.39;动态交互轨中,Veo 3.1 为 72.77,榜首并不相同。人类标注对齐达到 Spearman ρ=0.8614、PLCC=0.8583;更换 DA3 重建后端时,静态轨平均绝对相对变化为 3.09%,动态轨为 0.57%。这组结果支持论文的区分:视觉质量与显式指令遵循,不等于内在反应性。78
边界也写得很清楚:动态轨只适用于部分模型,Goal Completion 只覆盖 language-driven 模型,评测依赖 VLM 判分,界面维度仍不完整。作者:Yuxue Yang、Shuyao Shang、Jiahe Wang、Zitong Zhou、Liang Tan、Junhan Zeng、Ruizhi Li、Junyan Li、Yu Liu、Xiao Yang、Yong Li、Jun Zhu、Hongsheng Li、Tieniu Tan、Lue Fan、Zhaoxiang Zhang。机构映射为:CASIA(Yuxue Yang、Shuyao Shang、Jiahe Wang、Zitong Zhou、Liang Tan、Junhan Zeng、Ruizhi Li、Junyan Li、Tieniu Tan、Lue Fan、Zhaoxiang Zhang);SLAI 与 CUHK(Hongsheng Li);AMAP(Yu Liu);THU(Xiao Yang、Yong Li、Jun Zhu)。8
社区信号目前很弱:@shumpeiMaxwell 的直接讨论帖在北京时间 8 月 5 日 07:37 页面显示为 0 赞、0 转发、0 回复、48 浏览;未找到作者帖、Reddit 或 Hacker News 直接讨论。9

3. Ego2Robot:把人类视频变成机器人数据

核心问题:机器人演示昂贵且受形态限制,能否把第一视角人类操作视频转成可训练的机器人数据?Ego2Robot 依次做 Action Alignment、Visual Alignment、Quality Curation:用 21 个手部关键点重定向到平行夹爪,再用 SAM 3、ProPainter、IK 网格搜索和深度感知合成完成视觉对齐,最后用 L1/L2/L3 三级筛选。10
约 1,940 小时人类第一视角视频被转换为论文自报的 18,561 小时机器人训练数据,覆盖 15 种机器人形态。用 Qwen3.5-4B + DiT 在 RoboTwin2.0 和 EBench 上评测,Ego2R+Robot 1:1 的 Clean 成功率为 68.1%,robot-only 为 62.2%;EBench 为 49.8%,对照为 39.6%。但这不是 18,561 小时真实机器人采集时长,而是合成训练数据口径。11
论文限制包括:动作重定向目前只映射到平行夹爪,细粒度手指关节被丢弃;inpainting 与深度合成在遮挡或复杂光照下可能引入伪影;评测仍主要落在 RoboTwin2.0 任务范围内。作者及脚注归属为:Ye Wang(1、2,共一作)、Pei Lin(2、3、4,共一作)、Xiong-Hui Chen(2,共一作)、Haoqi Yuan(2)、Zhixuan Liang(2)、Yiyang Huang(2)、Anzhe Chen(2)、Zixing Lei(2)、Jie Zhang(2)、Tao Zhang(1)、Haoyang Li(2)、Tong Zhang(2)、Chenxi Xiao(3)、Ziyuan Jiao(4、5)、Qin Jin(1,通讯作者)。机构 1 为 AIM3 Lab(中国人民大学),2 为 Qwen Team(Alibaba Inc.),3 为 ShanghaiTech University,4 为 BIGAI,5 为北京航空航天大学。12
社区信号同样偏弱:@robotsdigest 主帖显示 28 赞、5 转发、2 回复、1,352 浏览,但它是第三方摘要转述,不是实验证据,也不是作者/团队原帖;未找到 Reddit 或 Hacker News 直接讨论。13
三篇论文的共同提醒很具体:模型分数之外,还要看运行时是否能修、世界模型是否真的会反应,以及训练数据的规模来自真实采集还是合成转换。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

Comments

Sign in to comment.