当天的 arXiv AI 新批次没有检出新的 v1。本期严格回看 72 小时窗口:2026 年 8 月 30 日 08:15 至 9 月 2 日 08:15(北京时间),三篇论文都按 9 月 1 日 v1 纳入。它们把增量分别放进空间 token、科研 rubric 和持久程序:读者可以沿着同一条问题线,比较能力究竟加在了哪个接口。
LightNav-0:空间 token
LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation 用双通道 pointing 表达空间意图,再用 RVQ action tokenizer 解码动作。模型每步输出 10 个
SE(2) waypoints,训练数据覆盖 2K+ 场景与 4K+ 小时;论文摘要报告它在 10 个公开导航仿真设置中取得单目 SOTA。1最窄结论:LightNav-0 把“指向哪里”和“怎么移动”接到同一个紧凑 VLM 的 token 接口,真实机器人证据的范围是跨 embodiment 的 zero-shot 评测。论文统一署名为 Light Origins Team;arXiv 元数据列出 20 位作者,页面没有提供逐人机构映射:Shaoan Wang、Aocheng Luo、Fei Huang、Jingyi Xu、Xiaoyang Wang、Yueyu Wang、Qianli Ma、Fan Yang、Ran Mei、Jia Wei、Jiangpeng Hu、Xuhao Liu、Hongming Chen、Yuanbin Shao、Yiyang Lin、Ziliang Li、Liang Pan、Xinhang Liu、Yuntao Ma、Tingxiang Fan。1
X 原帖快照:104 赞、16 转、4 回复、1 引用、76 收藏、11,659 浏览,发布时间为北京时间 2026 年 9 月 1 日 10:12。2
Loading content card…
AutoSciRub:科研 rubric
Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents 先把开放式科研指令拆成 atomic goals,再结合文献与任务可见数据生成 executable rubric;执行后逐条验证并迭代修订。AstaBench E2E Discovery 的随机 20 任务子集平均提升 16.8 分;ResearchClawBench 在固定 Codex harness 下跨 3 个 backbone 平均提升 2.08 分,在固定 DeepSeek-V4-Flash backbone 下跨 3 个 harness 平均提升 2.95 分。16.8 是评分提升,分数口径与完成任务数分开读取。3
最窄结论:AutoSciRub 把“什么算完成”提前变成可执行标准,再把标准接回研究执行和报告修订;AstaBench 的数字来自随机 20 任务子集,ResearchClawBench 的两个平均值分别对应 backbone 与 harness 维度。9 位作者及机构为:Xuehai Wang(浙江大学)、Haowei Qin(电子科技大学)、Tongxin Liu(北京邮电大学)、Junkai Li(浙江工业大学)、Buqiang Xu(浙江大学)、Jintian Zhang(浙江大学)、Yijun Chen(浙江大学)、Zirui Xue(浙江大学)、Shumin Deng(浙江大学)。3
X 原帖快照:10 赞、2 转、5 回复、0 引用、0 收藏、238 浏览,发布时间为北京时间 2026 年 9 月 1 日 17:00。4
Loading content card…
SUN:持久程序
SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies 把几何与接触关系写入 SUN Program,再编译成 MPC cost、满足谓词、RL reward、transition guard 和 diagnostics;Kuafu 先用 MPC 筛选可行性,再训练保留语义的分阶段策略。9 个任务宏成功率为 82.03%,sparse-reward 与 Stage-BC 基线分别为 35.67% 与 24.75%;8192 路并行时,成功轨迹时间/小时达到人工遥操作的 10.57 倍。5
最窄结论:SUN 的增量在于让控制验证过的任务语义继续进入策略学习和数据生成。每任务 500 条轨迹训练 DP3 后,仿真成功率为 46.0%,实体 Franka 与 Kinova 为 34.7%,替代方案仿真为 22.4%;82.03%、10.57 倍、46.0%→34.7% 属于不同证据分母。10 位作者及机构为:Weiqi Wang(加州大学洛杉矶分校)、Zhi Li(加州大学洛杉矶分校)、Yudong Lei(加州大学圣塔芭芭拉分校)、David Martinez(加州大学洛杉矶分校)、Xiaofeng Gao(Amazon)、Yuxin Jiang(加州大学洛杉矶分校)、Chenfanfu Jiang(加州大学洛杉矶分校)、Yingnian Wu(加州大学洛杉矶分校)、Demetri Terzopoulos(加州大学洛杉矶分校)、Ran Gong(Robotics and AI Institute)。5
X 原帖快照:0 赞、0 转、0 回复、0 引用、0 收藏、9 浏览,发布时间为北京时间 2026 年 9 月 2 日 04:39。6
Loading content card…
本窗口的社区证据由三条 X 原帖提供;公开 Reddit subreddit feed 逐帖详情,以及 Hacker News 的
new、top、best 快照,均未检出这三篇论文的对应直帖。X 的点赞、转发、回复与浏览量保持平台原口径,彼此没有合并。References
- 1LightNav-0 arXiv v1
arxiv.org
- 2
- 3AutoSciRub arXiv v1
arxiv.org
- 4
- 5SUN arXiv v1
arxiv.org
- 6


Comments