截至北京时间 2026 年 8 月 6 日 08:30,arXiv 可检索的最新 AI 批次在列表页标为 8 月 5 日;本期三篇论文的 v1 都在 8 月 5 日凌晨提交(原始记录为 8 月 4 日 UTC)。三篇均有可打开的 X 直接讨论,但互动仍处于 0 到 72 浏览的早期阶段;本轮未检索到对应 Reddit 或 Hacker News 直接帖,不跨平台合并数字。1
1. ParVL:视觉和语言,算力不必绑在一起
ParVL 不复制整套模型,而是复用 InternVL3.5 的视觉与语言 backbone,在每层用分支专属 KV prefix 区分多个视觉分支和语言分支,再用 token-wise MLP 聚合。视觉结果会投影到各语言分支并再次融合,因此视觉计算量与语言计算量可以分别配置。2
在同一训练配方下,1B 模型九项 benchmark 平均分从 49.6 提到 50.5(4:4 分支);2B 从 54.4 到 54.7,8B 从 62.5 到 63.0。代价并非零:1B 4:4、batch 1 的推理延迟为 1.04×,显存为 1.23×。不同任务的最优配比也不同,General 最好是 2:2,Math 是 4:4,OCR 是 2:4。2
论文只验证 InternVL3.5 的 1B、2B、8B,并只做 SFT;训练数据取 1/20 子集,每种配置只跑一次。它证明并行分支能分配计算,却还没有证明这套收益能跨 backbone、预训练阶段或真实部署稳定复现。2
作者与机构:Yang Yang(澳大利亚国立大学、上海人工智能实验室),Qinyu Zhao(澳大利亚国立大学),Mouxiang Chen(浙江大学),Xiaohui Li(上海交通大学),Lixin Gu、Hongjie Zhang、Wenwei Zhang(上海人工智能实验室),Wenhai Wang(南京大学)。3
社区信号来自第三方法语解读线程:@clxymox 主帖页面显示 0 赞、1 回复、32 浏览,后续 5 帖继续解释 prefix、分支配置与指标;@CxCPhilly 的条目页显示 14 浏览。它是本期相对完整的讨论,但绝对互动仍弱。45
Loading content card…
2. OpenETA:每次动作后,先看世界有没有变
ETA(Embodied Task Agent)把数字 Agent 的循环搬进机器人:Planner 每次只能提出一个结构化 Tool 调用,Interface 校验权限、前置条件与来源,再执行一个改变世界的 AtomAction。World 随后返回收据和新观测,Planner 才能决定下一步。它把 observation-to-action 的直达路径改成可追踪、可中止的物理闭环。6
OpenETA for Codex 在 130 个 LIBERO 任务上用 GPT-5.6 Sol 得到 Pass@5 117/130(90.0%);Terra 为 83/130,Luna 为 62/130。完整配置用 Luna 跑 40 个任务、每项 10 个 seed,只成功 56/400(14.0%);344 次失败里 215 次由 episode timeout 主导。两组设置的 Planner、Tool 配置和统计口径不同,不能把 14% 与 90% 当作同一条提升曲线。6
论文没有给真实机器人审计成功率,只展示 UR5e-Robotiq 的接口级集成和开发录像。长时程子目标、预算管理、放置关系、释放时机和附着稳定性仍是主要故障点;5 类自演化经验更新也没有一类通过全部晋升门槛。6
作者与机构:Yitong Chen、Sixian Li、Yubang Wang(上海创智学院、复旦大学);Zezheng Huai、Hechang Chen(上海创智学院、吉林大学);Haozhe Zhang(上海创智学院、浙江大学);Yifei Zhang(上海创智学院、南京大学);Jingjing Gong(上海创智学院);Yu-Gang Jiang(复旦大学);Xipeng Qiu(上海创智学院、复旦大学)。6
通讯作者 Xipeng Qiu 的原帖页面显示 0 赞、0 转发、0 回复、72 浏览,是三篇中单帖浏览最高的直接信号,但仍只能标为早期弱信号。7
Loading content card…
3. TurnSight:轨迹级奖励太粗,就落到每个工具回合
TurnSight 用模型自己已经执行过的工具结果构造 hindsight,不依赖参考轨迹。它在每个回合汇总 token 级后见差异,让 1、2、3 步 lookahead 教师先投票决定方向,再选同向最强信号;归一化后只调节 RL advantage 的幅度,不改变原来的优化方向。8
Qwen3-4B 在 FTRL、BFCL、ToolHop 的平均分为 37.51,此前最强基线 MatchTIR 为 34.76;Qwen3-8B 为 42.02,对照为 39.03。8B 消融中,完整方法 46.92;去掉回合级聚合降到 43.23,去掉组归一化为 43.65。8
后见窗口越长并不总是越好:更远的交互会引入与当前决策无关的信息,多教师方向也可能冲突。训练还依赖可执行工具环境;论文没有给出额外教师计算成本或真实部署结果。8
作者与机构:Changle Qu、Sunhao Dai、Yuqi Zhou、Jun Xu(中国人民大学高瓴人工智能学院);Hengyi Cai、Xinran Chen、Simon(百度)。9
社区信号是一条第三方摘要帖,页面显示 0 赞、0 转发、0 回复、31 浏览,没有展开技术讨论,因此三篇中信号最弱。10
Loading content card…
三篇论文改的是三个不同层级:ParVL 分配模型内计算,OpenETA 约束模型与物理世界之间的执行权,TurnSight 把训练信号落到单个工具回合。分数提升可以继续追,眼下更该先核对各自增加了多少推理、交互与训练成本。
References
- 1arXiv 最新 cs.CL 列表
arxiv.org
- 2ParVL arXiv 全文
arxiv.org
- 3ParVL 作者与机构
arxiv.org
- 4ParVL X 解读主帖
x.com
- 5ParVL X 条目帖
x.com
- 6ETA / OpenETA arXiv 全文
arxiv.org
- 7OpenETA 作者 X 原帖
x.com
- 8TurnSight arXiv 全文
arxiv.org
- 9TurnSight 作者与机构
arxiv.org
- 10TurnSight X 讨论原帖
x.com


Comments
Sign in to comment.