
本周 3 篇具身智能 / 机器人 arXiv:E-TTS、LA4VLA、SSI-Policy
本期精读 3 篇 2026 年 6 月 25 日提交的 cs.RO 论文,聚焦机器人操作中的测试时扩展、语言-动作预训练和结构化场景接口,帮助快速判断哪些思路值得继续深读。
这一周的共同信号:机器人论文开始把「泛化」拆成可控环节
本期筛选的 3 篇 arXiv 论文都来自 2026 年 6 月 25 日提交的 cs.RO 新稿,主题集中在机器人操作:一篇把测试时扩展从「多采样动作」推进到「推理-动作联合搜索」,一篇把 VLA 预训练里被视觉信号稀释的语言-动作关系单独拎出来训练,另一篇用 RGB-only 的结构化场景接口,把几何、对象和运动预测放在控制器前面。它们的共同点不是模型更大,而是把机器人策略中容易混在一起的环节拆开,再用实验看哪一块真的带来成功率提升。
| 论文 | 主要问题 | 关键证据 | 我会优先读哪类细节 |
|---|---|---|---|
| E-TTS | 测试时扩展在具身任务里不能只扩动作,还要处理推理、历史和反馈 | 跨 4 个 benchmark、6 个环境、3 种 embodiment 和 4 个 VLA 模型测试;最高仿真增益 33.14%,真实机器人增益 26.62%1 | verifier 怎么打分,以及延迟-成功率权衡 |
| LA4VLA | VLA 训练里,密集视觉-动作监督可能盖过稀疏语言-动作监督 | LA4-33K 从 9,560 条 VLA episode 中整理出 33,116 条人工校验的语言-动作 episode;真实任务 MixPT 平均成功率 83.3%,无预训练为 38.3%2 | 语言-动作数据构造和视觉冲突诊断 |
| SSI-Policy | 低数据机器人操作既需要空间结构,又不想依赖深度传感器或大规模外部预训练 | 10 demonstrations per task 的 LIBERO 平均成功率 80.42%,比 ATM-DP 高约 14.75 个百分点;真实空间推理任务平均 80.0% 对 43.3%3 | RGB-only 中间表示是否能稳定替代部分 3D/flow 接口 |
1. E-TTS:把测试时扩展做成「推理-动作」联合闭环
论文信息:E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation。作者来自中国科学院自动化研究所 NLPR、中国科学院大学人工智能学院、中国科学院自动化研究所基础模型研究中心和 FiveAges;arXiv:2606.27268,cs.RO,v1 提交于 2026 年 6 月 25 日1。
这篇论文要解决的问题很具体:LLM/VLM 里常见的 test-time scaling,放到机器人操作里不能简单等价于「多采样几个动作再挑一个」。论文指出,已有具身 TTS 工作主要在 action space 里扩展,容易忽略两个机器人任务特有的问题:第一,高层推理会影响低层动作,单独扩动作会让 planning 和 execution 脱节;第二,操作是序列决策,当前帧不足以判断候选动作好坏,历史轨迹和失败反馈也要进入判断链1。
E-TTS 的核心设计是把一个候选看成「reasoning, action」二元组,而不是只看动作。每个时间步先采样多个 reasoning,再为每个 reasoning 采样多个 action;reasoning verifier 用 Qwen2.5-VL-7B 零样本打分,action verifier 用 LLaVA-7B 在 90k 成功/失败 rollout 对上训练;两者的分数相乘得到联合分数1。如果当前 batch 没有候选超过阈值,系统会生成反馈,把失败原因写回下一轮 sampling prompt,形成闭环 refinement;历史 buffer 则把最近 K 步的 reasoning-action pair 和观察放进 verifier 输入,给长程任务补上下文1。
实验覆盖面是这篇的强项。作者把 E-TTS 接到 E-CoT、MolmoAct、π0.5 和 Embodied-R1 等不同 VLA 或 reasoning-based manipulation 模型上,在 SimplerEnv WidowX、SimplerEnv Google Robot、LIBERO、LIBERO-Plus、VLABench 和真实 Franka 环境中测试1。在 SimplerEnv WidowX 的 E-CoT 设置里,平均成功率从 6.67% 提到 39.81%;同表中 E-CoT+RoboMonkey 为 26.38%,naive TTS 为 23.61%1。在 MolmoAct+LIBERO 上,平均成功率从 85.57% 到 90.78%;在真实机器人四个任务中,MolmoAct finetuned baseline 从 22.13% 到 48.75%,提升 26.62 个百分点1。
它比已有工作的增量,主要不在「再多采样一点」,而在把具身任务里相互耦合的三个东西放进同一个推理时流程:推理质量、动作可行性、历史一致性。消融也支持这个判断:去掉 feedback、reasoning scaling、action scaling、joint scoring、history buffer 或 epsilon-greedy,E-CoT 设置下的平均成功率都低于完整模型的 39.81%1。采样预算实验还显示,计算资源过度偏向 reasoning 或 action 都不是最佳,约 1:1 的分配在论文实验里达到峰值1。
局限也要看清楚。E-TTS 把更多计算放到推理时,作者虽用 vLLM、PagedAttention 和 prefix sharing 降低开销,但结论部分仍把进一步加速列为 future work1。真实机器人实验每个 task 收集 100 条 teleoperated expert demonstrations,每个 baseline 每 task 40 次试验;这能说明闭环 TTS 在该设置下有效,但还不是「无需高质量真实演示」的证据1。
2. LA4VLA:先让策略学会「指令如何约束动作」
论文信息:LA4VLA: Learning to Act without Seeing via Language-Action Pretraining。作者机构包括上海交通大学 School of AI、阿里巴巴集团、南洋理工大学和 KAUST;arXiv:2606.27295,cs.RO,v1 提交于 2026 年 6 月 25 日2。
这篇的出发点很尖锐:标准 VLA 预训练把视觉、语言和动作一起喂给模型,但视觉-动作监督太密,语言-动作监督太稀。一个轨迹里可以有几百甚至几千个 image-action pair,却通常只有一个高层 task instruction;模型输入里,图像 token 也往往比语言 token 多一到两个数量级2。结果是,策略看起来会听指令,内部却可能主要靠视觉 shortcut 决定动作。
作者先做了一个诊断实验:固定语言指令,改变视觉输入。标准 paired input 下,方向对齐率 DAR 为 0.98,方向一致性 DCS 为 0.95;但去掉视觉后 DCS 掉到 0.16,换成 unaligned 视觉后 DCS 为 0.37,换成冲突视觉后 DAR 掉到 0.35、DCS 掉到 0.032。这组数字说明,在这个诊断设置里,模型的动作方向会被视觉输入强烈带偏,而不是稳定服从固定语言指令。
LA4VLA 的做法是把已有 VLA demonstration 重新切成原子动作片段,给每个片段配一个低层语言描述,然后在预训练阶段去掉视觉输入,只保留语言、proprioceptive state 和动作轨迹。这样训练出的不是视觉 grounding,而是 language-conditioned action prior。数据上,作者从 9,560 条原始 VLA episode 出发,经 VLM 分割得到 56,899 条候选 LA episode,人工校验后保留 33,116 条;平均每段从原 VLA episode 的 287.83 帧缩短到 46.05 帧,候选保留率 58.2%,双人标注子集 Krippendorff’s alpha 为 0.77942。
实验部分比较了 Base、VLA、LA、LA-VLA 和 MixPT 几种预训练方式。在 LA4VLA-1B 上,MetaWorld 平均成功率从无预训练的 69.73% 提到 LA 的 83.00%,MixPT 到 87.53%;LIBERO 从 92.85% 到 LA 的 95.30%,LA-VLA 到 96.28%2。把同一 LA 预训练协议迁移到 StarVLA,MetaWorld 平均成功率从 58.39% 到 69.91%,LIBERO 从 93.70% 到 94.85%,说明这个信号不只服务于一个具体模型2。
真实机器人结果更能体现这篇的野心。作者用 xArm6、双 RGB 相机和三类语言条件任务测试:按位置按按钮、把书放到指定书架位置、把饮料放到九宫格指定位置。每个任务 100 条 teleoperated demonstrations,三任务共 300 条;无预训练平均成功率 38.3%,VLA 预训练 48.3%,LA 预训练 81.7%,MixPT 83.3%2。在加高斯噪声的视觉扰动下,无预训练平均 27.5%,VLA 42.5%,LA 67.5%,MixPT 70.0%2。
局限主要来自数据构造和任务边界。LA4-33K 不是原生人工写好的低层控制语料,而是由 Qwen-3-VL-Plus 在 2 FPS、224×224 多视角帧上生成候选分段,再由人工过滤;这使数据质量依赖 VLM 分割、动作词表和人工验证规则2。同时,作者也明确说 LA 预训练不打算替代视觉 grounding,因为目标定位和场景特定选择仍需要视觉;它更像是给 VLA 补一层被标准训练稀释掉的动作先验2。
3. SSI-Policy:用 RGB-only 的结构化接口补上空间和运动
论文信息:SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation。作者机构包括南方科技大学、鹏城实验室、香港大学和 LimX Dynamics;arXiv:2606.26800,cs.RO,v1 提交于 2026 年 6 月 25 日3。
SSI-Policy 盯住的是低数据机器人操作里的空间问题。作者认为,视频预测方法能做任务级 reasoning,但长程 rollout 容易几何漂移、计算重;3D 方法空间结构强,却常依赖 RGB-D 或点云;flow/trajectory 接口提供了运动抽象,但有些只隐式处理几何,有些需要深度或点云初始化3。论文的核心问题是:能不能只用 RGB,做一个显式结构化、robot-agnostic、又可从 action-free video 预训练的中间接口?
SSI 这个中间表示由三类信号组成:monocular depth features 提供相对几何,language-grounded object layout maps 标出任务相关区域,instruction-conditioned 2D motion trajectories 预测对象和机械臂的预期运动3。策略结构也相应分成两段:Perception Composer 从 RGB 和语言中抽 SSI;Diffusion Action Planner 再把 SSI、RGB 和 proprioception 融合,用 diffusion 生成多步动作3。关键点是 SSI 不含 embodiment-specific action,因此感知部分可从无动作标签的视频预训练,控制器只需要少量机器人 demonstration。
在 LIBERO few-shot 设置里,SSI-Policy 使用每任务 10 条 demonstrations,平均成功率 80.42%。同表里,ATM-DP 为 65.67%,ATM 为 63.42%,Diffusion Policy 为 54.50%;SSI-Policy 在 Spatial/Object/Goal/Long 四个 suite 上分别为 83.50%、95.00%、82.50%、60.67%3。当每任务 demonstration 增到 50 条时,SSI-Policy 平均 91.25%,在无外部数据方法中仅略低于 OFT 的 91.90%,并且 Object 为 97.50%、Goal 为 93.00%3。
真实世界实验验证了它的几个主张。空间推理 6 个任务中,SSI-Policy 对 Diffusion Policy 的平均成功率为 80.0% 对 43.3%,其中「把红盘右下方的柠檬放到盘子上」达到 100% 对 55%,「左下方」达到 85% 对 10%3。跨 embodiment 方面,作者用 5 个非目标机械臂的视频训练 SSI motion predictor,再用目标机器人 10 条 demonstration 训练策略;few-shot SSI 在 LIBERO-Spatial 达到 83.0%,接近 full-shot 的 83.5%3。人手到机器人迁移也有信号:两项任务里,人手数据 alone 为 40-45%,human+robot 为 70-80%,比 robot-only 高 10 个百分点以上3。
消融显示,SSI 的三类信号不是摆设。完整模型平均 80.42%;只用 depth 的 DepthHelps 为 63.15%,只用 motion 的 ATM/ATM-DP 为 63.42%/65.67%,motion+depth 为 76.92%,motion+layout 为 77.09%,去掉 hybrid sampling 为 78.46%3。一个更直接的检查是 SSI-only 变体:去掉 raw RGB、只用 SSI 和 proprioception,仍保留约 98% 的完整模型性能,说明 SSI 捕获了大部分任务相关的空间和运动信息3。
局限部分也写得清楚。作者观察到三类常见失败:遮挡或杂乱环境下 GroundingDINO 检测错误会污染 layout map;海绵等可变形或笨重物体容易因为位移、夹爪开口和摩擦导致抓取失败;单目深度或检测的时间不一致会造成 motion prediction 抖动3。结论里把 temporally consistent perception 和 tactile feedback 列为后续方向,这说明 SSI 对上游感知稳定性仍然敏感3。
这 3 篇放在一起看,方向很清楚
这 3 篇论文都在处理同一个现实问题:机器人策略想泛化,不能只靠更大的端到端模型把所有东西吞进去。E-TTS 把推理、动作、历史和反馈分出来,在推理时做闭环搜索;LA4VLA 把语言-动作监督从视觉主导的 VLA 训练里分出来;SSI-Policy 把空间几何、对象布局和运动预测做成 RGB-only 中间接口。
如果你更关心部署,优先读 E-TTS 的延迟与 verifier 设计;如果你在训练 VLA,LA4VLA 的诊断实验和数据构造更值得细看;如果你手里 demonstration 少、又不想上 RGB-D,SSI-Policy 的中间表示和失败案例会更接近工程问题。三篇都不是「只靠 scaling 解决机器人」的叙事,反而都在说明:把 supervision、representation 和 inference loop 拆得更清楚,成功率才更容易被追踪和改进。

具身智能与机器人 arXiv 论文精读
每周一 8:00 更新:从具身智能与机器人方向筛选 3 篇值得关注的 arXiv 论文,用中文基于论文原文讲清问题、创新、对比优势和局限。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.