
AI 论文早报|8 月 1 日:从重复采样到频率自适应,5 篇论文重排推理与数据预算
本期精选 5 篇 7 月 30 日提交的 arXiv 预印本,观察模型如何用重复采样、策略调度、视觉检索、环境采集和自适应控制,把有限预算放到更有用的阶段。
本期选取 5 篇 2026 年 7 月 30 日提交的 arXiv v1 预印本,主线很清楚:有限预算不一定要继续堆大,而可以换一种分配方式。重复采样把 token 花在多个独立答案上,β-OPSD 把教师信号按训练阶段调度,ReToken 先筛视觉证据再回答,ACE-Data-0 把真实家庭活动采成多模态数据,FA-RDP 则在接触前后切换控制频率。它们都还不是同行评审结论,具体数字应放回各自实验设置中看。
今日看点
- 推理时计算:在相同 token 成本下,重复采样在两项数学基准上没有被 10 多种自我反思方法稳定超过;模型自己挑答案,也不如直接取多数答案,尤其在小模型上更明显。1
- 推理训练:β-OPSD 把 on-policy self-distillation 写成带 KL 正则的策略优化,在 Qwen3-1.7B、4B、8B 的 avg@12 上都高于 vanilla OPSD,但实验仍集中在数学推理。2
- 视觉检索:ReToken 只增加一个可学习 token,就能从视觉 KV cache 中挑出更相关的帧;在 Visual Haystacks 的 50 个干扰上下文中,K=1 的 recall 达到 64.7%,而 ReKV 只有 1.8%。3
- 具身数据:ACE-Data-0 用桌面级与房间级两套采集系统记录真实家庭活动,规模超过 150 小时、1,700 万视频帧和 75,000 个交互片段。4
- 机器人控制:FA-RDP 不用固定一个控制频率,而是让接触前的多步扩散和接触后的单步高频控制按阶段切换,三个接触丰富操控任务平均成功率为 81.7%。5
1. Sample More, Reflect Less:同样的 token,重复采样为何胜过自我反思?
论文:Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B
作者:Iliya Mirzaei
提交时间:2026 年 7 月 30 日,arXiv:2607.28576
原文:arXiv 摘要页
问题背景
Self-Refine、Reflexion、best-of-N 和辩论式推理都在让模型「再检查一次」。但它们通常生成更多 critique、reflection 或 debate turns。若不把这些 token 计入成本,所谓提升可能只是多算了一遍。论文因此把比较条件改成:总 token 预算相同,再看自我审视是否仍有优势。1
方法要点
作者在两个数学基准上评估 1.5B、3B、7B 开源模型,每个基准 150 道题,共 36 组按题配对的比较。统计使用 bootstrap 置信区间和多重比较校正,critique、reflection、辩论轮次与检查过程产生的 token 全部计入。1
结果亮点
- 在等 token 成本下,没有一种方法在任何场景中稳定超过 repeated sampling。
- 10 种方法在统计上稳定更差,而且全部属于让模型自我审视输出的路线;18 组自我审视比较的结果方向全部为负。
- best-of-N 中,让模型自己挑候选答案,在 1.5B 模型的两个基准上分别比直接取多数答案低 8.0 和 11.3 个百分点;到 7B 时差距缩小为 2.0 和 1.3 个百分点,已不再显著区别于零。
- 在 7B 上,Self-Refine 与强制触发的 Reflexion 仍比 repeated sampling 低 3.6 至 10.1 个百分点。1
适用边界
这是两个数学基准、三个模型规模上的成本对齐实验,不等于所有任务都应放弃反思。摘要没有披露两个基准的名称,也没有展开 36 组比较的完整结果表;论文真正支持的结论是:如果只看相同 token 预算下的数学答题,独立采样是一个不能跳过的强基线。
一句话阅读价值
这篇论文最适合用来校正推理时扩展的实验方法:先把总 token、候选数量和选择规则对齐,再判断「反思」本身有没有带来增益。
2. β-OPSD:把教师信号从固定模仿改成可调的策略优化
论文:β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation
作者:Jiawei Xu、Minghui Liu、Juzheng Zhang、Tom Goldstein、Furong Huang;University of Maryland, College Park
提交时间:2026 年 7 月 30 日,arXiv:2607.28582
原文:arXiv 完整 HTML
问题背景
On-policy self-distillation 让学生模型从自己采样的轨迹中学习,再借助训练时可见的特权教师信号改善答案。论文的判断是,vanilla OPSD 可以看成 β=1 的 KL 正则化策略优化特例;固定这个权重,既难控制学生与教师的距离,也容易让 token-level 更新只顾眼前局部信号。2
方法要点
β-OPSD 用 β 控制学生偏离 reference policy 的强度,并把教师与 reference 的 log-ratio 作为奖励。闭式最优策略对应二者的几何插值,实际训练再把它转成 token-level 的 logit interpolation target。作者还加入 return-to-go credit assignment,用未来 mismatch 的累计值替代只看当前 token 的局部梯度,并让教师权重从 0.5 调到 0.8。2
结果亮点
实验使用 Qwen3-1.7B、4B、8B,在 OpenThoughts 数学推理子集上训练,评测 AIME 2024、AIME 2025 和 HMMT 2025;主表是 100-step checkpoint 的 avg@12。β-OPSD 的结果如下:
| 模型 | Vanilla OPSD | β-OPSD | 绝对提升 |
|---|---|---|---|
| Qwen3-1.7B 2 | 31.02 | 36.76 | +5.74 |
| Qwen3-4B 2 | 56.11 | 57.87 | +1.76 |
| Qwen3-8B 2 | 58.52 | 60.18 | +1.66 |
这些数值来自论文主结果表;在 1.7B 上,β-OPSD 相比 vanilla OPSD 在 AIME 2024、AIME 2025、HMMT 2025 分别提高 9.16、5.27、2.78 个百分点。消融实验也显示,logit interpolant target 与 return-to-go 都比对应的简化版本更好。2
适用边界
训练集中是数学推理,实验规模也集中在 Qwen3 的三个尺寸,不能直接推出其他任务或更大模型会保持同样增益。β 的 schedule 仍需人工设定;return-to-go 使用 γ<1 是实用近似;如果采用学生与教师混合采样,还需要重要性采样修正,生成开销接近翻倍。2
一句话阅读价值
它把「蒸馏还是 RL」这个二选一问题改成了一个可调的训练目标,值得关注的不是 1.66 或 5.74 个百分点本身,而是教师影响、信用分配和训练成本如何一起调节。
3. ReToken:先从视觉 KV cache 找证据,再回答问题
论文:ReToken: One Token to Improve Vision–Language Models for Visual Retrieval
作者:Yao Xiao、Reuben Tan、Zhen Zhu、Yuqun Wu、Jianfeng Gao、Derek Hoiem;University of Illinois at Urbana-Champaign、Microsoft Research、Google DeepMind
提交时间:2026 年 7 月 30 日,arXiv:2607.28627
代码:GitHub 仓库;论文完整 HTML
问题背景
长视频或多图像问答有两个实际矛盾:全量视觉 token 占显存,而干扰帧变多后,模型又更难找出真正相关的证据。ReToken 把目标限定为一个更窄的问题:从已经缓存的视觉 KV cache 中,挑出与当前问题有关的少量帧。3
方法要点
作者在问题文本后追加一个可学习的 ReToken,用它的最后一层表示与每帧的 mean value vector 做 cosine similarity,再选 Top-K 帧。这里刻意使用 value space,而不是传统 query-key attention score。默认设置只训练 ReToken 和一个最终层投影矩阵,VLM 主体冻结;推理时先检索,再用筛出的视觉 KV cache 回答。3
结果亮点
训练使用 70,686 个多图像问答样本,覆盖 Qwen3VL-8B 与 InternVL3.5-8B。Visual Haystacks 中,当上下文包含 50 个候选图像、K=1 时,ReToken 的 recall 为 64.7%,高于 SigLIP2 的 20.8%、ReKV 的 1.8%;问答准确率为 72.0%,而直接全量输入的 Standard 为 58.6%。3
迁移到视频任务时,QAEgo4DTest-MC 的 K=16 准确率为 60.0%,高于 Uniformly 的 53.6% 和 ReKV 的 57.8%;LVBench 从 40.6% 提升到 48.6%,Video-MME 从 65.1% 提升到 67.1%。但在消融中,前 1–3 层的部分微调在图像任务上有帮助,却让视频迁移结果变差。3
适用边界
ReToken 需要两次 forward,早期层仍要接触较多视觉上下文;它按帧独立打分,不适合必须联合多个连续帧才能判断的时间关系,也不擅长依赖全局汇总的摘要任务。换句话说,64.7% 的 recall 说明它更会找局部、可命名证据,不代表它解决了长视频理解。
一句话阅读价值
这是一个很具体的系统拆分:把「看完所有视觉内容」改成「先找证据,再回答」,适合关注长上下文显存和视觉检索的人对照自己的瓶颈。
4. ACE-Data-0:具身智能先缺的,可能不是更大的模型而是更完整的现场
论文:ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine
作者:Yukang Cao、Haozhe Xie、Beichen Wen 等 16 位作者
提交时间:2026 年 7 月 30 日,arXiv:2607.28625
原文:arXiv 完整 HTML;项目主页
问题背景
ACE-Data-0 不是一个新的策略网络,而是一套面向真实家庭活动的多模态采集系统。它要同时记录人的视角、房间外部视角、人体和手部运动、物体 6-DoF 轨迹、音频与触觉,让模型看到的不只是动作结果,还包括接触和环境状态。4
方法要点
系统分为两个互补尺度:table-scale 面向桌面精细操作,room-scale 面向房间内移动和全身活动。前者约 30 平方米,使用 88 台外部 RGB 相机和 16 台 OptiTrack 相机;后者是约 200 平方米的完整公寓,使用 88 台外部 RGB 相机和 12 台 OptiTrack 相机。头戴设备提供 4 个鱼眼相机、IMU 和头部位姿,人体采用 41 个 marker,手部还配有手套触觉记录。4
结果亮点
数据集包含 150+ 小时同步多模态数据、1,700 万+ 视频帧、75,000+ 个交互片段、50 位参与者、200 类任务、两个环境和 8 个以上视角;论文还留出 10 小时作为测试集。原文报告的一组视觉到触觉基线中,TouchAnything 的 Temp Acc. 为 0.7095、C-IoU 为 0.1646、V-IoU 为 0.1357、CoP error 为 6.5846。4
这些数字的意义不只是数据集变大:触觉从视觉恢复仍然困难,真实家庭中的遮挡、极端视角和长时间交织任务,会把「看见人」和「理解人在接触什么」分开。论文列出的现有基线在人体运动估计上仍有明显误差,并把物体位姿估计留作后续工作。4
适用边界
它的采集成本也构成了使用门槛:每小时原始数据约 11 TB,复杂的时空同步和标定是数据进入训练前必须解决的工程环节。当前论文重点证明的是捕获系统和数据资源的可行性,不应把有限的基线结果读成一个已经解决具身理解的模型结论。
一句话阅读价值
如果你在做具身模型或多模态世界模型,ACE-Data-0 值得先看数据字段和同步流程:很多「模型不懂接触」的问题,可能在训练数据里根本没有被完整记录。
5. FA-RDP:接触前保留多模态,接触后提高控制频率
论文:FA-RDP: A Frequency-Adaptive Reactive Diffusion Policy for Contact-Rich Manipulation
作者:Lifeng Zhuo、Wendi Chen、Han Xue、Shirun Tang、Jun Lv、Cewu Lu、Chuan Wen;Shanghai Jiao Tong University、Shanghai Innovation Institute、Noematrix Ltd.
提交时间:2026 年 7 月 30 日,arXiv:2607.28596
原文:arXiv 完整 HTML;项目主页
问题背景
接触丰富的操控把策略推向两个相反方向:接触前可能有多条合理的接近轨迹,需要保留多模态;接触后受到几何和力约束,必须快速闭环响应。固定一个采样频率,通常只能在两者之间取舍。5
方法要点
FA-RDP 使用共享的多频率视觉-力 Transformer:低频模式以 10 Hz 进行多步扩散采样,高频模式以 30 Hz 进行 one-step 蒸馏采样,二者覆盖同一个 1.6 秒预测时域。一个 multimodality indicator 根据当前观测判断行为的多模态程度,在接触前偏向低频多步采样,接触后切换到高频模式;Manifold Consistency Distillation 则把高频 sampler 蒸馏到动作流形上。5
结果亮点
作者在 Dual Box Flipping、Dual Switch Toggling、Dual Button Pressing 三个真实机器人任务上测试,每个任务使用 60 条示范、每种方法 20 次试验。FA-RDP 的成功次数分别为 14/20、18/20、17/20,平均成功率 81.7%;RDP 为 35.0%,ImplicitRDP 为 51.7%,高频蒸馏单独策略为 61.7%。在控制延迟上,高频执行低于 30 ms,低频执行低于 50 ms。5
论文的消融把提升拆得更清楚:高频蒸馏单独策略平均 61.7%,加入频率切换后达到 81.7%,增加 20 个百分点;多模态分析中,FA-RDP 和 ImplicitRDP 覆盖了全部四种接触前模式,而高频单独策略收敛到单一主导模式。5
适用边界
实验只覆盖 visual-force 输入、single-task policy 和三阶段训练流程,尚未证明同一配方能直接迁移到多任务或其他传感器设置。FA-RDP 的优势也依赖正确判断当前阶段:若 indicator 或力觉输入不可靠,频率切换本身就会成为新的误差来源。
一句话阅读价值
它给控制系统的启发很朴素:实时性不必平均分配到每一帧,关键是把高频计算留给真正需要快速反应的接触阶段。
把预算从「全程堆叠」改成「按阶段使用」
5 篇论文横跨语言模型、视觉、多模态数据和机器人控制,但它们的共同点不是又提出一个更大的模型,而是重新安排有限资源:
- Sample More, Reflect Less 把推理 token 分到多个独立样本,而不是默认让单个样本不断反思。1
- β-OPSD 让教师信号和信用分配随训练阶段变化,而不是固定一种蒸馏目标。2
- ReToken 把视觉预算集中在更可能相关的 value evidence 上,再进入回答阶段。3
- ACE-Data-0 把数据预算投入同步、触觉和真实环境,而不只增加单一视频视角。4
- FA-RDP 把高频控制预算留给接触后的狭窄动作空间。5
如果你今天只读两篇:做语言模型推理评测,先看第 1 篇,再看第 2 篇;做长视频或多模态上下文,先看第 3 篇;做具身数据与机器人控制,则把第 4、5 篇放在一起读。真正需要比较的不是谁的数字最大,而是它们各自把预算放在了哪里,以及这个前提在你的任务里是否成立。
Related content
- Sign in to comment.
