
奇绩信号Alpha Sight 2026年8月20日【文字版】
本期精选 8 月 19 日 arXiv recent 分组十篇论文,观察记忆调度、版本化工作空间、动作流、物理能量和硬件执行如何变成可检查接口。
本期从 arXiv recent 的 2026 年 8 月 19 日分组精选十篇论文;所选论文详情页的 v1 版本日期主要为 2026 年 8 月 18 日。阅读目标不是替读者下结论,而是把值得继续精读、复现或跟踪的信号拆成方法、条件、证据和限制。本期判断:今天的共同信号不是模型又多了一项能力,而是系统开始把「记忆何时打开、工作空间哪个版本有效、动作如何映射到世界、指令是否真的执行」写成可检查的接口。下面先看四篇头条,再按认知模型、多模态、具身智能、AI4Science、Infra、Agent、应用体系和 Benchmark 展开。
头条
一、别把一次自我改进当成能力:智能体的记忆可能放大随机性 从方差、任务顺序与欠规范看自我改进智能体的脆弱性
信号源:Salesforce AI Research
🧭
认知提取
自我改进智能体像一个会给自己写操作手册的实习生。
问题是,早期写错的一条规则会被后续任务反复检索,错误因此不再是一次性的。
这篇论文把「平均分数上涨」拆成重复运行方差、任务顺序和环境欠规范三个变量,提醒读者先问结果是否稳定,再问方法是否有效。
论文摘要
- 论文重新评估 Agent Workflow Memory 和 ReasoningBank 两类文本记忆自我改进方法,实验覆盖 WebArena、VisualWebArena 和 SCUBA;三个基准分别包含八百一十二、九百一十和二百六十七个任务。原文
- 每种设置重复运行三次,并报告平均 pass@1、标准差以及最佳与最差运行差距;骨干模型和记忆构建模型均为 GPT-5-mini。
- 论文的核心问题是:固定任务顺序是否偷偷提供了由易到难的课程;任务描述和环境能力不明确时,记忆是否会生成无法执行的策略。
- 原文 HTML 提供了图一至图四以及表一至表九的章节入口,但未提供可直接复用的独立图片资源;因此本条保留可核验的原始表格数字和图表入口,不用生成图替代原图。图表入口
核心方法
- 重复运行协议:每个方法—领域组合运行三次,用最佳—最差差距观察单次结果是否掩盖了路径依赖。
- 顺序扰动:除默认任务顺序外,加入两种随机打乱顺序,检验自我改进是否依赖隐含课程。
- 记忆干预:在 ReasoningBank 记忆中分别加入评分标准与反馈、环境动作反馈、更加明确的环境约束提示,观察欠规范能关闭多少性能损失。
- 错误传播分析:人工检查「API」「用户确认」和 Haversine 距离估计等错误策略如何写入记忆,并在后续任务中被再次检索。
实验成果
- 二十四个「方法—领域」组合中,有十七个约百分之七十一出现方差上升;其中十一个组合的相对方差增幅超过百分之五十。原文
- 自我改进后的最高标准差为百分之四点二八,最高最佳—最差差距为十点四二个百分点;WebArena Map 的 ReasoningBank 差距为八点二六个百分点。
- 三次运行平均 pass@1 中,无记忆、AWM、ReasoningBank 在 WebArena 上分别为百分之五十四点八、百分之五十四点一和百分之五十六点三;ReasoningBank 的一点五个百分点提升对应的非配对 t 检验 p 值为零点二三。
- 默认顺序下,ReasoningBank 的总体平均提升约一点五个百分点;随机顺序下,摘要报告约四点五个百分点的下降,八种比较中有六种明显下降。
- 加入规格和环境信息后,干预合计只关闭约百分之三十一的性能下降;欠规范是原因之一,但不是全部原因。
| 设置 | WebArena 平均 pass@1 | VisualWebArena 平均 pass@1 | SCUBA 平均 pass@1 |
|---|---|---|---|
| 无记忆基线 | 百分之五十四点八 | 百分之五十四点九 | 百分之四十九点六 |
| AWM | 百分之五十四点一 | 百分之五十四点五 | 百分之五十点一 |
| ReasoningBank | 百分之五十六点三 | 百分之五十五点六 | 百分之五十一点一 |
表一:三次运行的平均 pass@1;ReasoningBank 的平均提升很小,且统计显著性有限,读者不应把单次运行的正增益当成稳定能力。来源:原论文表三
总结与反思
- 结果总结:论文的强信号不是某个记忆方法更高,而是自我改进的评价必须同时报告方差、任务顺序和环境规格。
- 局限性:每个设置只运行三次,研究也只覆盖三个网页基准、两类记忆方法;欠规范干预仍有约百分之六十九的下降无法解释。
- 前沿见解:记忆系统的第一道护栏可能不是更强的检索器,而是版本、来源和可执行性检查。
二、知识工作代理先要知道自己改的是哪个版本:StagedWorkspace 让解析视图和原生文件绑定 StagedWorkspace:面向知识工作代理的版本化工作空间
信号源:哈佛大学、Raycaster AI、悉尼科技大学、华盛顿大学、斯坦福大学
认知提取
代码代理已经习惯用版本控制、diff 和测试检查工作状态。
但 PDF、表格、幻灯片和混合项目文件仍常常把「搜索到的解析视图」「正在编辑的原生文件」和「最终提交物」当成三个互不相干的世界。
StagedWorkspace 的贡献不是再造一个文件管理器,而是把这些视图都钉在同一个带哈希的工作空间版本上。
论文摘要
- 论文提出 workspace-state contract:每个解析记录、原生工件、审阅差异和提交物都必须明确对应到演化中的某个工作空间状态。原文
- 解析记录同时绑定源文件路径和内容哈希;文件变化后,对应解析缓存标记为 stale,并只对变化文件异步重新解析。
- OfficeQA Pro 包含约六百九十七份 Treasury Bulletin PDF、百零四个文档问题和二十九个实时证据问题;APEX-Agents 包含三十三个工作世界和四百八十个任务。
- 固定工具预算为二百五十次调用,比较 Dual、Artifact-only 和 Parsed-only 三种视图条件。

核心方法
- 三类状态:原生工作空间记为当前权威状态,解析缓存支持搜索和证据定位,差异状态记录初始工作空间与当前版本之间的变化。
- 哈希同步:每轮工具操作后扫描沙箱;哈希未变的文件复用解析缓存,哈希变化的文件进入 stale 状态并异步刷新。
- 审阅日志:文本使用行级 diff,电子表格使用行级和单元格级变化,幻灯片使用幻灯片级变化,不支持的二进制文件退化为前后预览。
- 三臂消融:Dual 同时提供同步的原生和解析视图;Artifact-only 只提供原生文件;Parsed-only 只提供解析缓存。

实验成果
- OfficeQA Pro 上,SW-Agent 使用 Dual 视图时,GPT-5.4、Gemini 3.1 Pro、Gemini 3 Flash 的 Pass@1 分别为百分之六十四点七、百分之六十三点九和百分之五十七点八;相对更受限的单视图,提升八点三至十二点一个百分点。原文
- APEX-Agents 上,GPT-5.4 Nano 的 SW-Agent Pass@1 为百分之二十五点零,平均 rubric score 为四十二点一;相对已发表结果分别高八点一和十六点六点。
- Dual 在每个被测模型上的点估计都最高;相对单视图条件,APEX 平均 rubric score 提升四点七至九点二个百分点。
- 运行成本并不为零:OfficeQA 上三种模型双视图运行延迟为六点一、十点三和十五点三分钟,工具调用为三十点四、二十五点九和三十九点八次。
- 论文在五十七个文件编辑任务上做成对审阅轴消融;可见 diff 时的观察得分更高,但摘录没有展开该消融的完整分数。
总结与反思
- 结果总结:StagedWorkspace 把工作空间版本变成实验变量,Dual 视图在两类知识工作基准上都更有利。
- 局限性:APEX 排除了二十八个依赖外部 EDGAR API 的任务;异步刷新仍存在短暂 stale 窗口,不支持的二进制格式也没有细粒度 diff。
- 前沿见解:未来的知识工作代理需要提交「证据版本、编辑版本和最终版本」三者一致的工作产品,而不只是一个看起来正确的答案。
三、长上下文的关键不是硬塞更多 token:MoNe 把记忆容量按片段逐层写入 MoNe:面向高效长上下文推理的模块化神经记忆
信号源:Qualcomm AI Research
认知提取
把一百二十八 K token 全部塞进注意力层,就像让每个问题都翻遍一整栋档案馆。
MoNe 先把上下文切成长度为五百一十二的片段,在测试时更新轻量神经记忆;问题到来时只读取固定数量的记忆 token。
它把长上下文从「窗口能不能继续变大」换成了「旧信息怎样被压缩、查询怎样复用状态」。
论文摘要
- MoNe 插接到冻结的预训练 Transformer,不重新训练主干;上下文预处理复杂度为 O(N),查询成本相对于上下文长度为 O(1)。原文
- 论文使用 Qwen2.5-0.5B-Instruct,主干窗口为三十二 K,MoNe 训练上下文最多四 K,评估扩展到一百二十八 K。
- 评测覆盖 S-NIAH、MK-NIAH 和 Frequent Word Extraction,并与完整 ICL 和分块 RAG 比较。
- 额外参数开销为百分之六点四;一百二十八 K 时,MoNe 的计算量和峰值显存相对 ICL 约降低百分之八十。

核心方法
- 冻结主干:每个 Transformer 层挂接一个使用 SwiGLU MLP 的快速权重记忆模块,主干参数保持不变。
- 局部更新:每个五百一十二 token 片段生成 key 和 value,通过关联记忆损失只更新当前层的快速权重,不把梯度传回其他层。
- 记忆查询:问题 token 经过查询投影后生成记忆 token,再用冻结的 key/value 投影把记忆转换成注意力项,与问题自身的标准注意力拼接。
- 长序列复用:同一个记忆状态可以被多个查询复用;新片段到来时增量更新,不必重新读取过去全部 token。

实验成果
- 一百二十八 K 时,MoNe 在 S-NIAH、MK-NIAH、FWE 上分别达到零点九六、零点九四和零点九六;ICL 分别降至零点二八、零点零零和零点二三。原文
- MoNe 在四 K、八 K、十六 K、三十二 K、四十八 K、六十四 K、九十六 K 和一百二十八 K 上保持相对平稳,而 ICL 在主干窗口之外明显退化。
- 仅使用最后十六层时,MK-NIAH 在四 K、六十四 K、一百二十八 K 上为一点零零、零点八八和零点七零;仅使用最后八层时,六十四 K 与一百二十八 K 降至零点一五和零点零二。
- 默认片段长度五百一十二能从四 K 训练上下文推广到一百二十八 K;片段长度一百二十八和二百五十六在超过十六 K 后快速下降。
总结与反思
- 结果总结:MoNe 以少量模块化参数把测试时学习、长上下文压缩和查询复用接在一起,效率与检索保持率同时改善。
- 局限性:容量调度按上下文位置而非信息重要性决定;长上下文任务主要是合成检索和词频抽取,尚未证明复杂跨文档推理。
- 前沿见解:长上下文模型的下一场竞争,可能是把记忆预算按信息生命周期分配,而不是继续只扩展窗口上限。
四、机器人世界模型不必绑定关节空间:Hydra-0 用像素动作流连接不同实体 Hydra-0:面向通用世界建模与控制的动作流
信号源:英伟达、布朗大学、哥伦比亚大学、哈佛大学
认知提取
不同机器人有不同的关节、夹爪和控制接口,直接把它们拼在一起,像要求不同国家的道路共用一套车牌。
Hydra-0 把动作改写为相机平面上的像素运动轨迹,再用这个视觉接口预测未来视频和机器人动作后果。
它的价值不在于让世界模型多看一种视频,而在于把动作的语义从具体 embodiment 中抽离出来。
论文摘要
- Hydra-0 使用 action flow 表示机器人、物体或人手表面点的像素轨迹,前向模式预测动作造成的视频后果,逆向 WAM 模式从期望物体流预测兼容的机器人运动。原文
- 训练数据来自 DROID、ABC-130k、MolmoAct2、EgoDex、Deform360、XVLA-Soft-Fold 和 H1-Fold-Clothes,共一百七十八万八千七百零七个 episode,过滤后保留一百五十六万五千六百三十四个窗口、约二千二百零一点七小时。
- 每个窗口重采样到四百八十 p、十六 fps、八十一帧;部署时仍需 Isaac Lab 控制器、机器人几何、相机内外参和深度缓冲构造可执行动作流。
- 训练冻结视频骨干,只训练 patch embedding 和 rank-64 LoRA;每个 chunk 使用四步去噪,并通过 KV cache 做自回归 rollout。

核心方法
- 动作流构造:训练视频用密集点跟踪和 grounded mask 分离机器人、夹爪、人手与物体;部署视频用控制器和物理仿真生成带运动学含义的像素轨迹。
- 四种条件模式:Embodiment 使用机器人或人手轨迹,Object 使用物体未来轨迹,All 同时使用全部轨迹,None 用于条件 dropout。
- 运动条件注入:从初始图像 latent 采样轨迹起点特征,沿像素轨迹传播,并用可见性和 presence gate 在 DiT patch embedding 前注入。
- 逆向 WAM:输入人类示范迁移得到的期望物体流,世界模型推断兼容的机器人运动 latent,目标机器人 action head 再映射为可执行动作;该模式仍需要目标机器人配对 rollout。

实验成果
- 相比 action-conditioned Cosmos 2.5 baseline,机器人运动误差降低百分之九十点四,物体运动误差降低百分之六十点一六。原文
- RoboLab 五个策略的 replayed success rate 与 reference success rate 之间 Pearson 相关系数为零点九六;零点九六是相关性,不是百分之九十六的成功率。
- 论文展示跨单臂、双臂、人手、手持夹爪和 humanoid 数据的组合,以及从人类示范到机器人动作的零样本组合;给定原文提取没有提供每个真实机器人任务的绝对成功率。
- 误差改善依赖可见表面点、相机标定和开环固定轨迹;遮挡、标定偏差或实时接触修正会改变部署条件。
总结与反思
- 结果总结:Hydra-0 让动作流成为连接世界建模、开环评估和机器人控制的共享接口。
- 局限性:部署仍依赖运动学 grounding,逆向控制只是 proof-of-concept,开环相关性不能等同于闭环操控能力。
- 前沿见解:机器人基础模型的统一动作空间,可能不是关节坐标,而是能被相机观察和物理仿真共同解释的中间运动。
认知模型
五、Agent RL 的最小接口是模型调用,而不是重写整个 harness:Agent Lightning v1.0 Agent Lightning v1.0:走向 Harnessed Agentic RL
信号源:微软、复旦大学、浙江大学、爱丁堡大学
认知提取
真实 Agent 的工具调用、子 Agent 和上下文摘要会把一条 rollout 拆成很多次模型调用。
如果训练系统强行把它们拼成一条线,就会在 token 边界、奖励归属和 loss 权重上悄悄改写真实轨迹。
Agent Lightning v1.0 选择站在 LLM endpoint 边界观察请求—响应,用尽量少的代码把现有 harness 接到 RL 训练上。
论文摘要
- 训练时继续由 harness 负责上下文、工具和环境;endpoint/proxy 只捕获每次 LLM 调用的 token 级请求—响应,不要求重写 Agent loop。原文
- 一个 rollout 可能因 retokenization、子 Agent 分支、上下文摘要而拆成多个训练样本;论文主张 advantage 应按 rollout 计算,而不是按拆出的样本计算。
- 论文将框架控制在约三千五百行代码,并验证通用 instruction-following agent、search agent 和 coding agent。
- coding agent 使用约六 K 训练样本和 Qwen3.5-9B,在 SWE-bench Verified 上从百分之四十一点八提升到百分之五十六点四。原文

核心方法
- Best-effort sequence merging:只有相邻调用满足精确 token 前缀关系才合并;前缀不一致时关闭当前样本并开启新样本,牺牲复用率以避免 off-policy prompt。
- Rollout-level advantage:同一 rollout 拆成多少样本不应改变 GRPO group 的 baseline;如果一个奖励为一的 rollout 拆成三个样本,sample-level baseline 会被样本数量扭曲。
- 动态 loss 归一化:论文比较 token-mean、seq-mean-token-mean 和 rollout-mean,指出样本数量不应无意中改变某条 rollout 的优化权重。
- 轻量控制面:harness 可在 Kubernetes 集群中直接运行,训练后端负责动态样本数、负载均衡和 rollout 到样本的映射。
实验成果
- Qwen3.5-9B 在 SWE-bench Verified 上由 RL 前百分之四十一点八提升到 RL 后百分之五十六点四,绝对提升十四点六个百分点;论文称训练使用六 K 样本和 modest compute。原文
- coding-agent 运行中,只有百分之三十六的 rollout 最终保持为单个训练样本,每条 rollout 平均产生二点四个训练样本;这说明线性样本假设与真实 Agent 轨迹差异很大。
- 论文没有在当前原文摘录中完整披露 GPU 型号、训练时长、loss normalization 最终实现以及 search agent 的逐项结果;读者复现时不能只复制百分之五十六点四这个终点数字。
总结与反思
- 结果总结:Agent Lightning v1.0 的工程信号是把 RL 接口放到模型调用边界,尽量不破坏现有 Agent harness。
- 局限性:训练系统看不到 harness 和环境的潜在状态;token boundary drift、工具格式化和动态样本数仍会影响 credit assignment。
- 前沿见解:Agent RL 的基础设施比较,应该同时报告模型、harness、环境和样本切分策略,单看模型 checkpoint 已经不够。
多模态
六、图像生成的高分辨率计算不必平均分配:AViTS 按时空重要性选择 token AViTS:面向高效动态分辨率生成的自适应时空 token 选择
信号源:上海交通大学、山东大学、吉林大学、西安交通大学
认知提取
扩散图像的每个区域都不需要同时升级到最高分辨率。
文字 attention 更容易找到与指令相关的区域,跨时间步的 variance 更容易找到仍在快速变化的细节。
AViTS 把这两类信号合成 token 重要性分数,先把高价值区域升到高分辨率,再做完整 refinement。
论文摘要
- AViTS 在低分辨率 denoising 后收集 image-to-text attention 和 latent step variance,以 Top-K 方式选择优先上采样的 token。原文
- Stage 1 低分辨率去噪,Stage 2 选择性上采样,Stage 3 完整分辨率 refinement;主要机制发生在推理/采样阶段。
- 实验覆盖 FLUX.1-dev、Qwen-Image-Edit 和 FLUX.1-Kontext-dev;FLUX.1-dev 使用 NVIDIA A800,其余模型使用 NVIDIA H20。
- 在 FLUX.1-dev 的 DrawBench 上报告 ImageReward、CLIP Score、延迟、FLOPs 和 NFE;论文还报告与蒸馏模型结合时最高十四点七六倍加速。原文

核心方法
- 空间分数:对 image-to-text attention 在 head 和文字 token 上聚合;FLUX 的 fused joint attention 需要通过 hook 取 Q/K 并重建对应 attention。
- 时间分数:对多个 diffusion timestep 的 token latent 计算跨步方差,突出仍在变化、需要精细处理的区域。
- 融合排序:分别 min-max 归一化 attention 和 variance,以权重 alpha 融合,再用微小高斯扰动打破并列。
- 混合分辨率序列:优先 token 正交上采样,低重要性 token 暂留低分辨率;重新注入坐标绑定噪声后继续 denoising。

实验成果
- FLUX.1-dev、三十 NFE 配置:延迟八点二一秒,相对五十 NFE baseline 为三点一四倍加速,ImageReward 为一点零一零四,CLIP Score 为三十二点四七六。原文
- 十八 NFE 配置:延迟四点七三秒、延迟加速五点四五倍、FLOPs 加速四点八零倍,ImageReward 为零点九九五九,CLIP Score 为三十二点三六一。
- FLUX.1-schnell 的十四 NFE 配置达到七点零六倍延迟加速和六点三四倍 FLOPs 加速;九 NFE 时达到九点七八倍,但 ImageReward 相对下降百分之五点三三。
- 方法仍需在 Stage 3 对剩余 token 做完整分辨率 refinement;多 timestep latent 和 attention map 的收集、以及 fused attention hook 都会带来工程成本。
总结与反思
- 结果总结:AViTS 把动态分辨率从统一放大改成基于语义和变化率的分配,速度—质量权衡比单纯减少 NFE 更可解释。
- 局限性:效果依赖 alpha、rho、收集步数和各阶段步数;极端加速仍会掉质量,Qwen-Image-Edit 和 FLUX.1-Kontext-dev 的完整结果表在当前摘录中没有展开。
- 前沿见解:生成模型的稀疏化正在从静态剪枝转向「什么时候、哪个区域值得继续算」的采样调度。
具身智能
本期具身板块由头条 Hydra-0 代表。它与上一期的纯机器人策略论文不同:方法的中间对象不是技能文本或动作 chunk,而是可以由视频、控制器和相机共同解释的 action flow;读者应把误差改善、开环相关性和真实闭环成功率分开看。
AI4Science
七、物理约束不是训练时硬塞进去:Flow Matching 能量在采样时接入 PDE 残差 已知物理约束下的 Flow-Matching 能量组合
信号源:阿贡国家实验室
认知提取
普通生成模型先学数据长什么样,再希望样本恰好满足物理规律。
这篇论文把 Flow Matching 的速度场写成势函数梯度,因此同一个势函数既给出生成方向,也给出一个可计算的能量。
PDE 残差、观测似然和数据能量可以在采样阶段组合,但这条路的代价是:物理约束让采样更像 MCMC,而不是一条干净的 ODE。
论文摘要
- 论文令速度场为标量势函数的梯度,并从势函数导出时间相关能量;已知 PDE 残差作为额外能量项加入采样目标。原文
- EnergyPC 在 Flow ODE 的 predictor 后加入 ULA 或 MALA corrector,实验覆盖 Poisson、Helmholtz 和 Burgers 字段。
- 终端总能量还可用于 OOD 检测;观测似然加入后,可用于 PDE 解场重建和系数场反演。
- 原文报告整体上能降低 PDE residual 和 spectral distance,但当前可访问摘录没有恢复各任务完整数值表,因此只引用图中可读的逐面板残差。

核心方法
- 势函数 Flow Matching:用势函数梯度生成速度场,训练仍采用标准 Flow Matching 回归目标;势函数同时提供数据驱动能量。
- 物理能量组合:总能量由数据能量与 lambda_t 乘以 PDE 残差平方构成;高噪声阶段将物理权重调低,因为此时残差不稳定。
- EnergyPC:predictor 之后执行 Langevin corrector;ULA 直接接受 proposal,MALA 再用 Metropolis—Hastings 校正离散化偏差。
- 后验与 OOD:把观测误差项加入总能量形成后验目标,并在低噪声终端用总能量作 OOD 分数。

实验成果
- Burgers 图中,四个残差面板的 Data 数值分别为零点零零零一二一、零点零零零四、零点零零零四六六和一点三一乘十的负五次方;EnergyPC-MALA 对应为零点零零零二八四、零点零零零五零三、一点八八乘十的负五次方和零点零零零八三一。原文
- 图中 ODE、EnergyPC-ULA、EnergyPC-MALA、ODE+ULA、ODE+MALA 和 annealed sigma-gated 方法的残差呈现不同空间结构,说明「加物理项」不是对每个样本逐格保证更低残差。
- 论文声称总能量在多种 corruption 上比单独数据能量或物理残差更适合 OOD 排序;当前摘录没有提供每种 corruption 的 AUROC 数值。
- 物理后验采样需要额外 MCMC 步骤,步长、corrector 次数、终端最小噪声和 lambda 调度都会增加复现敏感度。
总结与反思
- 结果总结:论文提供了一个把数据先验、PDE 残差和观测似然组合到同一采样能量中的统一接口。
- 局限性:有限训练时势函数不一定等于真实边际密度;总能量也不一定是 Flow 的真实中间边际,终端时间还存在数值不稳定。
- 前沿见解:AI4Science 生成模型的下一步不是只追求样本逼真,而是让样本的物理可行性、分布校准和 OOD 分数共享同一个可审计对象。
Infra
八、模型会执行目标 PTX 指令,不等于它真的优化了 GPU:PTXBench 把 kernel 评测拆成三道门 PTXBench:用架构专属 PTX 评测与适配 LLM GPU kernel 优化
信号源:斯坦福大学、卡内基梅隆大学、RadixArk、独立研究者
认知提取
GPU kernel 的优化不能只看代码是否编译通过。
一个模型可能写出了正确 kernel,也调用了新一代 PTX 指令,但实际执行的有用工作量仍然很低。
PTXBench 把「功能正确」「目标指令真的被执行」「相对前沿库更快」分成三道门,逼着模型从会写代码走向会测量。
论文摘要
- 每个实例固定参考算子、workload、GPU 架构和目标 PTX 指令族;模型从零生成带 inline PTX 的 CUDA kernel,并保留多轮编译、运行、修复反馈。原文
- 评测覆盖 NVIDIA H100 与 B200,任务包括 GEMM、MHA-Fwd、MHA-Fwd-Causal、MHA-Bwd 和 MHA-Bwd-Causal。
- 目标指令成功需要同时满足功能正确、SASS 中存在目标指令族,以及 Nsight Compute 报告正的 predicate-enabled thread count。
- Fixit SFT 用失败 kernel、编译或运行反馈和 teacher 修复构造数据;基础模型为 Qwen3.6-27B,比较七种 s0—s6 recipe。

核心方法
- 三道检查:功能检查输出 shape、dtype 和数值;静态 SASS 检查目标指令族;动态 Nsight Compute 检查目标指令是否真的被执行。
- 性能协议:每次计时先 warmup 十次,再测五十次并取中位延迟;speedup 定义为参考延迟除以候选延迟。
- 架构知识包:每条轨迹提供约二十 K 至三十 K token 的架构参数、PTX wrapper、layout、同步和一致性契约。
- Fixit 适配:repair teacher 生成修复 kernel,reasoning teacher 生成解释,学生模型学习从失败状态到修复结果的映射;失败样本只从适配前 checkpoint 收集一次。

实验成果
- H100 上,Claude Opus 4.8 的目标指令正确率在 GEMM、MHA-Fwd、Fwd-Causal、MHA-Bwd、Bwd-Causal 上分别为百分之九十四点八、九十点六、七十五点零、七十九点二和四十四点八;B200 上对应为八十点二、三十八点五、三十二点三、十点四和未报告。原文
- B200 GEMM 中,Gemini 3.1 Pro 的最高 speedup 为 cuBLAS 的零点八九二倍,Claude Opus 4.8 为一点零一二倍;执行新指令不等于超过前沿库。
- Gemini 3.1 Pro 仅给架构参数时目标指令正确率为百分之零;加入 PTX 模板后为百分之十九点八,再加入架构契约后为百分之三十八点五。
- 目标指令指标是二值执行检查,不代表指令利用率或有效工作量;没有任何被测模型在完整任务集上持续达到前沿库性能。
总结与反思
- 结果总结:PTXBench 把 GPU kernel 优化从代码生成题改成可执行、可测量、可审计的系统题。
- 局限性:评测只覆盖 H100、B200、固定 workload 和有限模型;适配数据来自适配前 checkpoint,可能遗漏适配后出现的新错误。
- 前沿见解:面向硬件的 Agent 评测应该把「是否触发目标机制」和「是否带来端到端收益」强制拆开。
Agent
本期 Agent 板块与认知模型板块由 Agent Lightning v1.0 共同覆盖。它的独立增量在于把 harness 视为训练协议的一部分:同一个模型换一个工具编排或样本切分方式,可能得到完全不同的 RL 结果。
应用体系
九、表格预测不必把三千二百八十个示例全塞进 prompt:ARASH 按局部性和难度分配 shots ARASH:面向表格预测的自适应检索与示例选择
信号源:麦克马斯特大学
认知提取
固定取三十二个最近邻,是把所有查询都当成同一种题。
ARASH 先看数据集是否有稳定局部结构,再看局部标签是否纯净,最后决定用多少示例、局部 kNN 还是全局 DPP。
它把 in-context learning 的 prompt 长度,变成一个可以按查询难度动态调度的预算。
论文摘要
- ARASH 的三阶段是局部性感知聚类、基于难度的 shot 预算分配、查询路由与检索策略选择;基础模型以 TabPFN 为主,也测试 LLaMA 3.2、Qwen 2.5 和 FLAN-T5。原文
- 数据使用 OpenML-CC18 和 Combo 集合,训练—测试按八十比二十划分,随机种子为四十二,主实验使用 NVIDIA GeForce RTX 4090。
- 当 cluster 局部性高且标签纯度高时,ARASH 使用局部 kNN;局部性高但纯度低时使用 DPP;局部性低时混合局部—全局检索或全局 DPP。
- 如果选中示例的标签完全一致,系统进入 Direct mode,不调用表格基础模型;否则进入 TFM mode。

核心方法
- 局部性画像:用数据规模、维度、PCA 各向异性和 Hopkins 统计量决定聚类方法,候选包括 KMeans、GMM、Birch、HDBSCAN 和层次聚类。
- 难度分数:把 cluster 的归一化标签熵和一点减去纯度求平均,难度越高,分配的 shots 越多。
- 查询路由:查询先进入 cluster,再根据全局局部性和当前纯度选择 kNN、DPP、混合检索或全局 DPP。
- 预算控制:shots 下限不低于 cluster 内不同标签数,上限不超过 cluster 样本数,并受模型 token 长度约束。
实验成果
- 摘要报告:结合 TabPFN 后,ARASH 在准确率相近的情况下将 prompt 长度减少一千二百六十一点五倍,内存使用减少二点五六倍。原文
- 四个合成区域中,Full-context 使用三千二百八十个 demonstrations;ARASH 分别使用六、十九、十三和五十八个示例,准确率为百分之九十六点二五、百分之九十五点零、百分之九十三点零和百分之五十点五。
- 固定 kNN 使用三十二个示例时,四个区域准确率为百分之九十六点二五、百分之九十三点零、百分之九十二点六和百分之四十四点零;低纯度区域中,DPP 带来的多样性是主要增量。
- 局部纯度足够高时,Direct mode 可以跳过 TFM 推理;但聚类阈值、类别不均衡和固定数据划分会影响跨数据集稳定性。
总结与反思
- 结果总结:ARASH 让表格 in-context learning 同时适配局部结构、标签难度和 token 预算。
- 局限性:全局局部性分数是数据集级常数,不能随每个查询更新;聚类和阈值选择仍带启发式色彩。
- 前沿见解:应用系统的检索器不只应回答「找哪些示例」,还应回答「这次查询值得花多少示例预算」。
Benchmark
十、文档多模态推理的难点不只是 OCR:BEAR-Bench 用双语企业与学术页面测试多跳理解 BEAR-Bench:面向多模态模型的双语企业与学术推理基准
信号源:Yandex、Applied AI Institute
认知提取
一张文档页面既可能有表格、图表和公式,也可能把答案拆在不同视觉区域。
BEAR-Bench 不让模型依赖外部知识,而是要求模型从页面本身完成多跳问题。
它的价值在于把视觉理解、布局阅读、数值计算和跨区域推理放进同一张答卷,而不是只测文字能不能被 OCR 出来。
论文摘要
- 基准包含一千张文档页面图像和一千个人工编写 QA;商业领域五百三十二张,科学领域四百六十八张;俄语六百一十八题,英语三百八十二题。原文
- 文档覆盖财务报告、投资者演示、流程图、组织结构图、数学物理公式、科学图表和学术多栏页面;九百四十题带有二至十步以上的粗粒度推理深度标注。
- 零样本评测只提供页面图像和问题,温度为零点六;开放权重模型在 H100 和 L40 服务器运行,专有模型通过 OpenRouter 调用。
- 主要结果由 GPT-4o 作为语义等价判题器,二百条分层抽样中与人工判断一致率为百分之九十九。

核心方法
- 双语双领域构造:从企业与学术页面中筛选含有图表、公式、代码或流程图的高视觉密度样本,再由人工编写页面内可验证问题和答案。
- 多跳约束:问题要求表格汇总、跨年度比较、图表趋势解释、公式与图形联合推理或流程图路径追踪,答案不得依赖外部领域知识。
- 质量控制:八个专有 VLM 检查异常样本,人工审核删除错误或含歧义标准答案;质量抽查报告标准答案质量百分之八十四点四、问题质量百分之九十点九。
- 错误诊断:人工检查一百五十条错误回答,再归纳为空间误定位、计数/聚合、OCR/视觉属性、图表数值提取和语义/推理五类。

实验成果
- Overall 最佳为 Qwen3.5-397B-A17B 的百分之七十五点四,Gemini 3.1 Pro 为百分之七十五点一;Business 最佳为 Gemini 3.1 Pro 的百分之七十九点五,Science 最佳为 Qwen3.5-397B-A17B 的百分之七十二点二。原文
- Gemini 3.1 Pro 的英语准确率为百分之八十三点零,俄语为百分之七十点二;Qwen3.5-397B-A17B 的英语为百分之八十一点九,俄语为百分之七十一点四,语言差距没有被大模型规模消除。
- Qwen3.5-9B 的图像缩小倍率从一倍到四倍时,准确率从百分之四十九点六下降到百分之四点七;原文正文的原始分辨率数字写作百分之四十九点三,与表四的百分之四十九点六存在轻微不一致。
- Qwen3-VL-8B-Instruct 加显式 CoT 后从百分之二十五点四升到百分之三十九点一;Qwen3.5-9B、Qwen3.5-4B 的 CoT 结果反而分别下降零点三和一点四个百分点。
总结与反思
- 结果总结:BEAR-Bench 把文档图像中的语言、布局、图表和公式推理放到同一个双语评测里,当前最强模型也只达到约四分之三正确率。
- 局限性:只有英语和俄语,任务以单页 PNG 为主,主结果依赖 GPT-4o 判题;标准答案质量抽查也不是百分之百。
- 前沿见解:多模态模型的下一道门槛不是把页面看得更清楚,而是把页面中的多个证据连接成可复核的推理链。
阅读优先级
- 先读方法与系统边界:StagedWorkspace、MoNe、Hydra-0、Agent Lightning v1.0。四篇分别覆盖版本状态、记忆调度、动作接口和 Agent RL 训练边界。
- 再读评测与资源约束:自我改进智能体脆弱性、PTXBench、BEAR-Bench。它们共同说明,单次成功、目标指令命中和视觉回答正确都不能替代完整协议。
- 最后看迁移与应用:AViTS、已知物理 Flow Matching、ARASH。三篇把预算调度分别带到扩散采样、科学生成和表格预测。
本期论文事实、数字和图表均以对应 arXiv 原文为准;图表下的来源链接指向论文原始详情页。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
