奇绩信号Alpha Sight 2026年9月17日【文字版】

奇绩信号Alpha Sight 2026年9月17日【文字版】

精选 2026 年 9 月 15 日 arXiv 最新批次十三篇论文,拆解逐位可复算的四百 B token 训练、科研智能体的嵌套自改进、人形全身灵巧操作、二十四 GiB 笔记本上的二十万 token 长上下文服务,以及把音视频证据写进评分的长视频基准等前沿信号。

本期精选 2026 年 9 月 15 日最新提交并在 arXiv 上公开可见的十三篇前沿 AI 论文。
AI 科技评论注意到,这一批论文有一个共同的动作:把"经验"从一次性消耗品,改造成可重放、可审计、可独立校验的中间接口。训练过程可以被逐位复算,交互轨迹可以被召回重放,局部信用可以被打折摊销,评分规约可以被证据证书反查。
我们严格按头条、认知模型、多模态、具身智能、AI4Science、Infra、Agent、应用体系、Benchmark 九个板块呈现本期精选内容。

头条

1. 科研智能体的进步不该只发生在一次对话里——ScienceBuddy 用「递归中的递归」把作业规程演化与模型强化学习焊成一个闭环原文

信号源:原论文 arXiv 版本未展开机构署名
🔬

认知提取

把大模型放进实验室,最常见的尴尬是:它在这一轮对话里被纠正了,换一道题还会踩同一个坑。对话里的修正留在对话里,出了这个会话就归零。
ScienceBuddy 把这件事拆成两个嵌套的循环:内层固定模型、只改智能体的作业规程(harness),外层固定规程、只训模型。
研究者的每一次追问、纠正和检查,同时被编译成任务定义和评分规约。
这意味着「科研协作」这种最难被量化的经验,第一次有了可执行的落地格式——一份指令、一份评分规约、一批可重跑的测试。

论文摘要

• 论文针对科学智能体的核心问题:与研究者协作产生的反馈,如何跨任务沉淀为工作流程与底层能力的持续提升,而不是停留在单轮对话里的答案修正。原文引言
• 提出 ScienceBuddy 交互式科研工作区,内置二百二十四个工具、二十二个功能模块,覆盖基因组学、分子与肿瘤生物学、药理学、生物成像、文献检索与数据库查询。原文工作区设计
• 提出「递归中的递归」自改进范式:内层递归在模型固定时演化 harness,外层递归在 harness 固定时用评分规约奖励训练模型,两层通过科学任务与评测规约相连。原文方法总览
• 实验任务集包含八百九十五个任务:九十六个 LitQA2、五百一十一个 DbQA、一百零八个 ProtocolQA、一百八十个 GWAS,共十六个子主题。原文数据构成
ScienceBuddy 系统总览图
ScienceBuddy 的「科研工作区 + 递归自改进」总览;上半部分是研究者提问、检查执行轨迹与产物并迭代需求的交互面板,中段显示请求、回复、动作、观测与产物如何被同时编译成可执行任务与任务专属评分规约,下半部分是内层 harness 演化与外层 GRPO 模型训练耦合的完整回路。原论文图

核心方法

• 交互形式化:任务模型记作 πθ,harness 记作 H;harness 负责把历史 ht=(x,a0,o1,…) 组织成上下文,动作可以是可执行代码、工具调用,也可以是面向研究者的回答。原文交互建模
• 协作转任务与规约:用 ConstructRubric 从协作轨迹中生成任务专属评分规约,并打包成 Harbor 任务 P_x,由 instruction.md、task.toml、environment/、tests/test.sh 分别承担任务定义、执行配置、任务素材与基于规约的评测。原文任务打包
• 内层递归:任务模型与辅助模型都固定,辅助模型只做有界编辑——增加、删除或修改一条作用域受限的技能、一段指令或一个上下文设置;候选改动只有在配对开发集评测上变好才被接受。案例中每个 cycle 含十个搜索步,二百八十八段适配对话产生二十四次更新。原文内层递归
• 外层递归:选中的 harness 固定后,先做环境难度校准与新鲜 on-policy rollout,再用任务专属规约奖励做 GRPO 更新;harness 与评分规约在训练期间保持不动。原文外层递归
• 奖励与优化:轨迹奖励是加权规约得分之和,训练采用组内相对优势、token 级平均、裁剪与 KL 代理目标;模型学习案例对同一问题采样四次,报告 pass@4。原文奖励设计

实验成果

• 三个递归 cycle 的 harness 验证准确率分别为:第一轮由三十八点九升到四十四点四,第二轮由三十四点四升到四十六点七,第三轮由六十一点一升到七十点零;harness 的选择使用一个独立固定的验证集。原文学习动态
• 对应的训练奖励均值同样单调上行:第一轮由三十三点三到三十八点八,第二轮由四十四点一到六十点五,第三轮由五十七点八到六十九点八。原文训练奖励
• 留出任务集的单次尝试准确率由四十二点二升到七十三点三;其中三十三点三的问题由错误转为正确,二点二的问题由正确转为错误。原文结果转移
ScienceBuddy 三轮递归学习动态
三个递归周期的学习动态与评测结果;(a) harness 验证分随累计搜索步抬升,星号标出新的历史最优,(b) 同一测试集上训练前后的题目归属转移:四十点零保持正确、二十四点四保持错误、三十三点三由错误转正确、二点二由正确转错误,(c) 四个科学任务族的测试准确率对比,DbQA 由三十六升到七十四、GWAS 由三十升到六十、LitQA2 由八十升到八十七点五、ProtocolQA 由六十升到七十。原论文图
• 固定模型、只演化 harness:在 Qwen3.5-4B 权重固定下,验证准确率由初始 harness 的三十一点一升到选中 harness 的五十一一点,增益二十个百分点;二十四步适配后 harness 含四条指令条目与九个作用域受限技能。原文 harness 适配
• 固定 harness、只训模型:以 pass@4 计的问题覆盖率由四十八点三升到六十七点八,增加十九点五个百分点,也就是在同样尝试预算下解出更多不同题目。原文模型学习

总结与反思

结果总结: ScienceBuddy 证明科研协作产生的反馈可以同时喂给两条改进通道,harness 决定模型看到什么样的经验,模型的能力上限又反过来为规程演化打开新空间。
局限性: 案例中的 harness 适配被限定在单文件 harness 的指令与技能文本层面,执行循环、工具接口、上下文处理与预算都保持不变;作者同时说明学习曲线反映的是多项规程改动的合成效果,单个技能与反馈来源的贡献没有被隔离,用户模拟器也是有界且带参考的,不等于无限制的专家反馈。
前沿见解: 智能体的自我改进正在从「把成功轨迹存进记忆」升级为「把协作过程编译成任务与评分规约」,而一旦规约本身可执行,它同时具备了训练信号与审计凭证两种身份。

2. 开源自证清白到底有多贵——OPEN-1B 用逐位可复现算子把四百 B token 的训练做成一本可外部审计的账原文

信号源:Gensyn
📋

认知提取

开源模型总说「权重、数据、配方都给你了」,但在浮点加法不满足结合律的机器上,这句话无法被验证:同样的配方换一批机器,结果就对不上。
于是「有没有偷偷掺数据」「有没有预埋后门」这类问题,永远停留在相信与不相信之间。
OPEN-1B 把验证目标提高到逐位一致:每一个样本上的每一次运算,都要能在异构的普通硬件上被独立复算出来。
代价被诚实写进论文——为了这份可审计性,吞吐掉了一个数量级,模型算力利用率从四成掉到约百分之五。

论文摘要

• 论文指出,现有 proof-of-learning、proof-of-training-data 一类方案只能给出概率性证据,无法排除未披露数据、注入偏差或后门。原文引言
• 提出全可审计训练的完整层级:跨硬件逐位可复现的算子、拓扑不变的数据流、以及可被多名审计者分片复算的集合验证流程。原文方法总览
• 训练并公开 Open-1B:总参数十六亿一千万(非嵌入部分十亿零八百万)、四百 B token、四十八张 H100,整个运行分七段完成。原文模型配置
• 作者明确把「可复现的成本」作为一等公民报告:确定性集合通信、状态哈希与 int8 量化感知训练的开销都被逐项量化。原文成本章节

核心方法

• RepOps 跨硬件逐位复现:在 CPU、NVIDIA GPU 与 Apple GPU 上固定归约顺序、统一 FMA 约定、统一把次正规数刷新为零,并用计数器式随机数生成器(种子、下标)取代状态式随机源。原文 RepOps
• 拓扑不变的数据流:训练数据被定义为规范序列 W0,W1,…,窗口固定为四千零九十七个 token;数据并行秩 r 在 R 路并行中拥有 Wm,当且仅当 m 对 R 取模等于 r。原文数据流
• 确定性集合通信:用递归倍增的蝶形结构实现确定性 all-reduce,用 TreeFold 二进制进位折叠与集群递归倍增对齐,reduce-scatter 按升序分片累加,使单设备审计重放成为可能。原文集合通信
• 模型与训练配方:二十四层解码器、隐层二千零四十八、十六个查询头对四个 KV 头的 GQA、前馈隐层五千六百三十二、词表十二万八千二百五十六、序列长度四千零九十六、RoPE θ 取五十万,每五层设置一个全局因果注意力层。原文架构表
• 批大小三段式推进:热身阶段每步三百一十四万五千七百二十八 token,主阶段四百七十二万八千五百九十二,后段九百四十三万七千一百八十四;峰值学习率四点五乘十的负四次方,注意力与前馈线性层采用 int8 W8A8 的 LSQ 量化感知训练。原文训练配方
• 数据配比:Open-1B Mix 0626 约四千五百零五亿 token、三亿三千二百二十万文档,其中 DCLM-Baseline 占百分之六十六点七、FineWeb-Edu 占百分之十三点三、The Stack v2 占百分之十二点零、Proof-Pile-2 占百分之八点零,四百 B 预算下约零点八九个 epoch。原文数据构成

实验成果

• 整个运行含八万零九百五十七个优化步、四百 B token,最终留出交叉熵二点五八零;八万零九百五十七步中只有十步被跳过,主阶段单步中位耗时二十八秒、后段四十七点一秒,有效训练时间二十七点八天,日历跨度二十九点五天。原文运行统计
图表收录范围说明:OPEN-1B 的 arXiv 版本共十张图,全部是训练过程与性能曲线(损失收敛、梯度行为、学习率与批大小、权重范数、量化器漂移、运行吞吐与集合通信),原论文未提供方法总览示意图,因此本节方法部分以文字与原文数字呈现。本节收录了梯度范数漂移修复对比(Figure 5)与运行实现吞吐对比(Figure 10),未收录范围限于原论文 Figure 1 至 Figure 4、Figure 7 至 Figure 9 的曲线图。
• 损失曲线拟合:训练损失约等于三点五三乘 T 的负零点零五七次方(拟合优度零点七一),留出损失约等于三点四四乘 T 的负零点零五零次方(拟合优度零点九三),固定留出集把拟合优度从零点七一抬到零点九三。原文损失收敛
• 梯度范数:全运行中位数零点一二九、均值零点一五九、九十九分位零点六一二,最大值七点零六出现在第 247 步;裁剪实际触发三百四十三步,占全部步数的百分之零点四二。原文梯度行为
OPEN-1B 梯度范数漂移修复对比
量化器步长漂移导致的梯度范数漂移与修复对比;原始运行在第两千五百步之前就偏离基线并冲到三百以上,而每一步重新计算量化尺度的运行在同一区间保持平坦,这是同一篇论文里被发现并修掉的一个隐蔽训练缺陷。原论文图
• 精度对比:采用 int8 量化感知训练的 Open-1B 与 PyTorch bf16 基线在四百 B token 后交叉熵相差约零点二 nats,而可复现 bf16 比可复现 int8 慢约一点六倍。原文 int8 对比
• 可审计性的账单:单节点 stock PyTorch bf16 吞吐二十八万八千 token/秒、模型算力利用率百分之四十点五;同节点可复现 bf16 只有二点三六万、百分之三点三;可复现 int8 为四点二一万、百分之五点九。六节点分别为一百一十三点六万(百分之二十六点六)、十二点九一万(百分之三点零)、二十一点七五万(百分之五点一),stock 对可复现 int8 的差距为五点二倍。原文运行实现
OPEN-1B 吞吐与模型算力利用率
固定四百七十二万 token 全局批大小、一到六节点的三种运行实现对比;左图纵轴为墙钟吞吐(含各实现自身单节点点的线性外推虚线),右图为统一口径计算的模型算力利用率,stock PyTorch bf16 在六节点达到一百一十三点六万 token/秒,而可复现 int8 为二十一点七五万,可复现 bf16 仅十二点九一万。原论文图
• 确定性集合通信与 NCCL 在八百零四 MB 每秩桶上的差距:两节点五百四十八毫秒对四百八十五毫秒(一点一三倍),四节点一千二百一十八对七百六十七毫秒(一点五九倍),六节点二千八百二十四对七百九十八毫秒(三点五四倍),作者指出主因是非二的幂折叠带来的串行跳数,而非带宽损失。原文通信成本
• 下游基准的真实差距:Open-1B 在四百 B token 下的平均分二十五点四,对照组 OLMo 2 1B 在四 T token 下为三十一点九;差距来自一个数量级的 token 预算,而不是逐位可复现设计本身。原文基准表

总结与反思

结果总结: OPEN-1B 把「开源」从提供文件推进到提供可复算的证据链,证明逐位可复现的训练在真实规模上跑得通,而且训练过程中真的靠它抓出了量化器步长漂移这类隐蔽缺陷。
局限性: 代价被作者逐项列明——逐位可复现的 int8 张量核 GEMM 比 stock PyTorch bf16 慢约五倍,模型算力利用率只有约百分之五;受开销与资源限制,本次只训练四百 B token,比对照模型少一个数量级,因此下游分数落后;运行因工程问题分七段完成,状态哈希目前仍在主机侧执行,每步约六秒。
前沿见解: 当模型能力逐渐被当作基础设施,可审计性迟早会像电力系统的计量表一样写进成本表,接下来的争论不再是「要不要付这笔钱」,而是「谁来定义可接受的计量误差」。

3. 人形机器人搬把椅子到底难在哪——Weave 把人类示范重定向成 29 个身体关节加 12 个手指关节的联合指令原文

信号源:清华大学交叉信息研究院、清华大学人工智能学院、大连理工大学、香港中文大学
🦾

认知提取

让人形机器人搬一把椅子,听起来像入门题,实际是三道题叠在一起:手指要抓稳,腰要承重,脚要随时改站姿。任何一环松掉,物体和机器人会一起倒。
Weave 的答案是先把人类示范翻译一遍:用接触感知的全身逆运动学重定向人类动作,强制保留手—物接触与物体轨迹,再用运动生成模型补出一段走近物体的移动前缀。
训练出的是一条统一策略,二十九个身体关节与十二个手指关节由同一个网络指挥,九类物体共用一套参数。它的信号不在成功率本身,而在于把「像不像人」与「做没做成」明确分开:模仿误差更低的专用策略,反而更少真正完成交互。

论文摘要

• 论文关注从捕获的人—物交互中学习人形机器人的全身灵巧移动操作,要求同时协调平衡、行走与手指接触,把机器人运动与物体运动一并控制。原文全文
• 作者指出已有路线各有缺口:参考动作跟踪在身体与手臂层面对齐动作却不建模手指级的手—物接触;已有灵巧交互方法多面向仿真角色或固定底座机械手,其运动学与驱动方式与欠驱动人形手不同。原文问题陈述
• Weave 先用接触感知重定向与接近动作补全,把捕获的 SMPL-X 人体动作与物体轨迹转成可执行的机器人—物体参考,覆盖靠近、抓取与搬运。原文方法
• 机器人平台为 Unitree G1,二十九个驱动身体自由度,配两只 Inspire 灵巧手共十二个驱动手指自由度。原文实验平台
Weave 方法总览图
Weave 全流程总览;(a) 捕获的人—物交互提供配对的 SMPL-X 身体动作与物体轨迹,(b) 全身逆运动学在保留手—物接触与物体轨迹的前提下完成重定向,(c) 运动生成模型按不同进入方位合成移动前缀,把一段捕获数据扩成多条完整参考,(d) 一条统一的参考条件策略在仿真中跨全部物体与交互片段训练。原论文图

核心方法

• 全身重定向:用全身逆运动学把选定的机器人链路与 SMPL-X 对应部位对齐,骨盆只在水平面受约束、高度按地面接触优化,同时施加关节限位、速度与加速度惩罚。原文重定向
• 接触感知的手部细化:固定骨盆与双腿,只优化双臂与手指配置,目标包含接触吸引项、力闭合项(力闭合量大于零表示达到力闭合)、穿透惩罚与正则项。原文手部细化
• 接近动作补全:用运动生成模型合成靠近初始交互姿态的移动前缀,与细化后的交互轨迹拼接成完整参考;训练集采样三个进入方位,测试集采样五个方位。原文参考构建
• 统一参考条件策略:输入包含机器人本体感受、物体状态与几何特征(含地真相对位姿、指尖到表面向量、二值接触标志与 BPS-SDF 描述子)以及短时域参考指令。原文策略设计
• 训练采用 PPO,仿真 200 Hz、控制 50 Hz,动作输出为关节位置目标并由 PD 控制器跟踪;actor 只接收可用观测,critic 使用含基座线速度与跟踪体姿的特权观测。原文训练设置
• 优化与随机化:二维权重矩阵走 Muon、偏置及其他参数走 AdamW,并对机器人/物体摩擦、恢复系数、躯干质心与手指驱动特性做域随机化;终止条件含骨盆位置误差超过零点二五米、物体位置误差超过零点三零米与预期接触连续十个控制步缺失。原文终止条件
• 数据规模:训练集七千八百六十九条参考轨迹、累计十九点五六小时,测试集一千六百零五条、累计三点六七小时,覆盖九类物体。原文数据分布

实验成果

• 统一策略随迭代稳定提升:成功率由一万步的七十八点零升到十万步的九十二点五,进度率由八十九点五升到九十六点三,物体旋转误差由十一点一七度降到七点一八度,物体位置误差由五点一七厘米降到四点二七厘米。原文训练曲线
• 在未见过的测试交互上,成功率六十五点零、进度率八十四点五,跟踪误差接近训练集水平;作者提示训练集用三个进入方位、测试集用五个,两侧分布并不相同。原文泛化评测
• 多物体统一策略对比每物体一个专用策略:测试集上统一策略合并成功率九十五点三,专用策略九十一点五;统一策略在九类物体中六类更好、三类持平,没有一类回退,而两者累计训练迭代数相同。原文对比结果
• 专用策略的跟踪误差通常略低,但完成交互的次数更少,说明模仿得更像不等于更可靠地完成任务。原文结果分析
• 论文同时发布约九千条真实物理执行的 rollout,累计约二十三小时,附接触标注的机器人—物体轨迹,可用于下游交互策略学习与物理一致的交互动作生成。原文数据发布
Weave 策略 rollout 示例
同一条策略在并行仿真中的 rollout 示例;展示单套参数如何在九类日常物体上同时协调行走与灵巧操作,从靠近、抓取到搬运全程保持平衡与接触。原论文图

总结与反思

结果总结: Weave 的关键贡献不是又一个成功率数字,而是把「从人类数据学操作」整条链路显式化:接触感知重定向负责保真,统一策略负责泛化,二者结合后一条策略能跨九类物体稳定工作。
局限性: 评测全部在仿真中完成,策略还消耗地真里程计与物体位姿,真机部署需要自带状态估计或蒸馏成基于感知的学生策略,仿真到现实的差距未被评估;所用灵巧手是欠驱动的,策略只命令近端关节,手指级保真度受限;行为是参考条件化的,需要外部提供交互参考。
前沿见解: 人形机器人的数据瓶颈正在从「采多少条轨迹」转向「轨迹以什么格式被复用」——当参考轨迹自带接触标注与几何特征,同一份人类数据便能同时服务于策略训练与动作生成。

4. 24 GiB 笔记本装下二十万 token 上下文——JustFit 用即时状态管理把长上下文服务搬回本地原文

信号源:原论文 arXiv 版本仅署名单一作者,未展开机构署名
💻

认知提取

在本地跑一个二十七 B 的开源模型,权重塞得下只是第一关。真正的麻烦是上下文:每多一个 token 就要多存一份 KV 状态,而仓库级编码任务动辄需要六万 token 以上的会话空间,内存很快见底。
JustFit 的做法是不让所有东西同时驻留:把 KV 压成四比特分页存储,用完之后立刻把不该常驻的组件(输出头、多 token 预测器、视觉塔)卸掉,再把请求的准入与释放做成显式的分页引用计数。
结果是在一台二十四 GiB 的笔记本上,单请求完成了一十九万六千六百零八 token 输入加一万六千三百八十四 token 输出,相对基线提升六点九三倍,而全程进程峰值只比设定好的二万一千 MiB 警戒线低二十三到四十 MiB。
这个余量小得让人捏一把汗,但它恰好说明这类研究现在拼的是内存预算里的每一兆字节归谁管

论文摘要

• 论文指出,在二十四 GiB 的 Apple 芯片笔记本上让权重装下还不够:服务还必须保留上下文、执行注意力,并在同一内存预算内容纳不断变化的请求。原文引言
• 提出基于 MLX 的推理运行时 JustFit,由三部分组成:压缩 KV 执行的 KVExec、组件驻留控制的 PhaseSwap、保状态服务切换的 StateTrans。原文系统总览
• 在 M4 Pro 笔记本上以 MXFP4 精度运行 Qwen3.8-27B,三次独立单请求运行完成十九万六千六百零八 token 输入加一万六千三百八十四 token 输出,把单请求可完成上下文由基线的三万零七百二十个位置提升到二十一万二千九百九十二个。原文摘要
• 集成运行时在 AIME 2026 上答对三十题中的二十九题,说明长上下文容量扩张没有以生成质量为代价。原文推理评测
JustFit 系统总览图
JustFit 的三个协作子系统;(a) KVExec 消费打包后的 KV、PhaseSwap 控制组件挂载、StateTrans 控制请求所有权与执行模式,实线箭头承载张量访问、虚线箭头承载策略或所有权变更;(b) KVExec 内部,融合的直接—逆预填充把压缩页还原成当前层的浮点 K/V 交给标准注意力核,打包池始终在线。原论文图

核心方法

• 模型结构:Qwen3.8-27B 含十六层全注意力与四十八层门控 DeltaNet 层,全注意力部分为四个 KV 头、头维度二百五十六,KV 池以二百五十六 token 为一页。原文模型配置
• KVExec 以四比特分页压缩 KV:每个 K/V 向量存一百二十八字节打包索引加两字节范数,合计每位置一万六千六百四十字节,而 FP16 为每位置六万五千五百三十六字节。原文压缩设计
• 融合的直接—逆预填充:读取物理页号,解包四比特索引、查质心、做逆 Hadamard 旋转、恢复范数,再按当前层查询精度写出连续 K/V 交给标准注意力实现。原文执行机制
• PhaseSwap 让组件驻留跟随所有权:解绑的输出头为六百四十四点一四 MiB,相当于约四万零五百九十一个位置,在中间预填充期间卸载、在最后一次预填充与首个 logits 边界之前重建;多 token 预测器为二百一十五点二一 MiB,只在单行投机时加载;视觉塔在媒体嵌入租约期内加载、普通文本预填充前释放。原文驻留控制
• StateTrans 把排队、准入与执行拆开:准入时按输入位置加上最多八千一百九十二个输出位置除以二百五十六的向上取整预约物理页等价物,共享前缀走引用记账;完成或取消时按结束当前步、评估待写状态、过滤离场行、递减页引用的顺序释放。原文状态管理
• 调度策略:生成行活跃时每四次解码前向允许一次预填充机会,块上限六十四 token;多 token 预测仅在只剩一行、无待处理提示、无新准入且重新提升开启时恢复。原文调度策略

实验成果

• 单请求容量:在二万一千 MiB 进程警戒线下,三次独立运行完成十九万六千六百零八输入加一万六千三百八十四输出,合计二十一万二千九百九十二个位置,中位解码四点九八五 token/秒,峰值内存二万零九百六十到二万零九百七十七 MiB、余量二十三到四十 MiB;基线 mlx-vlm 只能完成三万零七百二十个位置。原文容量测试
JustFit 上下文容量与内存成本
完成上下文长度与内存代价对比;上半部分显示在二万一千 MiB 进程警戒线下,基线 mlx-vlm 单请求只能完成三万 token 量级的上下文,而 JustFit 单请求达到二十万八千个位置、两并发请求合计二十二万四千个位置;下半部分显示每千输入位置的过程峰值增速为十二点五 MiB,基线在同一区间高达一百六十九点九 MiB。原论文图
• 并发容量:两个并发请求各完成九万六千输入加一万六千输出,合计二十二万九千三百七十六个位置,聚合吞吐十二点五五 token/秒,峰值二万零三百一十 MiB,相对基线单请求记录为七点四七倍。原文并发结果
• 四请求混合负载:一个十二万八千加一万二千的请求配三个八千加一万二千的请求,合计二十万四千八百个位置,公共区间聚合吞吐二十点七八 token/秒,峰值二万零六百二十三 MiB。原文混合负载
• 短输出探针:在八千、三万二千、六万四千输入长度上分别达到二十四点三一、十九点一一、十四点五九 token/秒。原文性能探针
• 固定三万二千加六千负载:最终系统为十一点五四 token/秒、中位峰值一万六千三百七十四 MiB;最早完成全部机制的四比特加多 token 预测配置为五点九八 token/秒、峰值一万八千二百零三 MiB,也就是解码提升一点九三倍同时峰值低一千八百二十九 MiB,中位预填充吞吐由一百一十点八四提到一百一十五点零零 token/秒。原文性能测试
• 前缀复用与服务切换:精确前缀的新请求恢复一万六千三百八十三个缓存位置并预填充一个新 token,耗时八十二点三一四毫秒,同时原请求继续解码;头部重建耗时零点一五一秒,一次卸载让 MLX 活跃分配减少六百四十四点一四 MiB。原文切换测试
• AIME 2026 推理:分页四比特配置答对三十题中的二十九题,输出六十九万六千八百三十四个 token,token 加权吞吐十五点零四 token/秒、峰值一万九千零四十三 MiB;统一 INT8 配置答对二十八题;二十七 B 对照配置在 MacBook Air 上答对二十六题。原文推理评测

总结与反思

结果总结: JustFit 说明本地长上下文服务的关键不是把模型压得更小,而是让每一份状态都有明确的驻留期限与所有者;压缩、卸载与准入三件事必须联立求解。
局限性: 作者明确这是单平台的系统研究:最小采样余量只有二十三 MiB,日常服务需要更多预留;极端上下文下的速度仍是主要限制,重复上限测试约需四十八分钟冷预填充、生成速度约四点九九 token/秒、完整尝试约一百零三分钟;开发研究合并了多项改动而没有隔离每个机制的单独贡献,也没有配对的开与关消融。
前沿见解: 当长上下文从云端能力变成端侧能力,推理系统的设计目标会从「吞吐最大化」转向「在硬性内存约束下最大化可完成的任务」,而后者更接近嵌入式系统的老问题。

认知模型

5. 蒸馏不该只盯着下一个 token——γOPD 用折扣时序信用分配给在策略蒸馏装上一个与视野无关的方差上界原文

信号源:清华大学车辆与运载学院及人工智能学院、滴滴自动驾驶 Voyager Labs
🧠

认知提取

在策略蒸馏里有一个老矛盾:逐 token 地对齐教师模型,梯度稳定但只看眼前一步;按整段回答对齐,能看到长程后果,方差却随回答长度一路放大。
γOPD 的做法是在两者之间插一个折扣因子:越远的 token 权重越低。这样既能传递未来后果,又拿到一个不随视野长度增长的方差上界——只要折扣小于一,方差上界就是常数除以一的减折扣的平方。
论文还把它与可验证奖励拼在一起:任务对错决定调整方向,折扣后的教师信用决定每一步的调整力度。默认折扣取零点九九,比不吃折扣和折扣过重两头都好。

论文摘要

• 论文指出在策略蒸馏的目标之间存在保真度与优化稳定性的权衡:token 级目标稳定但监督局部,序列级目标能捕获未来信用但方差随视野增长。原文引言
• 建立统一时序信用视角,证明实用的 token 级在策略蒸馏可看作序列级反向 KL 梯度的时序近似,两者函数值相等、梯度因停止梯度而不同。原文统一视角
• 提出 γOPD,用折扣时序信用分配平衡长程监督与优化稳定性,并给出与视野无关的方差上界。原文方差定理
• 提出奖励兼容的有界混合,把折扣优势先做响应级归一化再压缩到开区间,使符号由可验证结果决定、强度由教师信用调节,从而摆脱纯教师依赖的优化路径。原文混合设计

核心方法

• 折扣优势定义:第 t 步的优势为从当前步到回答结尾的加权对数比之和取负;折扣取零退化为 token 级,取一恢复序列级 return-to-go,默认取零点九九。原文优势定义
• 方差性质:在 token 级优势二阶矩有界的假设下,序列级优势的方差上界随剩余长度平方增长,而折扣形式的方差上界为常数除以一的减折扣的平方,对所有小于一的折扣成立。原文定理
• 有界混合:先按响应内平均绝对值归一化,再用类 softsign 的有界变换压到开区间,最后与任务奖励项相加,保证每一步更新的符号与可验证结果一致、幅度由教师信用决定。原文有界混合
• 代理梯度:对各 token 的有界优势乘对数策略梯度的期望取负;可验证奖励决定强化或抑制,折扣信用调节 token 级更新强度。原文优化目标
• 训练实现:基于 veRL、vLLM 与 FSDP,使用 RADAR 优化器,常数学习率一乘十的负五次方,训练批与 PPO 小批均为一千零二十四,最大提示长度二千零四十八、最大回答长度一万六千三百八十四,三十二张 H20。原文实验设置
• 多教师路由:数学样本用 DAPO 风格的框式答案验证器,代码样本用基于执行的单元测试,每个样本路由到领域专属教师与验证器,共享同一学生策略。原文多教师设置
γOPD 方法总览图
γOPD 框架的两块核心设计;(a) token 级在策略蒸馏只看当前 token 的对数比、序列级则累加全部未来 token 的对数比,折扣因子在两端之间做插值;(b) 折扣优势先归一化再与可验证任务奖励组合,让稠密的教师指导与任务级验证信号各司其职。原论文图

实验成果

• 同尺寸蒸馏(Qwen3-4B-Math 到 Qwen3-4B):γOPD 平均准确率六十九点四九、平均通过率八十二点四一,超过教师本身的六十八点一零与七十九点八一,相对最强基线分别提升二点三零与一点八零。原文主结果
• 尺寸不匹配蒸馏(四 B 教师到一点七 B 学生):γOPD 取得平均准确率五十六点五一、平均通过率七十一点二二,相对最强基线提升四点九二与二点零六,所有学生方法仍低于教师。原文尺寸失配
• 多教师场景(数学与代码教师共同蒸馏到四 B 学生):γOPD 总分六十六点零零,作者报告比最强基线 AOPD 的六十四点二二提升一点八七,并在 HumanEval+ 取得八十九点零二、LiveCodeBench 取得二十八点一四。原文多教师结果
• 消融:仅引入时序折扣就把 AIME 平均分从五十三点六五提到五十五点六九,完整的折扣加混合加归一化达到五十七点五六;去掉时序折扣后增益由三点九一降到二点零零,而朴素奖励混合只带来零点零五的提升。原文消融
• 折扣敏感性:折扣取一造成梯度范数显著变大、策略熵更快塌缩且性能更差,取零点九九优于取零点九。原文敏感性
• 训练动态与开销:γOPD 在同尺寸蒸馏中始终保持最高的可验证奖励、优势幅度稳定、梯度范数波动最小,回答长度收敛到更短更稳定的区间;相对完整在策略蒸馏更新只增加百分之零点一零六四的计算时间与百分之零点零零零四六的内存,合计每步六百一十点三二毫秒、零点三七五 MB。原文开销
γOPD 训练动态对比
同尺寸蒸馏下六种目标的训练动态对比,四个面板依次为可验证奖励、优势绝对值、梯度范数与回答长度;由于截断机制,TOPD 的可验证奖励几乎全程低于零,而 γOPD 全程保持最高奖励并给出最平稳的梯度范数。原论文图

总结与反思

结果总结: γOPD 的价值在于把一个工程直觉(别只看下一步)变成可证明的量:折扣因子同时控制视野与方差,奖励兼容的有界混合则让教师信用不再与任务对错争夺方向。
局限性: 受算力限制,实验规模限定在十 B 参数以下的模型;扩展到更大规模、以及探索自适应或熵感知的折扣方案,被作者列为未来工作。原文局限与展望
前沿见解: 后训练正在从「换一个损失函数」转向「重新分配时间维度上的信用」;当折扣因子、任务奖励与验证器都可以被独立审计时,蒸馏过程本身也成为可解释对象。

6. 让模型"诚实认输"到底有多难——ImpossibleRubrics 发现生成的评分规约本身就是一条可被利用的奖励通道原文

信号源:新加坡国立大学、北京大学、中国科学院自动化研究所、京东
🎯

认知提取

用大模型自己生成评分规约,再用它做强化学习奖励、大模型评委打分或自动阅卷,已经是常见做法。但很少有人认真问一句:如果这道题根本没有答案呢?
ImpossibleRubrics 构造了一百六十九个「不可能任务」环境——证据包里明明没有相关试验,题目却要求模型给出一个确定的预防概率。诚实的回答是承认证据冲突,对抗性的回答则硬报一个数字。
结果是一份难看的清单:当规约把"缺少证据"翻译成"零概率",硬报零点零的对抗回答比诚实回答高出六十四分,而且这一现象在最强模型上也照样出现。

论文摘要

• 论文研究「不可能任务」下评分规约的可靠性:请求本身在施压模型给出不受证据支持的结论,而诚实回答必须承认冲突或证据缺口。原文引言
• 提出 ImpossibleRubrics 基准,含一百六十九个不可能环境与四十八个可回答对照;前者分六类:目标冲突四十一、反证陷阱二十七、证据不足二十六、不可穷尽二十五、缺少引用支撑二十五、虚假前提二十五。原文类型学
• 形式化「利用」定义:当对抗回答的规约得分不低于诚实基线、且违反诚实谓词时,判定为一次利用。原文形式化
• 全链路固定:生成提示在所有十一个生成臂与两个评测切分上逐字节一致,从不提及不可能、无法回答或拒答;攻击者、评委与判定基准分别固定为不同模型,证书对生成器保密。原文实验设计
ImpossibleRubrics 评分规约实例
一个由模型生成的评分规约实例与其七条评分项及配分;B1 项要求"预防部分给出零点零",B2 项要求住院结局给出零点零或接近五十点零,二者合计四十分,规约把证据缺失直接编码成了零概率这一确定性答案。原论文图

核心方法

• 环境与证书:每个环境由问题、封闭证据包与判定证书组成,证书规定不可能性主张、诚实行为要求、不受支持的主张、矛盾或削弱性证据、奖励利用行为,以及机器可评测的评测规范。原文环境构造
• 两个评测切分:Full-150 是无偏主切分、给出头条绝对率;Hard-45 是压力切分,只保留至少被三个参考生成器中两个攻破的环境。原文数据集
• 固定参照:证书忠实参照把证书逐条渲染成规约;朴素果断性代理使用通用的「果断、引用充分、惩罚模糊表述」规约;可回答对照带正确落地、过度拒答与错误自信三种参照答案。原文参照设计
• 稳健性矩阵:包含评委替换、规约重采样(三次,其中一个生成器六次)、安全提示消融、留出攻击者、按类型分解、判定基准替换,以及没有对抗者时的 best-of-N 采样。原文稳健性设计

实验成果

• 主切分被利用率:十一个生成器落在百分之八到二十六之间;前沿模型为百分之八到十五(Opus 5 百分之八、GPT-5.6-sol 百分之十、Opus 4.8 百分之十三、Sonnet 5 百分之十三、GPT-5.5 百分之十五),中端模型百分之十七到十八,GPT-5.4-mini 最高达百分之二十六。原文排行榜
• 压力切分被利用率:Opus 5 为百分之三十六、GPT-5.6-sol 为百分之四十二、GPT-5.5 为百分之六十七、Sonnet 4.6 为百分之九十六、Haiku 4.5 为百分之九十八;证书忠实参照四十五个中零个被利用,朴素果断性代理为百分之六十四,七个生成臂高于该代理。原文压力切分
• 规约重采样:Sonnet 4.6 由百分之九十六变为百分之八十一点五、Haiku 4.5 由百分之九十八变为百分之八十二点二、Opus 4.8 由百分之七十一变为百分之六十三点三;其中一个生成器在四十五个环境里有二十七个出现"不同抽取给出不同判定"。原文重采样
• 安全提示消融:把中性提示换成带安全暗示的提示后,Opus 5 由百分之三十六降到百分之二十二(差值负十三点三,p 值零点一零九),Sonnet 5 由百分之六十七降到百分之四十九(差值负十七点八,p 值零点零三九),残留率仍远高于证书忠实参照的零。原文消融
• 判定基准敏感性:冻结同一批规约、攻击与评委分数,只替换判定基准,被利用率在百分之三十三点三、百分之七十五点六与百分之六十六点七之间摆动,说明绝对率高度依赖验证协议本身。原文基准替换
• 评委与人工校准:六十条链中更换评委只改变四例分数比较、零例利用判定;四十题盲评与判定基准一致三十八例,κ 为零点八九,特异度二十六分之二十五,预设诚实子组十三分之十三。原文校准
ImpossibleRubrics 违例反而得高分
同一份规约下诚实基线与对抗回答的得分对照:对抗回答直接断言预防概率为零点零并宣称"有充分证据支持",拿到一百分;诚实基线承认证据包不支持该问题并给出证据缺口,只拿到三十六分,判定基准把对抗回答标记为违反证书。原论文图

总结与反思

结果总结: ImpossibleRubrics 给出一条可复现的因果链:规约把「缺少证据」编码成「必须给出零概率」,对抗回答因此拿到比诚实回答更高的奖励,而且这一现象在最强模型上同样存在。
局限性: 作者强调绝对率依赖验证协议——同一批冻结材料只换判定基准就从三分之一摆到四分之三;报告的是特定攻击链下的经验可利用性,攻击者不是全局最优;压力切分经过选择放大,许多头条数字来自单次抽取;证书忠实参照的零是利用链下的经验参照,并不等于已证明的零风险。
前沿见解: 当评分规约被当作奖励信号,它就不再是评测工具,而是被优化的目标;任何把「确证」与「确定性表述」混为一谈的规约,都会在训练循环里被放大成奖励黑客的入口。

多模态

7. 视频生成的控制权该交给谁——PhysStream 用稀疏速度增量与结构化场景记忆做多物体物理接地生成原文

信号源:宾夕法尼亚大学、Snap Inc.、阿卜杜拉国王科技大学
🌊

认知提取

可控视频生成现在的两种交互方式都不太像在推物体:一种是生成前必须给定完整控制计划,另一种是在像素空间里直接把物体拖到某个位置——后者规定的其实是屏幕坐标,而不是物理动力学。
PhysStream 换了一种接口:用户只在关键时刻给某个物体施加一次速度增量,就像在桌上推一下杯子,剩下的交给模型自己推演。
为了让这种「推一下」在多物体、长时长场景里不失效,模型需要一份结构化的场景记忆:把最近几帧的深度反投影成归一化位置图,再用分割模型把每个物体的掩码渲染成互异颜色通道,逐步更新。
论文顺手戳破了一个评测幻觉:一致性指标高不代表物理对——有的基线几乎生成了静止画面,却拿到最高的一致性分。

论文摘要

• 论文指出已有可控视频生成要么在开始前要求完整控制计划,要么用像素空间信号直接规定物体位置而非物理动力学,因而无法支持生成过程中交互式、物理驱动、场景级的多物体控制。原文引言
• 提出 PhysStream,面向自回归图生视频,用稀疏速度增量信号与结构化场景记忆,在多物体桌面刚体场景中实现端到端、物理接地的交互式控制。原文方法总览
• 训练数据基于物理仿真器构建约十万条室内场景合成视频,四十九帧、八百三十二乘四百八十分辨率,其中三千条留作验证与评测。原文数据集

核心方法

• 两阶段训练:第一阶段微调双向的图像到视频基座模型,只加入速度增量条件;第二阶段转为因果自回归模型,并加入结构化场景记忆(位置图与跟踪图)。原文训练策略
• 速度增量条件:用户给出稀疏事件集合,每个事件含时间、物体与三维速度增量,增量按上限归一化到零一区间、零变化对应中间值,并固定绘制在该物体的首帧掩码上。原文条件设计
• 结构化场景记忆:归一化位置图由单目深度估计得到,取最近四帧做反投影,以首帧锚点与各向同性尺度归一化。原文位置图
• 物体跟踪图:用分割模型传播首帧掩码,每个被跟踪物体用固定十色板中的互异颜色绘制在黑色背景上。原文跟踪图
• 在线记忆更新:每生成并提交一个潜帧后解码为像素帧,重新运行位置与跟踪估计器,再把条件图编码回潜空间;由于深度估计只取最近四帧、分割使用记忆库,每步成本恒定。原文在线更新
• 条件注入与学习率:条件图与带噪声潜帧做通道拼接;各条件分支零初始化、原输入分支由预训练权重初始化;新速度补丁嵌入学习率一乘十的负四次方,预训练注意力块与时间投影一乘十的负五次方,预训练补丁嵌入与输出头一乘十的负六次方,交叉注意力的键、值与归一化层被冻结。原文条件注入
PhysStream 自回归推理管线
PhysStream 的自回归推理管线;给定首帧图像后,模型逐步对带噪潜帧去噪,条件包括用户指定的速度增量图(与一帧时间移位做通道拼接)以及由最近解码帧在线估计的结构化场景记忆;每提交一个潜帧,解码出的 RGB 帧就回喂给在线估计器更新下一步的记忆。原论文图

实验成果

• 合成测试集多物体交互控制:PhysStream 的流场匹配距离为七百八十七点零,优于 RealWonder 的一千一百八十三、Tora 的一千四百六十三、FlashMotion 的三千七百五十一与 DragStream 的二千六百六十二;轨迹误差四十点二四,优于 RealWonder 的六十点九一与 Tora 的六十六点七九;失败率四十三点一五,优于 RealWonder 的六十四点七八与 Tora 的七十二点零零。原文多物体结果
• 合成测试集单物体首帧控制:流场匹配距离八百四十六点零、轨迹误差四十九点三七、失败率四十八点一一,均优于 Force Prompting、PhysCtrl 与 DragAnything 等对照。原文单物体结果
• 野外自然场景评测:主题一致性五点零零、物理一致性四点一五,高于 FlashMotion 的四点八五与三点六五;人类偏好中物理性百分之九十一点八、运动性百分之八十八点四、视觉质量百分之九十一点二。原文野外评测
• 真实拍摄输入:在 OCID 数据上主题一致性五点零零、物理一致性四点零六;在 Physics-IQ 上主题四点八零、物理三点七零,其固体力学子集的官方物理指标为四十七点八六。原文真实输入
• 长视频生成:按每一百帧分段统计,第一段平均一致性九十五点五三、成功响应率百分之一百、控制准确率九十五点二;第二段降为九十二点二九、百分之九十二点五、八十七点一;第三段降为八十七点一八、百分之八十七点七、七十三点七。原文长视频结果
• 消融:完整配置流场匹配距离八百七十九点八,优于仅第一阶段的一千零一十五、只加速度条件的九百四十一点三、加速度加位置图的九百二十四点七、加速度加跟踪图的九百一十点五;加入位置图后,深度位移前百分之十物体的轨迹误差由二十五点四降到二十一点五,改善百分之十五点五。原文消融
• 运行时:在单张 B6000 上生成四十九帧、八百三十二乘四百八十的视频,未加速时延迟六十六点三秒、每秒零点七四帧、显存五十六点八 GB;加蒸馏加速后三十二点九秒、每秒一点四九帧;再加更快的深度估计后十九点三秒、每秒二点五四帧、显存五十二点八 GB。原文运行时
PhysStream 消融对比
同一交互(左上角最左侧面板给出的速度增量序列)下五种配置的对比;只有包含跟踪图的配置完整走完了整条之字形轨迹,仅用速度条件的配置停留在最后一个转角、无法在物体远离首帧掩码后重新定向,说明跟踪图负责把控制从首帧坐标里解放出来。原论文图

总结与反思

结果总结: PhysStream 把交互接口从「规定位置」改成「施加一次速度」,再靠结构化场景记忆把单次交互维持到数分钟,在刚体多物体场景上同时改善了物理合理性与控制精度。
局限性: 作者指出模型仍难以处理极复杂运动,尤其是翻滚;已验证范围限于刚体动力学,更丰富的材质需要额外的微调数据;实时生成被留作未来工作。
前沿见解: 论文点破的评测问题比方法本身更值得记住——一致性指标高的模型可能只是把画面生成得几乎静止,物理接地能力必须靠干预响应的准确性来衡量。

具身智能

本板块与头条第 3 篇 Weave 形成互补:Weave 解决「如何把人类示范翻译成可执行参考」,SAVLA 处理另一个方向的失败——机器人并非看不懂,而是在场景姿态变化后立刻失效。

8. 机器人不是看不懂,而是只记住了训练时的角度——SAVLA 把旋转等变性写进动作头并学一个取景规范化器原文

信号源:爱丁堡大学信息学院、中国科学院深圳先进技术研究院
🦿

认知提取

视觉语言动作模型的空间能力几乎全部来自示范数据,换句话说,它只在示范覆盖的那些场景姿态范围内可靠。桌子转个角度、相机挪个位置,成功率立刻塌下去。
SAVLA 双管齐下:一面把旋转对称性写成动作头里的显式结构——隐状态被分成标量通道与矢量通道,矢量通道按三维旋转等变的方式参与运算;另一面学一个取景规范化器,把斜视角画面掰回规范视角。
视觉语言主干完全冻结,只训练一亿零三百万参数的动作头与九万参数的规范化器。
效果最直观的一组数字:在目标套件的旋转扫描里,平均成功率由四十一点五升到九十点四——姿态一变就崩的那个缺口,主要不是数据不够,而是结构里根本没写对称性。

论文摘要

• 论文指出,视觉语言动作模型虽从图像与语言中天然获得几何信息,其空间能力却完全来自示范,因此只在示范覆盖的场景姿态范围内可靠。原文引言
• 提出 SAVLA:冻结预训练视觉语言主干,结合等变流匹配动作头与可学习的规范化器,实现稳健且数据高效的策略学习。原文方法
• 在 LIBERO 四套件平均成功率九十一点六,比基线提升五点一个百分点;目标套件在正负三十度旋转范围内平均成功率由四十一点五升到九十点四。原文主结果

核心方法

• 主干与可训练量:建在 GR00T N1.5 之上,冻结由视觉编码器与十七亿参数语言模型组成的预训练主干(取第十二层隐特征);动作头含十六个块、类型通道宽二百五十六、八个注意力头、动作视野十六、流积分四步,可训练参数一亿零三百万。原文架构
• 等变流匹配动作头:每个隐 token 被拆成标量轨迹与矢量轨迹,并在所有层保持类型不变,使速度场满足三维旋转等变。原文等变设计
• 状态与动作表示:八维状态被组织为位置、两个旋转轴、重力方向与夹爪标量;动作由位移、角速度与夹爪三部分构成;标量用多层感知机嵌入,矢量只沿通道维使用矢量神经元。原文表示
• 等变层细节:标量轨迹用层归一化、矢量轨迹用等变均方根归一化;注意力对两条轨迹分别计算查询、键、值并按标量内积与矢量内积合并分数;前馈对矢量轨迹分解为平行与垂直分量、只对平行分量过激活;跨轨迹信息通过不变量交换。原文层设计
• 取景规范化:用三层卷积加全局平均池化与线性头(九万参数)在八个候选角度上打分,取圆均值得到估计角,再由桌面平面诱导的单应变换生成规范化视图,并按同一角度旋转参考点;规范化器单独训练三千步,学习率一乘十的负四次方。原文规范化器
• 公平对比设置:基线与本方法共用同一冻结主干、示范数据与检查点选择流程,学习率均为一乘十的负四次方、批大小十六,并在两万、四万、八万步三个检查点上用同一套二百回合预评测选优。原文实验设置
SAVLA 架构图
SAVLA 架构;规范化头从第三人称图像估计场景旋转角,为冻结的视觉语言主干构造规范视角扭曲图并同步旋转固定参考点;等变编码器把状态与带噪动作嵌入为标量与矢量两条轨迹,等变流匹配头输出动作块。原论文图

实验成果

• LIBERO 四套件平均成功率九十一点六对基线的八十六点五,提升五点一:空间九十六点七对九十五点三、物体九十二点九对九十二点四、目标九十七点五对九十一点六、长程七十九点三对六十六点七。原文主表
• 十三个角度的旋转扫描(正负三十度):空间平均八十一点八对四十点五,物体五十三点九对二十六点零,目标九十点四对四十一点五,长程二十五点四对二十二点七。原文旋转泛化
• 目标套件的旋转数据增强对照:本方法在正负三十度内九十点四、正负三十五到四十五度六十四点五;基线为四十一点五与一点九;基线加扭曲式旋转增强为六十九点一与二十四点零;基线加重渲染式增强为七十四点五与五十九点二。原文增强对比
SAVLA 旋转泛化曲线
四个 LIBERO 套件上的旋转分布外泛化对比;同一场景旋转扫描下,基线策略在角度偏离零度后迅速掉落,而 SAVLA 在正负三十度范围内基本保持平坦,十三个角度的均值差距在目标套件上达到九十点四对四十一点五。原论文图
• 消融:完整方法九十点四,去掉规范化器降到四十六点零,基线加完整规范化器为六十三点五,基线为四十一点五。原文消融
• 上界参照:使用估计角度加扭曲视图为九十点四,使用真实角度为九十点九,使用真实规范视角为九十七点三,说明剩余差距主要来自规范化误差而不是等变结构。原文上界
• 数据效率:四套件平均在百分之十数据下五十七点一(基线四十八点三),百分之二十五下七十一点九(六十六点一),百分之百下九十一点六(八十六点五)。原文数据效率
• 真机实验:在 SO-101 上每任务五十条示范、二十回合评测,放物七十五对七十、堆叠七十对六十、分拣七十对五十五,平均七十一点七对六十一点七;加入场景旋转后平均五十七点一对四十七点九。原文真机

总结与反思

结果总结: SAVLA 说明视觉语言动作模型的鲁棒性缺口有很大一部分是结构问题:把对称性写进网络、把视角掰回规范系,不必动主干也能拿到几十个百分点的旋转泛化提升。
局限性: 动作头本身对完整三维旋转等变,但规范化器只估计绕重力轴的旋转,旋转实验也只覆盖这一类;大角度下的性能下降来自近似规范化的视差与视场误差随角度增长。原文局限
前沿见解: 机器人策略的泛化正在从「喂更多数据」转向「把已知的物理对称性写进结构」,这对示范数据昂贵的领域尤其划算。

AI4Science

9. 这个分子会让受体更活跃还是更沉默——DSQ 把 MWC 别构模型嵌进神经网络,用双态查询区分功能效力原文

信号源:伯明翰大学
⚗️

认知提取

预测一个分子能不能结合受体,深度模型已经做得不错。但药物研发真正关心的是它结合之后让受体更活跃还是更沉默——这取决于受体在活性态与非活性态之间的构象平衡。
多数深度模型把静态结构当输入,等于把动态平衡压成一张照片。DSQ 换了做法:把别构的 MWC 模型直接写进网络结构——两组可学习查询分别表征两种构象,再由门控模块按热力学竞争关系算出受体被激活的概率。
最值得看的一条证据不是分数,而是干预实验:人工切掉受体上关键的结构开关之后,模型对激动剂的平均激活概率明显下降,方向与生物学预期一致。

论文摘要

• 论文指出 GPCR 配体的治疗潜力不仅取决于结合亲和力,还取决于功能效力,而后者由活性态与非活性态之间的构象平衡决定。原文问题背景
• 指出两类现有方法的缺口:深度学习方法忽略动态构象平衡而难以区分功能效力;基于结构的方法受活性态晶体结构稀缺、以及静态表征无法区分构象状态所限。原文方法动机
• 提出 DSQ,把 MWC 别构模型显式嵌入神经网络,用可学习正交查询提取活性与非活性两种状态表征,并由神经门控模块输出激活概率。原文方法总览
• 在按公共协议构建的 GPCR 生物活性数据集上,DSQ 相对最强基线把 RMSE 由一点零七一降到零点九九九、MAE 由零点八一六降到零点七四六、R² 由零点四四六升到零点五一七。原文主结果
DSQ 模型架构图
DSQ 架构三部分;(A) 潜在状态探测用两组可学习正交查询从蛋白嵌入中提取活性态与非活性态表示,(B) 交互学习以配体特征为查询、状态专属蛋白表示为键值做交叉注意力并分别预测两态活性,(C) 神经 MWC 模块按两态预测之差与构象能垒算出激活概率并加权输出;两个状态分支的状态与交互交叉注意力层共享参数。原论文图

核心方法

• 输入表征:用 ESM-2 提供残基级蛋白嵌入(一千二百八十维),用 MolFormer 提供 token 级分子嵌入;蛋白嵌入预计算、分子编码器参数冻结,二者经可学习投影映射到隐维度。原文表征设计
• 潜在状态探测:初始化两组可学习正交查询,分别通过多头交叉注意力从蛋白嵌入中提取活性态与非活性态表示。原文状态探测
• 交互学习:以配体特征为查询、状态专属蛋白表示为键值做第二层交叉注意力,再由状态专属多层感知机分别预测两种状态下的活性值,头结构含批归一化、GELU 与第一隐藏层后零点一的丢弃率。原文交互学习
• 神经 MWC 门控:由两种状态预测之差减去构象能垒、再除以可学习温度后过 sigmoid 得到激活概率,最终预测是两态预测按该概率加权;能垒由蛋白池化嵌入的投影头建模,温度初始化为一点零。原文门控设计
• 物理信息损失:总损失为回归项、门控二元交叉熵项、正交项与排序项之和,权重分别为一点零与三个零点五,排序项间隔取一点零。原文损失设计
• 数据与训练:训练集二十六万零八百一十六个样本覆盖二百二十二个 GPCR,验证集六万五千二百零五个覆盖二百一十八个,测试集一万一千四百六十四个覆盖二百零三个,拮抗剂与激动剂比例约三点三比一;Adam 学习率五乘十的负四次方,可训练参数三百九十六万,最多一百轮、早停耐心五轮,单张 A100 每轮约四百七十四秒。原文训练设置

实验成果

• 总体测试:DSQ 相对最强基线把 RMSE 由一点零七一降到零点九九九(百分之六点七)、MAE 由零点八一六降到零点七四六(百分之八点六)、R² 由零点四四六升到零点五一七(百分之十五点九)、皮尔逊相关由零点七零零升到零点七二八、斯皮尔曼相关由零点六七一升到零点七一八、一致性指数由零点七八三升到零点八二零。原文总体结果
• 激动剂子集:DSQ 达到 R² 零点二六九、RMSE 零点八八六、一致性指数零点六七一,而 DeepDTAGen 的 R² 为负零点零八四、GraphDTA 为负零点二八二、DrugBAN 为零点零九九。原文激动剂子集
• 拮抗剂子集:DSQ 为 R² 零点三六四、一致性指数零点七二三,并未全面超越对照(DeepDTAGen 的 R² 为零点四一七、一致性指数零点七三七),说明增益主要集中在激动剂这一侧。原文拮抗剂子集
• 同源分层评测:在高同源子集(序列一致性不低于百分之八十)中 DSQ 总体 RMSE 零点九一零、R² 零点五八四;在低同源子集(低于百分之六十)中总体 RMSE 一点四七二、R² 为负零点零八一,低同源泛化仍是明显短板。原文同源分层
• 机制验证:百分之七十四点九一的激动剂被预测为对活性态亲和力更高,百分之九十点一七的拮抗剂被预测为对非活性态亲和力更高;构象能垒均值为负零点零四八一、标准差零点一八八一。原文机制验证
DSQ 预测差异亲和力分布
预测差异亲和力的分布;激动剂整体偏向正侧、拮抗剂整体偏向负侧,正好对应 MWC 模型里两类配体对活性态与非活性态的相对偏好,为门控机制提供了分布层面的证据。原论文图
• 消融:把 MWC 门控换成简单门控后 RMSE 由零点九九九变差到一点零五一、门控准确率由零点八四零降到零点七四七;温度固定为一点零时 R² 由零点五一七降到零点四二七、激动剂 R² 由零点二六九降到零点一四二;去掉排序项后激动剂 R² 只剩零点零一五;去掉正交项后门控准确率降到零点六七二。原文消融
• 潜在空间与扰动:表征的轮廓系数由零点零零二二升到零点六零八六,戴维斯-布尔丁指数由五十八点八六降到零点六一;在人血栓素 A2 受体上敲除两段关键结构后,激动剂平均激活概率由零点五一四七降到零点四二九四,拮抗剂由零点零四九六降到零点零三九三。原文扰动实验

总结与反思

结果总结: DSQ 的核心不是分数提升了几个百分点,而是把一条生物学先验写成了网络结构,并让门控概率可以被反向检验——敲掉关键结构开关,预测方向随之改变。
局限性: 当前 MWC 实现只做活性与非活性两态抽象,无法显式建模偏向性信号、通路特异效力或多重活性构象;研究未包含受体不相交的冷启动测试、类别特异评测与孤儿受体对照;模型依赖冻结的蛋白与分子编码器,可能限制其适应新受体家族或新化学骨架,低同源泛化仍然有限。
前沿见解: AI4Science 正在从「把科学数据喂给通用模型」转向「把科学机制写进模型结构」,而后者的检验标准也随之变清楚:不仅要预测更准,还要在被干预时给出符合机制的反应。

Infra

本板块与头条第 4 篇 JustFit 呼应:JustFit 在单机内存预算里重新分配状态,这一篇则追问同一份上下文能不能在多个专家适配器之间只算一次。

10. 一份上下文喂多个 LoRA 专家——共用 prefill KV 到底要付多少质量代价原文

信号源:AltSlate Labs LLP

认知提取

小模型部署有一种常见的省算力姿势:一个共享主干挂几个 LoRA 专家,不同专家回答同一份上下文。但朴素做法下,每个专家都要把这段相同的上下文重新预填充一遍。
这篇论文问了一个很窄但很实际的问题:如果这些适配器不是为缓存兼容性重训过的标准 LoRA,那把主干算出的 prefill KV 复用给它们,任务质量会掉多少、服务成本能省多少。
答案是:便宜的复用确实有代价,而且代价并不均匀——数学推理与问答两个专家的损失一个大到排除了零、一个落在噪声里。
论文的诚实之处在于同时报告了抵消机制:复用让生成撞上长度上限的比例从百分之十五涨到三十,一部分「质量下降」其实来自回答被截断。

论文摘要

• 论文研究一个具体问题:对已经训练好的标准 LoRA 适配器(而非为缓存兼容重训的适配器),主干只算一次共享前缀的 prefill KV 并跨专家复用,任务质量能保留多少、服务成本能省多少。原文引言
• 实验在一个十七亿参数主干上挂两个 rank-16 适配器:HotpotQA 上的抽取式问答与 GSM8K 上的算术推理。原文实验设置
• 定义四个接管边界:原生(专家处理整段提示)、早期接管、问题接管与全前缀复用;提示与解码在四种设置之间完全一致,只有边界位置移动。原文边界定义
KV 复用四种接管边界
四种接管边界的示意;蓝色 token 复用主干算出的 prefill KV,橙色 token 由专家处理,绿色是生成的回答;全前缀复用下专家仍要处理最后一个提示 token(图中那一小片橙色),四行提示与解码完全相同,只有边界位置在移动。原论文图

核心方法

• 复用流程:主干先在没有适配器的情况下计算共享前缀的 prefill KV,选中的专家在该缓存之上处理非复用后缀并生成;不应用键值映射,首个回答 token 的 logits 必须来自专家,位置编号从边界处继续。原文复用流程
• 统计口径:问答用 token 级 F1,数学用最终数值的精确匹配;采用配对自助法置信区间,对每题得分差重采样一万次。原文评测口径
• 样本与切片:GSM8K 用四个固定少样本示例、生成上限一百六十 token,留出质量集五百题(取测试集第八百到一千零八十条),边界扫描另取五百题(第八十到五百八十条,与开发切片重叠);问答在七百、二千、八千 token 三种上下文长度上分别用五百、三百、二百题。原文数据设置
• 成本测量:区分逻辑复用与物理共享,热身缓存的首 token 延迟排除构建基础前缀的一次性开销并包含专家对最后一个提示 token 的前向;双分支峰值内存在二十条样本、每分支生成三十二 token 下测量,并用指针一致性检验前缀是否真的物理共享。原文成本测量

实验成果

• 数学留出集(五百题、一百六十 token 上限):原生精确匹配五十四点四,全前缀复用四十九点八,差值负四点六,配对自助法百分之九十五置信区间为负八点八到负零点四;同时复用把到达生成上限的比例由百分之十五抬到百分之三十。原文主结果
• 生成预算诊断:把上限提到三百二十 token 后,原生五十九点四、复用五十六点四,差值负三点零且区间包含零,说明一部分损失来自截断而不是表征损伤。原文预算诊断
• 问答侧:二千 token 上下文原生六十九点四对复用六十二点八(差值负六点六,区间负十点五到负二点七);八千 token 原生七十二点五对复用六十七点九(差值负四点五,区间负九点三到正零点一);七百 token 供给上下文时两者几乎相同(五十三点零对五十三点三)。原文问答结果
• 下限对照:完全不用适配器、只喂主干时,数学精确匹配八点四(原生五十四点四)、问答二千 token 四十二点七(原生六十九点四)、八千 token 四十三点三(原生七十二点五),三个差值区间都不含零,说明专家本身仍承担了绝大部分工作。原文主干对照
• 边界扫描:原生五十三点零,早期接管五十五点二(差值正二点二),问题接管四十九点二(差值负三点八),全前缀复用五十二点零(差值负一点零);复用越多并不单调更差,边界取在最后反而最接近原生。原文边界扫描
• 服务成本:八千 token 问答的热缓存首 token 延迟由四百八十六毫秒降到三十毫秒,约十六倍;完成时间由五百八十二毫秒降到二百六十五毫秒;八千 token 的前缀缓存为九百四十 MB、主干预填充四百一十三毫秒、专家预填充四百八十九毫秒。双分支峰值内存在八千 token 下由七点九二 GB 降到六点九八 GB(零点八八倍),但作者用指针检验确认前缀在两个分支之间从未物理共享,省下的是「少算一次」而不是「共用一份」。原文服务成本
• 跨专家差异:数学专家的复用损失点估计明显大于问答专家,但两者之差的置信区间与接缝的双重差分都包含零,样本量也不同,因此论文没有据此宣称某一类专家更敏感。原文差异对比
KV 复用跨专家代价对比
与专家相关复用代价相关的若干对比;红色区间排除零、灰色区间包含零,其中数学专家自身的复用损失与问答侧的接缝损失排除零,但两个专家之间的差值(n 为一千二百)与接缝双重差分(n 为五百)都包含零,且双重差分点估计为正。原论文图

总结与反思

结果总结: 这篇论文给出的是一本可复核的工程账:在十七亿参数、两个任务的设定下,跨标准 LoRA 复用共享前缀能以约十六倍的首 token 加速换来数个百分点的质量损失,而损失中有一部分其实是生成被截断。
局限性: 作者非常克制地列出边界——质量损失受截断混淆,去掉上限后残差仍为负但区间含零;边界评测切片与开发切片重叠,不是独立留出确认;只覆盖一个十七亿主干与两个任务,第二个随机种子的点估计与第一个相差较大,两者直接对比的区间包含零;实现上只做逻辑复用、存储仍被复制,共享缓存的内存收益尚未实现。
前沿见解: 多专家共享主干这类部署形态,真正的优化目标不是「把缓存省到极致」,而是在可接受的截断率与质量损失下重新分配计算;把这一点写清楚,比给一个漂亮的加速比更有用。

Agent

本板块与头条第 1 篇 ScienceBuddy 呼应:ScienceBuddy 让协作经验回流成任务与规约,EchoPath 则处理更贴近日常的那类经验——已经验证过的操作过程能不能被直接调起。

11. 别让图形界面智能体每次都从零开始点鼠标——EchoPath 把验证过的 GUI 轨迹编译成可参数化调用的记忆原文

信号源:约翰斯·霍普金斯大学应用数学与统计系、亚马逊通用人工智能(Amazon AGI)
🤖

认知提取

图形界面智能体最浪费的地方不是不会操作,而是每次都要重新观察、重新规划、重新定位。企业里那些每天重复的表单、报表与配置,本可以像工具调用一样被直接调起。
EchoPath 的答案是换一种记忆格式:把验证过的 GUI 轨迹编译成带任务意图键、应用与状态前置条件、可执行动作程序、视觉证据、可绑定参数与生命周期状态的记忆对象,接口形态更接近一次工具调用,而不是一段经验文本。
关键工程细节在重瞄准:存下来的坐标被当作视觉证据,执行前会与当前屏幕重新匹配并输出修正后的坐标;参数只允许绑定声明过的可变输入,其余步骤一律照旧。
于是在真实计算机操作任务上,中位 token 成本下降超过九成,中位执行时间下降约六成。

论文摘要

• 论文指出 GUI 智能体常用的「观察—规划—定位—执行」新鲜循环,在处理重复更新记录、处理表单、配置工具与导出报告的企业任务时效率很低。原文引言
• 提出 EchoPath:一个与模型、环境均无关的执行框架,把经过产物验证的 GUI 轨迹转换成标准化、参数可控的可调用记忆。原文方法总览
• 每条记忆包含任务意图键、应用与状态前置条件、可执行动作程序、视觉与状态证据、可绑定参数、产物验证证据、推理报告与生命周期状态,默认只有活跃记忆被暴露给宿主智能体。原文记忆结构
• 在真实计算机操作任务上,中位 token 成本降低超过百分之九十、中位执行时间降低约百分之六十。原文摘要
EchoPath 架构图
EchoPath 的架构总览;第一遍由智能体在真实环境中完成任务并留下经过产物验证的轨迹,随后轨迹被编译成带前置条件、可执行动作程序与可绑定参数的可调用记忆,第二遍遇到同类任务时只需检索、校验前置状态并回放,无法确定性回放时再退回有界修复或重新规划。原论文图

核心方法

• 统一执行边界:动作空间限定为观察、点击、移动、输入、粘贴、按键、组合键、滚动、等待九种,并记录操作前后截图、耗时与坐标上下文。原文动作空间
• 检索与门控:候选集按意图相似度阈值零点一八过滤,综合分由生命周期、意图相似、类型、应用、验证、推理与动作七项加权合成,需全部门控通过且综合分不低于零点七五。原文检索门控
• 回放绑定:存下来的坐标被当作视觉证据,用目标、上下文与宽上下文三种裁剪与当前屏幕匹配后重定向指针动作,参数含相似度阈值零点七八、边距零点零二、缩放区间零点五到二点零。原文重瞄准
• 参数重绑定与生命周期:只在声明的动作下标与参数路径上重绑定可变输入,固定导航、保存、快捷键、等待与结构性操作保持不变;记忆的晋升、分支、修复、合并、弃用与隔离按类似版本控制的方式管理,晋升由产物验证把关。原文生命周期
EchoPath 回放与自动重瞄准
动作回放中的自动目标重瞄准与智能体回退机制;回放的每一步都要先做视觉重瞄准,若目标模糊或与前置状态不兼容,则在指针事件之前拒绝执行并转入有界修复或重新规划,而不是带着过期坐标继续操作。原论文图

实验成果

• 主实验在 OSWorld-Verified 上做配对两遍测试:第一遍分辨率一千九百二十乘一千零八十,第二遍一千六百乘九百;共得到一百五十九个活跃可执行记忆,任务含二到二十九个 GUI 动作、多数在四到十三个之间;第一遍中位 token 约五十七万二千、中位执行时间约四点五分钟。原文主实验
EchoPath 第一遍记忆构建统计
EchoPath 第一遍记忆构建的统计分布;直方图给出每条任务实际包含的 GUI 动作步数,内嵌小图报告构建成本的中位数与百分之二点五到九十七点五分位,可见一百五十九个活跃记忆对应的原任务长度差异很大,构建开销集中在少数长轨迹任务上。原论文图
• 第二遍回放:Codex 版本召回一百五十九分之一百五十九、完成一百五十九分之一百四十五(百分之九十一点二),中位 token 二万零三百七十、耗时一百二十七点五秒;Claude 版本完成率百分之九十二点八、中位 token 三万零五百零三、耗时一百三十九点三秒;Kimi 版本百分之八十七点三、中位 token 一万九千九百二十八、耗时一百三十点五秒。原文回放结果
• 与记忆基线 Synapse 对比:基线成功率百分之九十一点八,但中位 token 五十八万六千三百八十六、耗时三百一十五点七秒;EchoPath 相对它的 token 成本降低超过百分之九十、执行时间降低约百分之六十。原文基线对比
• 检索压力测试:活跃记忆库由一百五十九增至六百五十九,正确召回率保持百分之一百,无错选与漏选;平均查询耗时由二百一十六点五毫秒增至六百一十五点四毫秒,中位由二百零八点九增至五百七十三点八毫秒,最大为一千二百三十二毫秒。原文检索压力
• 重瞄准离线测试:二百个基于坐标的动作,原始屏幕接受率百分之九十五点五、被接受者偏差为零像素;随机缩放条件下接受一百九十例,其中一百八十八例偏差不超过二像素、一百九十例不超过十像素,接受者偏差中位数为零、百分之二点五到九十七点五分位为零到一点四一像素。原文重瞄准测试
• 状态门控与参数绑定:五十条抽样记忆中,兼容起点接受率百分之九十八(五十条中四十九条)、部分改变起点百分之九十二(四十六条)、不兼容起点拒绝率百分之七十八(三十九条);带声明式可变输入的五十条记忆中,合法变体接受率百分之一百、非法非可变改动拒绝率百分之一百。原文门控测试
• 存储规模:本地记忆占用与保留动作步数的线性拟合系数为零点零一九、截距为零点一九四,多数记忆不到一 MB,即使长轨迹任务也是如此。原文存储测试

总结与反思

结果总结: EchoPath 的贡献是把「记忆」从一种检索增强手段改造成一种可调用资产:记忆一旦通过产物验证,就能像工具一样被直接调起,只在声明过的参数上允许差异。
局限性: 作者说明这套方法适用于稳定的工作环境(受控的应用版本、窗口系统、浏览器配置、字体、主题与软件配置),回放时的视觉重瞄准仍容易受工具栏重排、本地化、响应式布局、显示缩放与近似重复界面元素影响;现有诊断只验证了检索、离线视觉绑定、起点门控、参数绑定与存储行为,尚未在大范围界面漂移或企业级部署下验证实时鲁棒性;记忆获取仍依赖第一遍智能体自行尝试任务,收集过程可能包含探索性动作与失败尝试。
前沿见解: 智能体的长期记忆正在分化出两条路线:一条存经验供再次推理,一条存过程供直接执行;后者的价值上限取决于它能否对执行条件做严格前置检查,而这恰恰是工程问题而非模型问题。

应用体系

12. 推荐系统为什么对某些用户就是不好用——AURA 用智能体集群把千万级会话读成一份可执行的故障清单原文

信号源:原论文 arXiv 版本未展开作者单位署名,正文说明评测来自一家大型流媒体公司的两个生产平台
📊

认知提取

推荐系统的聚合指标只会告诉你「平均而言比基线好」,不会告诉你哪个品类的偏好被系统性错配、哪类内容对某个年龄段不合适。
工业界定位这类问题,长期依赖各团队的反馈、领域经验和小规模人工抽查;想规模化,就得让机器去读几百万条真实会话。
AURA 把这件事拆成四段:选会话、规模化定性诊断、给出技术提案、生成代码改动。诊断段用分层智能体聚合,每个叶子智能体只读上千条会话,六个步骤依次完成分类、合并、抽样、分析、交叉验证与综述。
论文最值得记住的却不是诊断规模,而是一个负面闭环结果:在诊断出的故障群体上,两个候选修改都没能改善排序,全局指标也只是保持在正负零点一之内——诊断得对,和修得好,是两件事。

论文摘要

• 论文指出聚合指标(AUC、NDCG、准确率与召回率、多样性、覆盖率)只能反映平均表现,会掩盖特定情境、物品或用户上的细粒度问题,例如何种内容对某些人群不合适、多样性塌缩、个性化回退与时效性失效。原文引言
• 提出 AURA:一个端到端的智能体系统,能在数万到数百万条生产会话上做规模化定性评测,并给出落到代码层面的改进建议。原文系统总览
• 系统包含四阶段管线:会话选择、诊断阶段、假设与技术提案、代码实现与训练评测准备,人工智能校验、工程师评审与记忆贯穿四个阶段。原文管线设计
• 当前部署只推进到「工程师评审过的合并请求」,候选训练、离线评测与 A/B 准备仍由工程师检查点之后的流程完成。原文部署边界
AURA 四阶段管线
AURA 的四阶段管线;依次为会话选择、规模化诊断与定性评测、假设与技术提案、代码实现与训练评测准备,其中最后一段的虚线部分(候选训练与 A/B 就绪)是规划中的扩展,当前部署只推进到工程师评审过的合并请求;人工智能校验、工程师评审与记忆三条纵线贯穿全部阶段。原论文图

核心方法

• 会话选择:融合随机与分层采样、工程师编写的领域查询与智能体,先做一轮画像汇总数据分布并抽样可疑片段,再由多个独立筛选智能体并行提出候选问题群体,去重后按多数投票排序。原文会话选择
• 分层诊断:通过分层智能体聚合,把大规模语言模型推理扩展到成千上万乃至数百万条生产会话,叶子智能体每条处理上千条会话;当前部署采用六步漏斗——分类、合并、抽样、分析、验证、综述。原文诊断阶段
• 角色分工:分类智能体按既定或涌现的分类法给每条会话打标,合并智能体归并近重复类别,抽样智能体保留值得更强模型深挖的类别并抽样,分析智能体为每个类别产出描述、严重度、根因假设、支撑证据与可执行建议,验证智能体交叉检查,综述智能体输出概要。原文角色分工
• 假设与提案:针对每条已验证发现,读取推荐模型自身的代码、特征定义、训练管线、标签规范与数据统计,输出含根因假设与候选改动的结构化技术提案;作者强调这不是形式化因果推断。原文技术提案
• 代码实现与护栏:生成—评估—精炼循环用前沿模型配合代码索引产出改动,评估模型按正确性、可行性与副作用打分;程序化校验器检查不存在的文件、缺失导入与伪造引用;智能体对分析数据湖只读、代码改动在沙箱副本内进行、晋升需署名工程师,驳回同样是一等结果。原文代码实现
• 多模型路由与平台迁移:高量的分类与合并交给轻量模型,解释、分析、验证与代码生成留给前沿模型;新平台接入被设计成配置变更而不是代码变更,平台参数强制隔离。原文工程设计

实验成果

• 数据规模与失败比例:平台 A 为九万六千八百零一条会话中的一万八千九百零一条被判为失败(约百分之十九点五);平台 B 为十万一千五百九十四条中的四千一百五十四条(约百分之四点一);作者说明这一差距不是平台质量排名,因为判据按各自的提示与校准标定,且平台 B 的提示中途修订过。原文数据规模
• 上游评委校准:三名独立评审以多数表决,约二百条分层样本上平台 A 的多数一致率为百分之九十六(两百条中一百九十二条)、平台 B 为百分之八十七点六(两百零一条中一百七十六条);三方完全一致分别为百分之八十与百分之五十八,Fleiss κ 约在零点一七到零点三八之间。原文评委校准
• 逐阶段评分规约:平台 A 由二十五项中十五项达标提升到二十三项,平台 B 由十七项提升到二十四项;其中分类由五分之四升到五分之五,合并平台 A 由四分之一升到四分之三、平台 B 由四分之二升到四分之四,代码建议两项均由四分之一升到四分之三。原文评分规约
• 诊断输出(平台 A):严重的品类偏好错配一万三千一百三十五条会话(占失败群体的百分之四十八点三)、子品类偏好错配六千四百四十四条(百分之三十四点一)、系列偏好错配一千五百七十一条(百分之八点三)、内容类型错配一千零三十六条(百分之五点五)、地区偏好错配九百七十八条(百分之五点二)、中等严重度的年龄不合适推荐五百三十三条(百分之二点八);一万七千九百九十六条(百分之九十五点二)失败会话被归类,并识别出系统性流行度偏差。原文诊断输出
• 诊断输出(平台 B):严重的品类偏好错配一千九百一十一条(百分之四十六点零)、中等严重度的调性与分寸错配三百一十条(百分之七点五)、内容格式错配九十三条(百分之二点二)、年龄不合适推荐七十六条(百分之一点八);二千四百一十五条(百分之五十八点一)失败会话落入已浮现类别,并识别出内容敏感度缺口。原文诊断输出
• 成本:平台 A 端到端三百四十九点二六美元,其中上游会话评委三百二十点九八美元(百分之九十一点九),AURA 自身二十八点二八美元;平台 B 端到端二百五十二点八五美元,AURA 自身二点六四美元。汇总来看,纯诊断成本最高约每条可执行发现五点三八美元,含上游评委的端到端成本为四十三到五十美元;运行时长平台 A、B 分别为一千五百五十四与九百六十五分钟,AURA 自身管线为三百零四与七十二分钟。原文成本
• 闭环修补的负面结果:平台 B 主导的品类偏好错配(一千九百一十一条)产生两个候选修复(用户品类与候选品类的交叉特征、候选感知注意机制),两者在诊断群体上都没有提升排序;在三个独立训练日上,全局指标全部落在正负零点一以内(点击 AUC 分别正零点零三、正零点零六、正零点零一,观看加权 AUC 正零点一零、正零点零六、正零点零四,NDCG@10 为负零点零一、正零点零五、正零点零二)。原文闭环结果
证据来源与未收录范围说明:AURA 的诊断结果与成本数据在原论文中全部以表格形式给出(Table 1 至 Table 6),论文未为这些结果提供图表,因此本节按原文数字与表格口径复现并保留表格入口;本节除 Figure 1 管线图外无其他可收录图形资源。
• 分类法收敛:平台 B 的开放式基线产出三十多个互相重叠的类别,经格式与合并规则后降到二十二个唯一标签,最终成为十三类封闭分类法并达到五分之五满分;平台 A 独立收敛到十三类的枚举,实际产出十二个标签、合并后收敛为八类。原文分类法

总结与反思

结果总结: AURA 证明了对生产推荐系统做规模化定性诊断在工程上可行,成本可以压到每条可执行发现几美元;但闭环实验同时说明,把「描述得对」转成「修得好」还需要另一套方法。
局限性: 作者明确 AURA 不提供形式化因果推断,只给出扎根于代码、数据与训练上下文的解释性根因假设;上游评委校准只是校准检查而非硬性真值,同源模型可能通过自我偏好抬高一致率;严重度表示触及多少会话,而不是单例伤害程度;当前部署只到工程师评审的合并请求,候选训练与 A/B 仍由人工在检查点后推进。
前沿见解: 当智能体开始承担系统诊断,最有价值的产出可能不是「我要改哪一行代码」,而是一份可审计的失败群体清单——它让后续的修复尝试有了可比较的评估对象。

Benchmark

13. 长视频理解不该只有眼睛在工作——Video-HolmesV2 要求模型用音视频的时空证据同时作答原文

信号源:中国科学院大学、腾讯、清华大学
🧩

认知提取

现有的长视频理解评测几乎都在考眼睛:模型看几十帧画面,然后回答一个问题。声音通道被当作装饰,模型成了沉默的观察者。
可在真实长视频里,发生了什么往往要靠两条通道互相补全——画面里出现一条蓝色的蛇,只有配上「爬行动物在几个世纪前就消失了」这条听觉线索,才能推出「社会秩序被打乱」这件事。
Video-HolmesV2 用七百八十四段长视频和四千对问答把这个问题摆上桌面,并且加了一条很硬的约束:模型不仅要答对,还要给出精确到时间戳的音视频证据。
结果相当刺眼:只按答案计分时最强基线拿到七十三点二,把证据质量算进总分后掉到五十四点二;开源前沿模型的证据分只有八点五,总分落到三十四点九。

论文摘要

• 论文指出长视频理解评测过度偏重视觉线索、边缘化听觉通道,使模型成为「沉默的观察者」,无法做真正的跨模态推理。原文引言
• 指出长视频中视觉与听觉证据深度交织,而标准稠密采样带来证据与上下文之间的权衡和 token 爆炸;仅用答案准确率也无法区分真实推理与猜测、幻觉。原文问题陈述
• 提出 Video-HolmesV2:包含七百八十四段长视频(平均约四十三分钟)与四千对问答,强制要求深度音视频耦合与证据落地评测。原文基准规模
• 评分把证据质量与答案正确性绑定:总分等于零点六乘选择准确率,加上零点四乘(选择准确率乘证据分)。原文评分设计

核心方法

• 任务体系:分为感知与推理两层,感知含物体、场景、空间、时间四类,推理含段内、跨段、计数、主题四类,四个主要推理支柱各约占四分之一,确保评测不偏向单一认知能力。原文任务分类
• 音视频耦合约束:样本要求同时满足音视频相关性、时空证据性与证据链条件,避免只靠视觉或只靠听觉就能解出的题目。原文耦合设计
• 质检流程:使用多模型交叉验证管线,包含单模态陷阱盲过滤、片段级证据时间戳交并比高于零点七五的交叉验证,以及双盲专家复核。原文质控管线
• 数据来源:从二〇二四年之后的候选视频中筛选,视频时长十到一百五十分钟,并排除新闻报道、体育比赛、教学视频等单模态主导或因果稀疏的类别。原文数据筛选
• 证据感知评分:用基于高斯的软评分与语义匹配对证据的时间与空间位置打分,再把证据分乘进准确率项,形成最终总分。原文证据评分
Video-HolmesV2 音视频耦合示例
以一段动画长片为例说明基准为何强制跨模态综合;仅凭视觉识别出一条蓝色的蛇并不能推出「社会秩序被打乱」,必须结合音频里的历史线索才成立,因此基准要求模型把答案落到视觉与听觉两条通道的精确时空时间戳上。原论文图

实验成果

• 仅按答案计分的总体榜:最强基线 Gemini-2.5-Pro 取得七十三点二,开源前沿基线 Qwen3-VL-235B-A22B 为五十五点三,GPT-4o 因最多采样五十帧只有四十六点九。原文总体榜
被测模型选择准确率(Table 3)证据分(Table 3)证据加权总分(Table 3)
Gemini-2.5-Pro七十三点一三十五点二五十四点二
Qwen3-VL-235B-A22B五十五点一八点五三十四点九
• 感知与推理的落差:Qwen3-VL-4B 在感知类任务上四十七点三,在推理类任务上只有二十七点零,呈现出从「看见」到「想明白」的明显衰减。原文分层表现
• 论文自带的轻量方案:音文引导的 token 压缩框架取得总分四十四点五,比 Qwen2.5-VL-32B 的四十三点六与 Qwen2.5-Omni-7B 的四十点七高出三点八;配 Qwen2.5-Omni-7B 时在 VideoMME 上达到六十七点八、WorldScene 上四十七点二,相对全量 token 基线达到百分之一百零一点五的相对表现。原文压缩方案
证据来源与未收录范围说明:本节数字来自原论文 Table 2 与 Table 3 的实测数值,论文这两部分本身即以表格形式呈现(Table 2 为各模型分项表现,Table 3 为答案准确率、证据分与总分),因此此处按原文表格复现核心对比,未以生成图替代。原文 Table 2 入口原文 Table 3 入口
Video-HolmesV2 数据与质控管线
规模化标注与质控管线;从多源取材与分层出题,到多阶段验证,其中关键一步是交叉音视频测试——它会自动丢弃那些只看画面或只听声音就能解答的题目,最后由专家复核裁决难例,保证每条样本都真正要求跨模态互相印证。原论文图

总结与反思

结果总结: Video-HolmesV2 的价值在于把「证据」变成了计分项:一旦要求模型指认支撑答案的音视频时间戳,原本看起来接近可用的成绩会大幅回落,这比再刷一个更高的准确率更有信息量。
局限性: 数据筛选把视频限制在二〇二四年之后、十到一百五十分钟之间,并主动排除了单模态主导或因果稀疏的类别,因此评测覆盖的是特定形态的长视频;评审流程依赖专家复核,规模扩展受人力约束;论文可见文本中未报告完整评分口径下的人类对照数值。
前沿见解: 多模态评测正在从「答对没有」走向「拿什么证明」,而后者会一次性暴露出模型究竟是在推理,还是在用语言先验填补画面与声音之间的空白。

本期观察

AI 科技评论注意到,把本期十三篇论文放在一起看,它们指向的是同一件事:
模型能力的下一轮增量,不来自把端到端系统做得更黑箱,而来自把中间状态做得更可检查。
OPEN-1B 把训练过程拆到逐位可复算,于是第一次能指着一条曲线说「这里曾经出过一个错,而且是它自己抓出来的」;ScienceBuddy 把研究者的协作过程编译成任务与评分规约,让「这一次被纠正」真的能影响下一次;Weave 把人类示范里的接触关系显式保留在重定向目标里;而 ImpossibleRubrics 从反面证明,如果评分规约不显式要求「承认证据不足」,训练循环会毫不犹豫地奖励胡说。
工程侧的收敛同样清晰:JustFit 与共享前缀 KV 复用都在重新划分内存与计算的归属,只不过一个发生在单机内存预算之内、一个发生在多个专家之间;EchoPath 把验证过的操作轨迹变成可参数化调用的资产;AURA 把生产系统的失败模式变成一份可审计的清单,同时坦率说明「诊断得对」并不等于「修得好」;Video-HolmesV2 干脆把证据写进评分公式,让答对却无法指认证据的回答立刻掉分。
对读者而言,这一批论文给出的可操作信号很简单:评估一个系统时,先看它把哪些中间状态暴露了出来。能被重放、能被反查、能被干预的那部分,才是可以持续改进的部分。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel