奇绩信号Alpha Sight 2026年8月31日【文字版】

奇绩信号Alpha Sight 2026年8月31日【文字版】

从 8 月 27 日 arXiv 最新论文中精选十二篇,拆解 Agent 经验、跨具身世界模型、视觉压缩、科学推理与企业知识库如何变成可检查的中间接口。

今日判断

2026 年 8 月 27 日的 arXiv 新论文,反复把“模型会不会做”改写成“中间过程能不能被检查”。WikiSkill 把经验存进持久化知识库,CLAP 把不同机器人的动作放进共同物理空间,Audio Twin 把语音里的韵律线索做成可检索证据,CorporateBench 则把企业知识问答推到二十六万份文档的规模。
这批论文的共同价值,不在于又增加了一个模型名字,而在于它们都试图把隐藏过程留下接口。读者可以据此判断哪些工作值得继续精读、复现、技术跟踪或投资跟进。
本期覆盖窗口为 2026 年 8 月 27 日 arXiv recent 分组,所选论文详情页的 v1 日期均为 2026 年 8 月 27 日。

头条

1. WikiSkill:把 Agent 经验编译成可持续演化的知识库 原文

信号源: Google Research、Virginia Tech
认知提取
多数 Agent 的经验散落在一次次 rollout 里,下一轮优化只能重新翻旧记录。WikiSkill 加了一层会持续积累的 Wiki,把原始轨迹、结构化知识和可执行技能分开保存。结果显示,技能不只是提示词的另一种写法,它可以跨模型迁移,也能部分抵消模型规模差距。
论文摘要
• WikiSkill 在五个基准上比较无技能、Trace2Skill、EvoSkill、SkillOpt 和自身方法,任务覆盖数学推理、网页搜索、电子表格、长文档问答和具身交互。1
• 原始执行轨迹进入 Raw Layer,经验模式进入 Wiki Layer,当前可执行流程进入 Skills Layer;技能回滚时,Wiki 仍然保留。1
• 评测使用 Qwen、Gemma 和 Gemini 家族的五个模型,并在训练、验证、测试三份任务上分离技能演化和最终评估。1
WikiSkill 三层架构与演化循环
WikiSkill 将不可变轨迹、持久 Wiki 和活跃技能接成持续演化回路,技能更新可以撤销,知识积累不会被一起清空。1
核心方法
• Inference Agent 使用当前技能执行任务;Wiki Maintainer 从成功和失败轨迹中提炼模式;Skill Proposer 按需读取 Wiki 并提出原子修改;Gating and Rollback 只有在验证集得分严格提高时才接受修改。1
• 论文刻意限制 Inference Agent 直接访问 Wiki,让执行阶段使用技能,知识维护阶段负责沉淀,避免把完整知识库直接塞进每次上下文。1
• 默认配置下,WikiSkill 在 Qwen-3.5-4B、Qwen-3.5-9B 和 Qwen-3.6-27B 的平均得分分别为三十八点五、四十七点四和六十三点三。1
WikiSkill 持久知识演化案例
案例展示一次技能提案被拒后,后续版本如何基于仍然存在的 Wiki 模式继续修补,验证门把“经验积累”和“技能接受”分成了两条线。1
实验成果
• 相比各自最强基线,WikiSkill 的平均提升在 Qwen-3.5-4B、Qwen-3.5-9B、Qwen-3.6-27B、Gemma-4-31B 和 Gemini-3.5-Flash 上分别为三点三、五点一、十点零、五点八和十二点零个百分点。1
• Qwen-3.5-9B 加 WikiSkill 的平均得分为四十七点四,高于 Qwen-3.6-27B 无技能时的三十九点四;技能把模型规模差距变成了可以被知识补偿的一部分。1
• 跨模型迁移并不总是正向。Qwen-3.6-27B 演化的技能让 Gemma-4-31B 在 LiveMath 达到七十三点七,但某个 Qwen-3.5-4B 技能让 Gemini-3.5-Flash 的 SpreadSheet 从五十点五降到十八点一。1
总结与反思
结果总结:持久 Wiki 让技能演化获得跨轮次记忆,强模型演化出的技能还可能帮助较小模型。
局限性:所有技能在推理时直接注入提示词,论文没有评估技能检索和触发;Wiki 长期累积后的剪枝也未解决。1
前沿见解:下一步的关键问题是把“知识积累有效”推进到“什么时候该加载哪条知识”,这会把技能质量和技能检索真正分开。

2. CLAP:让不同机器人共享同一个物理世界模型 原文

信号源: 普林斯顿大学
认知提取
单一机器人数据像只看一条车道,能学到局部动作,却很难学到通用物理。CLAP 用潜在动作、语言动作和末端执行器动作把人类视频与多种机器人视频接到一起。论文最有价值的地方,是把跨具身泛化从口号变成了可测的预测、规划和少样本适配问题。
论文摘要
• CLAP 的核心假设是瓶子倾倒、毛巾折叠和抽屉滑动遵循同一套物理规律,动作主体换成手、人形机器人或机械臂后,时空动态仍有可共享部分。2
• 论文使用 Open X-Embodiment 与 EgoDex,训练一百千步,使用八张 H100/H200,训练约两至三天。2
CLAP 跨具身世界模型总览
CLAP 将人类与机器人视频放入跨具身训练框架,并覆盖末端执行器、语言和潜在动作三类条件。2
核心方法
• CLAP-EE 把关节位置映射为七维末端执行器动作;CLAP-LANG 把动作转成模板化运动原语;CLAP-LAM 用相邻帧学习三十二维连续潜在动作,从而利用没有动作标签的互联网视频。2
• CLAP-CURR 先用潜在动作学习物理先验,再替换为末端执行器动作头联合训练,目标是同时获得无标签视频的规模和零样本部署能力。2
CLAP 架构图
架构图展示不同动作空间如何通过视频扩散模型共享历史观测、语言指令和未来动作条件。2
实验成果
• 在 DROID 上,CLAP-CURR 优于 CLAP-LAM 与 CLAP-EE;跨具身模型相对 DreamDojo-Human 的 LPIPS 至少改善六十一个百分点。2
• 末端执行器条件下,绝对动作在 DROID 上的 LPIPS 比相对动作改善约十四点六个百分点;语言条件下,相对动作反而更好。2
CLAP 跨具身与单具身指标
DROID、Bridge 和 OXE-Mix 的指标对比显示,跨具身训练在数据混合后更容易形成可迁移的物理先验。2
CLAP 推理时跨策略规划结果
推理时跨策略规划把不同策略的候选动作交给世界模型筛选,论文在 Franka 与双臂 YAM 任务上报告了成功率提升。2
总结与反思
结果总结:CLAP 证明跨具身视频可以服务真实机器人规划和少样本适配。
局限性:模型仍会产生物理幻觉,当前训练数据主要来自单臂机器人和人类视频;双臂与人形数据仍然不足。2
前沿见解:世界模型的规模化路径可能先来自动作空间的统一,再来自机器人本体数量的统一。

3. LeVJEPA:视频预训练开始主动删掉百分之九十五的 token 原文

信号源: 德国癌症研究中心、德国癌症联盟、歌德大学法兰克福、Mila、蒙特利尔大学、布朗大学、纽约大学、Advanced Machine Intelligence
认知提取
视频预训练的成本,常常被一层层稳定训练的辅助组件推高。LeVJEPA 把配方收缩为一个编码器、一个投影器和一个 SIGReg 正则项,再把大量 patch token 随机丢掉。结果说明,稀疏输入不必等于稀疏表征,但运动理解仍是这条路线最需要补的短板。
论文摘要
• LeVJEPA 在同一数据和相同训练轮数下,比 V-JEPA 2 少用五点六到二十点八倍预训练 FLOPs。3
• 训练使用 K710 的百分之二十类别均衡子集,二百四十个 epoch,batch size 为三千零七十二;下游任务采用冻结 attentive probing。3
LeVJEPA 训练流程
同一视频片段产生 global 与 local view,百分之九十五的 patch token 被均匀丢弃,global 和 local 的 cls 表征由不变性损失与 SIGReg 共同约束。3
核心方法
• SIGReg 用随机方向投影检查 embedding 是否接近各向同性高斯,论文将正则项的权重固定为零点零二,不使用 target encoder、predictor、stop-gradient 或 masked-token reconstruction。3
• 编码器使用帧内双向、帧间因果的 block-causal attention,过去帧无需重复编码,因此更适合流式输入和自回归世界模型。3
实验成果
• FLOP 匹配时,LeVJEPA 在 ImageNet-1K、Something-Something-v2 和 Kinetics-400 上分别为六十一点零、四十点四和四十四点六;ImageNet-1K 比最强视频基线高七点六分,Kinetics-400 也最高。3
• 在同源视频帧、等 FLOPs 对比中,LeVJEPA 的 ImageNet-1K 为五十点七,Something-Something-v2 为三十点四;DINOv2 的对应结果为五十三点八和十六点九。3
LeVJEPA patch-token PCA
patch-token PCA 显示 LeVJEPA 在只监督 clip-level cls 的情况下,仍能把物体与背景分开,形成具有空间语义的局部表征。3
• token 丢弃率从零提高到百分之九十五时,ImageNet-1K 精度从三十三点九升到四十七点六;但短训练设置下,运动任务的收益不如外观任务稳定。3
LeVJEPA patch-token 空间结构
物体区域的 patch-token 相似度集中在空间上对应的目标附近,说明随机稀疏化没有抹掉全部局部结构。3
总结与反思
结果总结:LeVJEPA 把视频预训练的计算瓶颈直接变成 token 预算问题,并保留了因果帧表示。
局限性:受控实验主要在 K710 百分之二十子集和 ViT-S/B/L 上完成,密集预测任务尚未评估。3
前沿见解:后续真正的工程难题不是继续增加训练组件,而是让稀疏 token 同时保住长程运动和细粒度空间对应。

4. MAELLE:让反应预测沿着电子流动,而不是只猜分子字符串 原文

信号源: 原论文 arXiv 版本未展开机构署名
认知提取
传统反应预测常把反应物直接映射到产物,模型知道答案长什么样,却未必知道电子怎样重新分布。MAELLE 把分子图上的电子占据变化拆成稀疏、可解释的编辑动作。它在常规测试集接近强基线,在分布外质量和酯类测试上则更强调机制一致性。
论文摘要
• MAELLE 在 USPTO-480K 上学习电子重新分配路径,不需要逐步反应标签,并通过重原子守恒约束产物生成。4
• 论文用离散 flow matching 学习电子编辑动作,最终输出按置信度排序的 Top-k 产物候选。4
MAELLE 方法总览(arXiv PDF 截图)
图中展示 MAELLE 从反应物图、电子编辑路径到产物候选的采样过程;图片来自 arXiv PDF 原始页面截图。4
核心方法
• 每一步编辑只作用于电子占据状态,动作空间包括电子移动、键断裂与键形成等稀疏操作;中间状态因此具有化学机制解释。
• 最优传输矩阵把反应物和产物之间的电子状态配对,训练过程学习完整电子重新分布,而不是依赖人工标注的 elementary step。4
• 论文同时评估 SMILES、分子图和电子重新分布三类预测方式,以区分模型的归纳偏置和单纯的训练集记忆。4
实验成果
• USPTO-480K 上,MAELLE 的 Top-1、Top-3、Top-5 和 Top-10 准确率分别为八十七点二、九十三点零、九十三点九和九十四点六。4
• Top-1 结果低于 NERF 的九十点七和 Graph2SMILES 的九十点三,但 Top-5 与 NERF、MEGAN 接近;在分布外质量测试中,MAELLE 和 MEGAN 的性能随分子质量变化更稳定。4
MAELLE 分布外结果(arXiv PDF 截图)
分布外结果图对比 MAELLE、Graph2SMILES、Molecular Transformer 和 MEGAN 在不同测试集与分子质量区间的表现,图片来自 arXiv PDF 原始页面截图。4
• MAELLE 的 Top-1 plausibility 为八十点七,高于其 Top-1 accuracy 六十点三的分布外案例值,说明部分错误候选仍具有化学可行性。4
总结与反思
结果总结:MAELLE 把反应预测从终点匹配推进到电子流动建模,牺牲少量常规 Top-1 换取机制可解释性和分布外稳定性。
局限性:arXiv HTML 转换失败,本期图表只能从原始 PDF 截图;模型对质子化和去质子化采用简化处理。4
前沿见解:在科学机器学习里,机制路径的价值可能体现在错误候选是否仍然可行,而不只体现在单一 Top-1 命中率。

认知模型

5. 语言模型如何组织道德知识:检测道德只是最低门槛 原文

信号源: Distiller Labs
认知提取
模型能识别一句话是否涉及道德,并不等于模型把不同道德框架组织起来了。论文训练六个线性探针,观察六类 Moral Foundations Theory 方向在表示空间里的关系。结果显示,这些方向既没有塌成一个“道德开关”,也没有完全互相隔离,但论文没有找到心理学理论预期的分组结构。
论文摘要
• 实验对象是 OLMo-2 1B、OLMoE-1B-7B 和 OLMo-2 7B;每层分别训练 care/harm、fair/cheat、lib/oppress、loy/betray、auth/subv、sanc/degrade 六个探针。5
• 数据包含二百四十对最小对句子,困境扩展包含十五组双基础道德困境;作者还用 Moral Foundations Vignettes 做外部复现。5
六个道德基础方向余弦热图
六个方向在 OLMo-2 1B 第七层的平均非对角余弦为零点二六二,所有方向保持正相关但没有塌缩成单一方向。5
核心方法
• 论文把每个线性探针的权重向量单位化,将它当作表示空间中的道德基础方向,再用余弦矩阵、有效维度、Ward 聚类和置换检验分析几何结构。5
• 困境方向由两个基础方向的二维子空间解释,模型还接受高斯噪声注入测试,以估计不同方向的脆弱性阈值。
实验成果
• 六个基础探针最高准确率均达到百分之百;稳定层的平均成对余弦为零点二三二至零点二七四,有效维度在全部层保持为五。5
• 道德基础的平均余弦为零点二六,匹配的非道德概念电池为零点零一三,差值为零点二二三,置信区间为零点二零二至零点二四四。5
道德困境子空间热图
困境方向在匹配的两个基础子空间中比错配对更接近,平均匹配/错配比约为二点七倍;但平均仍有约百分之八十八的方差落在成分子空间之外。5
• 训练轨迹显示,表示几何在约二千步时已经进入整合区,之后准确率继续上升;这说明可读出的结构先于探针准确率饱和。5
总结与反思
结果总结:模型确实形成了可分离又共享成分的道德表示,困境方向也部分组合自基础方向。
局限性:MFT 的个体化/绑定分组检验只有二十种候选划分,统计功效不足;情感效价等残余对照也没有完成。5
前沿见解:探针几何可以测到“模型把概念怎样放在一起”,但它仍然距离模型在真实冲突中如何做判断还有一段距离。

6. Naive Prompt Optimization:复杂搜索未必比单线迭代更值 原文

信号源: 普渡大学
认知提取
提示词优化越来越像一套昂贵的搜索系统:多个候选、反思、Pareto 选择和大量 rollout。NPO 只保留一条提示词谱系,让教师模型看最近几轮完整轨迹和奖励后继续改写。论文的信号很具体:在部分任务上,教师推理能力比优化器的搜索复杂度更重要。
论文摘要
• NPO 每轮在学生模型上收集完整 rollout traces 和逐条奖励,再把最近若干轮反馈交给教师模型生成下一版 prompt;方法不维护候选池,也不使用显式搜索。6
• 评测覆盖 IFBench、HotpotQA 和二十二个 TextArena 游戏,主要学生模型为 Qwen3-8B;每个 prompt 在独立三百题验证集上评估。6
核心方法
• NPO 与 OPRO 的差别在于反馈粒度:OPRO 主要看到旧 prompt 和标量分数,NPO 还看到完整 rollout 轨迹与 rollout-specific rewards。6
• 论文用共享伪随机数降低环境差异,用受限解码消除非法动作和格式错误对比较的干扰;TextArena 中 NPO 与 GEPA 都使用四百零八个完整 episode。6
实验成果
• 在 IFBench 中,NPO 的 rollout 预算为三千五百,GEPA 为三千五百九十三;在 HotpotQA 中,NPO 为六千八百,GEPA 为六千八百七十一,NPO 达到相当或更好的表现。6
• NPO 加 GPT-5.5 收敛最快、验证性能最高;二十二个 TextArena 游戏没有统一赢家,GRPO 在某些不适合提示词优化的游戏上提供互补收益。6
• 优化后的 prompt 可以原样迁移到 Qwen3-14B、Qwen3-32B、Llama-3.1-70B-Instruct 和 Llama-3.3-70B-Instruct;同一家族迁移最稳定,跨家族收益更弱且波动更大。6
总结与反思
结果总结:单谱系提示词优化在若干可验证任务上接近或超过复杂搜索方法。
局限性:任务集合和长时程环境仍有限,论文也没有把前沿闭源模型作为学生模型做完整评估。6
前沿见解:优化器设计的首要问题可能从“搜索多宽”变成“教师能否读懂失败发生在哪里”。

多模态

7. When Text Misleads:语音模型真正的难题是知道何时相信声音 原文

信号源: 约翰斯·霍普金斯大学语言与语音处理中心
认知提取
语音对话里,文字说了什么和说话方式可能互相打架。ContraTalk 专门制造这种冲突,让模型面对“文字看似合理、声音却暗示另一种意图”的问题。Audio Twin 把韵律、情绪、说话节奏做成可阅读证据,结果显示,直接接入音频并不会自动带来可靠的跨模态推理。
论文摘要
• ContraTalk 来自一百一十七段对话,共五百零一道问题,包含三百三十三道 conflict 题和一百六十八道 consistent 题,覆盖互动行为、情绪、对话行为、社会立场和会话意图。7
语音对话中的模态捷径
动机图说明 transcript shortcut 如何让模型绕过声音里的副语言线索,直接沿着文字表面答案作答。7
核心方法
• 冲突题要求模型在 transcript-only interpretation 和 speech-grounded interpretation 之间做选择;一致题用于检查模型是否在没有冲突时保留正常的文字证据。7
• Audio Twin 用 Whisper、Parselmouth 和 Vox-Profile 提取带时间定位的转写、韵律、说话人特征和对话动态,组织成 turn cards、speaker baseline cards 和 dialogue-dynamics cards。7
Audio Twin 证据接口
Audio Twin 把局部韵律和互动线索写成可检索的证据条目,推理模型可以比较文字解释与声音证据。7
实验成果
• 文本模型在 conflict 题上的准确率为三十三点零至四十七点七;在 consistent 题上多数超过百分之九十,Opus 4.7 达到九十八点二。7
• 直接 Audio-LLM 在 conflict 题上的准确率为三十三点六至四十六点八,仍会在约百分之三十至四十的冲突案例中选择 transcript-biased trap。7
ContraTalk 构建与人工核验流程
基准构建先生成文字表面解释,再定位跨模态冲突区域,生成问答并经过自动检查和人工核验;五百零一道题中三百五十道经过七名评审复核。7
• Sonnet 4.5 加 Audio Twin 在 conflict 题上达到五十点五,误导率为二十九点四;相较裸 Sonnet,准确率从四十七点七提高到五十点五,但 consistent 准确率从九十六点四降到八十八点七。7
总结与反思
结果总结:显式音频证据能降低文字陷阱,却需要选择性调用。
局限性:基准只覆盖受控的跨模态冲突,Audio Twin 的自动对齐和韵律分析本身也会引入噪声。7
前沿见解:多模态系统的关键能力不是永远使用全部模态,而是知道哪条模态在当前问题上更有证据价值。

具身智能

8. STEP:机器人规划先预测状态,再预测动作 原文

信号源: 北卡罗来纳大学教堂山分校、Honda Research Institute
认知提取
“拿起积木、放到桌上”对于人很清楚,对机器人却缺少位置、朝向和目标距离。STEP 让多模态大模型先写出结构化当前状态,再预测动作后的状态,用状态距离筛掉不够接近目标的 rollout。代价也很明确:查询次数增加后,规划质量上升,运行时间从十八点二四秒增到一百四十八点零七秒。
论文摘要
• 数据包含四百九十五条 teleoperated manipulation 实例、十九名用户、双 Franka 机械臂和八类积木装配任务。8
STEP 系统总览
STEP 读取操作者已完成的动作和工作站图像,输出任务、结构化状态、动作以及动作执行后的未来状态。8
核心方法
• 流程包含 task estimation、state representation generation、action prediction、state propagation 和 rollouts 五步;状态用 JSON 表示积木位置、朝向、顶面方向和相对关系。8
• 系统定义零到二十的目标距离,在预测序列中选择距离最小的位置,截断后重新 rollout,直到距离为零或达到最大轮数。8
STEP 状态估计与 rollout
状态估计与 rollout 图展示了模型如何从当前状态逐步传播未来状态,并保留最接近目标的动作片段。8
实验成果
• 相比 AntGPT-inspired baseline,STEP 的 action executability 提高三十二点八个百分点,final-state error 降低十四点八个百分点。8
• 在百分之五十任务完成度的 rollout 消融中,第一轮 executability 为八十八点九八、final error 为四点四零;第三轮分别为八十四点五五和四点零五,动作序列平均每轮增加约零点七个动作。8
STEP 主结果
主结果按任务完成度比较可执行性、最终状态误差和最长公共子序列,图中体现了结构化状态对计划质量的贡献。8
• STEP 平均运行时间为一百四十八点零七秒,基线为十八点二四秒;论文因此把它定位为质量优先的规划器,而非实时控制器。8
总结与反思
结果总结:预测状态转移让语言计划获得了可量化的目标距离和执行参数。
局限性:实验集中在积木装配,当前实现还不适合实时运行;迁移到其他场景需要重写状态表示和提示词。8
前沿见解:具身 Agent 的下一层接口可能不是更长的动作列表,而是动作与状态变化之间的可验证关系。

Infra

9. PACE:视觉 token 压缩要同时发生在编码前和 LLM 前 原文

信号源: 中山大学、广东电网电力调度控制中心、深圳环湾研究院
认知提取
只在 LLM 侧删 token,视觉编码器的时间仍然花掉了。PACE 把压缩拆成两段:先在像素侧自适应缩放,再用视觉与语言两种注意力挑出任务相关 token。Qwen2.5-VL-7B 在保留百分之十视觉 token 时,仍保留原性能的九十三点八,同时 TTFT 加速三点一三倍。
论文摘要
• APC 在视觉编码前估计图像信息密度,DDAE 在视觉编码后融合 ViT 内部信号和 LLM 语义信号。9
PACE Condense-and-Extract 总览
PACE 先由 APC 压缩输入像素,再由 DDAE 在编码后提取 top-k token,两个阶段分别作用于视觉编码和 LLM prefill。9
核心方法
• APC 用全局 token 相似度估计冗余,用局部细节对比保留高密度区域,再按融合后的保留比例缩放输入。
• DDAE 从 ViT 末端注意力和 LLM 第二层跨模态注意力取得信号,按动态权重融合后保留 top-k token;方法无需训练。9
PACE 准确率与 TTFT
在百分之十 token 保留率下,PACE 的准确率接近原模型,TTFT 明显低于标准推理和只做后端剪枝的基线。9
实验成果
• Qwen2.5-VL-7B 固定分辨率下,百分之十 token 保留时,PACE 的归一化性能为九十三点八;百分之五和百分之二十时分别为八十四点三和九十八点六。9
• RTX 4090 上,视觉编码延迟从一百四十八点八四毫秒降到四十九点四七毫秒,LLM prefill 从二百一十七点零五毫秒降到三十二点六九毫秒,TTFT 从三百六十五点八九毫秒降到一百一十六点七九毫秒。9
PACE 自适应像素压缩
自适应像素压缩会把更多预算分配给细节密集区域,避免把所有图像统一缩放到同一保留比例。9
• 在 InternVL3.5-4B 上,百分之二十五、二十和十 token 保留时,PACE 的归一化性能分别为八十五点二、八十点九和六十九点五,均超过最强基线。9
总结与反思
结果总结:PACE 把高分辨率 VLM 的双重延迟瓶颈一起处理,且保持训练免费。
局限性:APC 是 query-agnostic 的一次性压缩,可能损失小文字、细线或低对比度目标;固定网格架构也无法获得编码端收益。9
前沿见解:视觉压缩的核心不只是删掉多少 token,而是哪些信息必须在进入编码器之前保留下来。

Agent

10. RedEvoAgent:红队经验也可以演化成可审计技能 原文

信号源: 香港城市大学、深圳北理莫斯科大学
认知提取
Agent 红队攻击如果只保存完整轨迹,上下文会越来越重,工具之间的功劳也很难分清。RedEvoAgent 把跨案例攻击经验压成一份人类可读的 attack skill,再用验证集棘轮决定哪些修改留下。它的价值不是让攻击更“聪明”三个字,而是让攻击策略的演化可以被追踪、回滚和迁移。
论文摘要
• 工具箱包含 GCG、AutoDAN、AmpleGCG、Template、FlipAttack、RolePlay 和 Prompt Substitution,攻击预算为二十。10
• 评测覆盖 ASB、AgentHarm、Claude Code 和 Codex harness,目标模型包括 MiniMax-M2.5、DeepSeek-V4-Flash 和 Qwen3.5-35B。10
RedEvoAgent 总览
RedEvoAgent 从成功与失败轨迹中提取工具优先级和编排策略,只接受能提高独立验证集分数的技能更新。10
核心方法
• Tool-Effectiveness Profile 单独评估每个工具;Deciding-Tool Attribution 把成功归因到首次成功 QueryTarget 前的决定性工具,减少工具共现带来的错误信用分配。10
• 演化运行四轮,minibatch size 为八,编辑上限为六行;候选技能只有在验证集严格提高时才接受,失败候选进入拒绝上下文。
实验成果
• Claude Code 上,ASB/MiniMax-M2.5 的 ASR 为九十三点二,ASB/DeepSeek-V4-Flash 为九十九点三;Codex 上对应值为九十二点八和一百。10
• AgentHarm/DeepSeek-V4-Flash/Claude Code 中,RedEvoAgent HarmScore 为七十四点三,高于 FlipAttack 的六十七点九和 RedCodeAgent 的三十七点五。10
• ASB/MiniMax-M2.5/Claude Code 中,完整系统 ASR 为九十三点二;移除工具有效性画像、轨迹收集、决定性工具归因后,分别降到七十六点九、八十五点零和八十七点五。10
总结与反思
结果总结:技能级经验摘要同时减少工具调用和上下文负担,并可迁移到另一个 harness。
局限性:验证棘轮在 AgentHarm/MiniMax-M2.5 上出现验证集升高、测试集下降,说明技能演化存在过拟合。10
前沿见解:安全评估系统也需要像普通 Agent 一样保存“哪一步真正起作用”的中间证据。

应用体系

11. Stageboost:电商推荐从固定信号改成增量转化估计 原文

信号源: eBay
认知提取
商品页上的“还剩一件”和“已有多人购买”看起来只是短文案,实际需要回答一个因果问题:这个信号在当前商品和用户身上到底增加了多少转化。Stageboost 用两阶段 XGBoost 先估计基线转化,再估计每条 signal 的增量 uplift。线上结果很克制,整体提升不显著,局部品类却出现统计显著增长。
论文摘要
• 研究对象是 eBay View-Item 页面上的 urgency 和 conversational signals;系统每天面对数亿次商品页访问。11
eBay 商品页信号位置示例
原图展示商品页中 urgency placement 的位置,以及“最后一件”“近期售出”等信号如何进入用户视线。11
核心方法
• M1 用价格、类目、卖家信誉、平台、垂直类目和买家分群估计 item-user 对的基线转化概率;M2 估计具体 signal 在基线之上的增量。11
• 训练数据来自随机对照试验,线上部署版本每次选择一个 urgency signal 和两个 conversational signals;Full Stageboost 因延迟超预算,最终使用 Lean Stageboost。11
Stageboost 两阶段模型
M1 先建立基线,M2 再估计每条信号的边际转化价值,推理时按预测的转化概率排序并取 top-k。11
实验成果
• 离线 counterfactual uplift 中,CLE 为零点一零九个百分点,Full Stageboost 为零点二五五个百分点,满足延迟预算的 Lean Stageboost 为零点一四四个百分点。11
• 线上 A/B 实验中,Overall GMB 提升零点零八个百分点,置信区间为正负零点二八个百分点,统计上不显著;Parts and Accessories GMB 提升零点五八个百分点,置信区间为正负零点五零个百分点。11
• 重点品类 ASP 提升零点四一个百分点,置信区间为正负零点三八个百分点;论文把增量主要归因于高均价商品的转化变化。11
总结与反思
结果总结:两阶段模型在极小 uplift 和高相关信号条件下,仍然找到了可上线的个性化增量。
局限性:整体 GMB 没有显著提升,完整模型延迟超过预算;urgency/scarcity 信号对用户自主性的影响也需要持续监测。11
前沿见解:推荐系统的增量价值越来越依赖随机试验和在线约束,离线最高分很难直接变成生产收益。

Benchmark

12. CorporateBench:企业问答终于被推到二十六万份文档规模 原文

信号源: Epiq AI Labs、康奈尔大学
认知提取
企业知识问答最难的地方,往往不是找到一封相关邮件,而是把几十天里不同人的说法拼成同一条时间线。CorporateBench 先生成一个持续变化的知识库,再把知识库序列化成企业邮件,因此问题的答案可以回溯到一致的事实源。模型一旦面对真实企业级规模,关系抽取和时序推理会明显退化。
论文摘要
• CorporateBench 模拟四家公司:十二人、 一百二十二人、一千一百一十人和一万零二百一十人,总文档数为二十六万三千四百六十六。12
• 评测包括信息抽取和知识库查询,五个模型为 Claude Haiku 4.5、Claude Sonnet 4.5、GPT-5 Nano、GPT-5.1 和 Gemini 2.5 Flash Lite。12
CorporateBench 与既有基准对比
CorporateBench 的文档/问题比为八十七点六,最接近的既有基准为一点五,问题需要跨越更多文档整合证据。12
核心方法
• 论文先生成公司层级、九十天工作任务、六类会议和季度末组织变化,再用 N-Quads 保存实体与关系;邮件正文由 Claude Haiku 4.5 根据证据字符串生成。12
• 知识库包含 MemberOf、ReportsTo、WorksOn、WorksAt、Attends、Organize、BelongsTo 七类关系;三千二百一十七条证据字符串按时间阶段和显式/隐式难度分层。
CorporateBench 合成公司知识网络
合成公司由组织树、员工、项目、会议和任务组成,知识库提供了跨邮件保持逻辑一致性的事实底座。12
实验成果
• 实体抽取 F1 在不同规模保持零点七一五至零点八二四;关系抽取 F1 从小规模的零点四一九至零点八四五下降到超大规模的零点二零五至零点四九四。12
• 时序关系最难,F1 从小规模的零点一四二至零点四七零下降到超大规模的零点零六二至零点一七三。12
• 在知识库问答中,KB 方法相对 RAG 的优势从小规模的零点二四扩大到超大规模的零点三七;Haiku 4.5 的 KB QA 从零点七零二降到零点五九七。12
• 一千次人工判断中,正确识别关系的比例为百分之七十六点二;这说明基准的可读性得到部分验证,但仍不能代替真实企业数据验证。12
总结与反思
结果总结:CorporateBench 把长上下文评测从“能不能找到 needle”推进到“能不能维护跨文档、跨时间的企业事实”。
局限性:语料只模拟邮件和九十天组织变化,文档由 LLM 生成,可能带来稳定的写作风格偏差;作者把它定位为困难下限。12
前沿见解:企业 Agent 的真正压力测试,可能要同时测检索覆盖、关系抽取、时间更新和跨文档一致性,单一长上下文分数远远不够。

阅读优先级

第一优先级是 WikiSkill、PACE 和 CorporateBench:三篇分别触及 Agent 经验如何留下、视觉推理如何降成本、企业知识如何在真实规模下失效,工程复现路径清楚,指标也较完整。
第二优先级是 CLAP、LeVJEPA、STEP 和 Audio Twin:它们都在建立中间表示,但 CLAP 的物理幻觉、LeVJEPA 的运动理解、STEP 的延迟和 Audio Twin 的证据提取,仍需要更大规模验证。
MAELLE、RedEvoAgent、Stageboost 和道德知识论文更适合带着问题精读:前者关注机制与分布外可靠性,RedEvoAgent 关注安全评估的经验归因,Stageboost 关注线上增量是否能穿过延迟和显著性门槛,道德知识论文则提醒读者把“可探测”与“真正理解”分开。

Fuentes de referencia

  1. 1
  2. 2
    CLAP 原文

    arxiv.org

  3. 3
  4. 4
    MAELLE 原文

    arxiv.org

  5. 5
  6. 6
    NPO 原文

    arxiv.org

  7. 7
  8. 8
    STEP 原文

    arxiv.org

  9. 9
    PACE 原文

    arxiv.org

  10. 10
  11. 11
  12. 12

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado