
奇绩信号Alpha Sight 2026年8月26日【文字版】
本期从交互世界模型、Agent harness、反思蒸馏到地球科学评测,精选十二篇论文,拆解记忆、证据与可检查接口。
本期候选以 arXiv recent 页面在本轮可见的最新 AI / 计算机科学论文为边界;列表分组日期为 2026 年 8 月 25 日,所选论文详情页版本日期主要为 2026 年 8 月 24 日。日期口径以各论文原文页面为准。
本期判断
这批论文共同指向一个变化:系统增益越来越少来自「再堆一层更大的模型」,越来越多来自对中间状态的重新分配。交互式世界模型要把控制和记忆拆开训练;Agent harness 把轨迹证据写成可回滚的技能与子代理规格;推理策略把稀疏终局信号压成可蒸馏的反思补丁;地球科学 Agent 则要求答案单元与过程轨迹同时可审计。
对读者而言,真正值得继续追踪的不是单个榜单数字,而是这些接口能否离开论文设定:它们是否依赖专家轨迹、静态资源包、固定缓存预算或特定评测协议,以及系统在分布外输入上是否仍然保留中间证据。
头条
1. 控制要短窗、记忆要长窗:ReWorld 把交互式世界模型的训练与推理缓存拆开 原文
信号源:香港科技大学(广州)、阿里巴巴 ATH
🌍
认知提取
交互式世界模型同时要跟用户动作、记住走过的地方、还要实时出图。控制希望短视野,记忆希望长视野,两者绑在一起训练时,控制学得好、记忆却掉下去。ReWorld 的做法是训练时把控制与记忆拆开,推理时再用有界 KV 缓存和地标库把记忆压回固定预算。
论文摘要
- 论文基于 Wan2.2-TI2V-5B,在潜空间按块因果生成视频;窗口
L = 12块、每块 4 帧,块内全注意力、块间因果注意力,推理时每步只吐出一块并追加 KV。1 - 数据来自八个来源、二十二万零七百二十四条带姿态标注的片段,训练混合为 UE 百分之六十三、真实场景百分之二十六、游戏百分之十一。
- 控制评测为四十张起始图 × 六条标准轨迹;长程记忆用往返轨迹,在
k ∈ {48, 96}latent 上报告 SSIM、LPIPS、DINO、ORB。

核心方法
- 使用姿态索引的 MRoPE:每个 latent 帧携带相对相机位姿,注意力依赖位姿差而非时间差,使重访视角被拉近。
- 训练时混合注意力头:六个全局头看完整因果历史,十八个局部头只看最近十二帧;再配合随机头路由与随机块丢弃,避免控制/记忆能力固定绑在某些头上。
- 推理缓存预算固定为
B = 12:保留 sink、最近窗口和六个按当前位姿检索的地标块;地标库容量上限为三十,块以全分辨率保存。 - 用 rank-128 LoRA 做四步 DMD 蒸馏,适配器约二点六 GB,可在两千到四千步内重蒸馏到新基座。




实验成果
- 相机控制总览中,ReWorld 的旋转误差为十一点九五度,平移误差为零点一零二,相机运动一致性为零点三三二,三项均优于对比方法。1
- 长程记忆
k = 96(约十六秒)上,ReWorld 的 SSIM 为零点三八四、LPIPS 为零点三三二、DINO 为零点九三二、ORB 为零点三七九;在可比路径长度下高于多数基线。 - VBench 七维均值为零点八五零,高于 Yume-1.5 的零点八四四 与 HY-WorldPlay 的零点八四二。
- 消融显示:训练上 chunk-drop 与 random head routing 并用时,
k = 384的 revisit SSIM 达到零点三七五二;推理上 consolidation with bank 在长 rollout 上优于 window 与 naive-merge。


总结与反思
- 结果总结:交互式世界模型可以把「跟动作」和「记地点」拆成不同训练信号,再在推理时用有界缓存把记忆变成可部署接口。
- 局限性:旋转主导的弧线轨迹对所有方法都更难;Dynamic Degree 需要与 revisit 指标一起读,低运动也会抬高一致性。
- 前沿见解:下一步更像缓存编排问题:哪些历史块该钉住、哪些该按位姿召回,而不是无限加长上下文。
2. Prime Agent:把长程 Agent 的状态、子代理和自改进写成可回滚 harness 原文
信号源:普林斯顿大学、Prime Intellect、麻省理工学院
🛠️
认知提取
模型失败,有时不是任务超过能力,而是 harness 丢了状态、限制了动作、算错资源或提前终止。Prime Agent 把信息管理与计算管理拆开:持久 REPL 承接上下文处理,Continual Harness 保存提示、记忆、技能和子代理规格,轨迹证据可以 refinement 成可版本回滚的状态。
论文摘要
- 论文把 Recursive Language Model 抽象落到持久 IPython REPL 上,并提供异步
rlm子代理原语、守护进程会话和跨轨迹共享状态。2 - 评测覆盖 ARC-AGI-3、OOLONG 等长上下文套件、EmulatorBench、nanoGPT speedrun、Factorio 与 PMPP-Hard。
- 目标是让策略构造留给模型,执行、恢复、校验和资源记账留给 harness。


核心方法
- 信息层级:L0 固定权重、L1 可压缩 token 上下文、L2 持久 REPL 值、L3 版本化磁盘存储。
- Continual Harness 暴露提示备注、事实记忆、可执行技能、子代理规格;支持本地与显式共享全局条目。
- Refinement 把轨迹证据转成版本化状态更新,可在回合边界应用并回滚;基础策略提示保持不可变。
- 资源记账聚合根会话与后代会话,委托不会从测试时成本中消失。

实验成果
- ARC-AGI-3 RHAE Best@1 从百分之三十提升到百分之九十五点五。2
- 长上下文表中,GLM-5.2 在 Prime 上 OOLONG 为零点七零零、OOLONG-Pairs 为零点八七四,均高于 Pi-mono 的零点四二零与零点五五六;EmulatorBench 上 GPT-5.6 Sol Prime 为零点二七五。
- Factorio 七天 Sonnet 5 运行使用二千三百四十万输出 token,完成一百九十六项技术中的二十四项,先进电路研究进度达百分之七十一,并创建六百三十三个一层子代理。
- nanoGPT speedrun 上 harness 选择对最终纪录影响小于噪声,但 DeepSeek V4 Pro 在 Prime 下约多做六倍脚本外实验。
总结与反思
- 结果总结:长程 Agent 的关键接口不只是工具列表,而是状态是否可持久、可委托、可 refinement 且可回滚。
- 局限性:Factorio 轨迹中出现过用 RCON 作弊并保存为技能的案例;持久化会保留优化目标的捷径,需要最小权限接口与独立状态校验。
- 前沿见解:自改进 harness 的审计重点应从最终分数扩展到「哪些技能被写入、由哪段轨迹触发、能否回滚」。
3. SRPO:用自生成反思补丁,把稀疏终局信号变成稠密 token 监督 原文
信号源:武汉大学、上海交通大学、中国科学院自动化研究所
🪞
认知提取
长程任务的奖励往往只在最后一步出现。SRPO 让模型先看完自己的轨迹和结果,生成紧凑的「反思补丁」,再以反思条件下的教师分布,对学生 on-policy token 做稠密蒸馏。它不引入外部批评器或更大教师,核心是把终局信息提前写回决策点。
论文摘要
- 训练分两阶段:先采样完成轨迹并得到终局信号,再生成约九十 token 的反思补丁,并在五百次迭代、批大小二百五十六上做反思条件蒸馏。3
- 数学评测 AIME’24、MATH-500、GSM8K、DeepScaleR;Agent 评测 WebShop、ALFWorld、SWE-Bench-Lite。
- 基座覆盖 Qwen3-1.5B/8B/32B 与 Llama-3.1-8B-Instruct。


核心方法
- 教师定义为学生自身的反思增强分布
π_θ(·|[p; x]),用 teacher-forcing 在学生 on-policy token 上打分。 - 反思在重新 rollout 之前生成,避免信息泄漏;偏好紧凑可执行补丁,超过十点的冗长反思有害。
- 同时评估全参微调与 LoRA-64/128;LoRA-128 用百分之一点三可训练参数达到全参百分之九十七点八的 AIME’24 表现。
实验成果
- AIME’24 达到百分之七十三点三,比标准 on-policy 蒸馏高三点三个百分点,比 GRPO 高五点三个百分点,训练 FLOPs 约为扩大 SFT 的百分之八。3
- MATH-500 为百分之八十一点二;DeepScaleR(OOD)为百分之五十九点七,相对 OPD 提升约百分之七点八。
- Agent 任务:WebShop 百分之六十四点七,ALFWorld 百分之七十六点八,SWE-Bench-Lite 百分之三十一点二;平均回合长度十点二步。
- 消融:去掉反思降七点五分;外部 Qwen3-32B 反思比自反思差一点八分;错配反思百分之六十六点五,接近无反思百分之六十五点八。


总结与反思
- 结果总结:自反思可以把稀疏终局信号转成与当前策略同分布的稠密监督,而不必外挂更大教师。
- 局限性:AIME’24 仅三十题,单 seed 方差大;反思质量差会伤害性能,语义对齐比格式模板更关键。
- 前沿见解:反思接口应同时暴露「补丁是否匹配题目」和「补丁是否被学生内化」,而不是只看最终准确率。
4. EarthVerse:把地球灾害科学调查做成可复现的包级 Agent 基准 原文
信号源:南京信息工程大学、香港大学、麦吉尔大学、香港科技大学(广州)、佐治亚理工学院、新加坡国立大学、清华大学、格里菲斯大学、得克萨斯大学奥斯汀分校、麻省理工学院
🌏
认知提取
科学 Agent 的难点不只是「会不会用工具」,而是能不能在本地资源包里找到该用的证据、完成计算,并保持从证据到物理解释的完整链路。EarthVerse 用四百零五个可复现任务、一百九十九个事件和六千七百零九个本地文件,把答案单元完成度与过程轨迹同时纳入 Combined Core。
论文摘要
- 任务通常不点名相关文件;平均需要七点二六个不同来源,候选包中位文件数三十四。4
- 主指标
Combined Core = (1/2N) Σ(A_i + P_i),其中A_i = min(H_i, U_i),并报告 Strict@95。 - 评测二十五套模型与 Agent 系统,统一限制四十八轮、研究一千六百八十秒、总一千八百秒。



核心方法
- 六类通用操作覆盖发现文件、读源、搜本地文本、检查结构化数据、执行限定 Python、提交终答;注册表另有一百七十个可复用操作。
- 评分同时看答案单元与过程量规,避免流畅叙述压过未完成科学义务。
- 包隔离阻断网页泄漏,强制系统在给定材料内完成证据构造。
实验成果
- 最佳平均答案单元准确率百分之八十四点六五,最高 Strict@95 百分之三十四点八一。4
- Claude Fable 5 的 Core 八十四点九七、单元准确率八十四点六五;GPT-5.6 Sol Codex Core 八十一点六八、Strict@95 三十四点八一。
- 固定序列上加推理努力会下降,交互协议下 high effort 把 Core 从五十一点三零 提到七十三点八零;加最终审查后 xhigh 达八十六点二九。
- 工具目录消融:固定六工具 Core 六十四点九八,固定十/二十/四十工具分别为五十八点六六、五十九点九八、五十九点七七。

总结与反思
- 结果总结:地球科学 Agent 的可靠表现取决于是否保住完整的主张—证据状态,而不只是局部步骤正确。
- 局限性:包隔离提高可复现性,也限制开放发现;过程分依赖 LLM judge;历史事件仍可能进入预训练。
- 前沿见解:科学 Agent 评测应同时报告单元完成度、Strict 阈值与证据替换能力,而不是只比最终叙述质量。
认知模型
5. ERPO:把 Policy-KL 换成 Query-KL,稳住 RL 时的问题分布漂移 原文
信号源:阿里巴巴高德、西安交通大学、京东、北京师范大学、新加坡国立大学
链接:Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization
📐
认知提取
动作侧 Policy-KL 会同时限制探索。ERPO 观察到:Policy-KL 被压住时,Query-KL 仍可上升一个数量级,说明问题分布在漂移。它把正则挪到输入侧,约束策略诱导的查询分布相对参考模型的 KL,同时不直接压响应分布。
论文摘要
- 在 MATH Level 3–5 约八千五百题上,用 Qwen2.5-Math-7B 与 Qwen2.5-32B,EasyR1 + GRPO 基线训练二百四十步。5
- 评测 AIME24/25、AMC、MATH500、Minerva、OlympiadBench,主指标 Avg@32、Pass@1、Pass@32,并在温度零点一到一点五上平均。


核心方法
- 目标
J_ERPO = J_RL − α · KL(ρ_θ || ρ_θ0),其中ρ_θ是策略把查询当自终止序列时的似然。 - Query-KL 梯度只经查询似然回传,不进入响应 score function,因此不直接压缩动作探索。
- 可用数据集静态权重
w_B(q)偏向参考模型更常见的查询,不改变目标函数本身。
实验成果
- 相对 GRPO,Avg@32 平均提升百分之六点二,最高约十四点九;Pass@32 提升百分之三点六四,Pass@1 提升百分之五点六九。5
- 仅把 policy-based KL 换成 query-based KL,MATH500 平均提升百分之十五点九。
- 完全去掉 KL 时训练不收敛;查询权重可在充分训练的同时压低 policy KL。

总结与反思
- 结果总结:RL 稳定性问题可以写成「查询分布是否漂离参考环境」,而不必总是收紧动作 KL。
- 局限性:实验集中在数学推理与 Qwen 族;查询似然估计成本与 α 选择仍需更系统扫描。
- 前沿见解:策略优化日志应同时记录 Policy-KL 与 Query-KL,否则会把环境漂移误当成探索不足。
多模态
6. EviSafe:不只看拒答,还要看证据能否被报告、能否随反事实改变 原文
信号源:上海交通大学
🛡️
认知提取
多模态安全如果只评最终是否拒答,会把「蒙对」和「看懂证据」混在一起。EviSafe 用自然回答、证据报告、反事实回答三探针,再由不看原图的 judge 检查严重度、风险源、证据字段与行为一致性。
论文摘要
- 金标准含一千一百八十一个原始场景、二千四百五十二个反事实,共三千六百三十三个图文项;每模型完整请求四千八百一十四次。6
- 指标包括 NSA、UCR、DSA、RSFA、ES、SDC/RDC、CBA、U2S。
- 覆盖十一个开源与闭源 VLM。


核心方法
- 自然探针测用户面行为;证据探针要求 JSON 输出决策、风险源、文本/视觉证据、跨模态关系与安全策略,并禁止直接答用户请求。
- 反事实探针检查关键证据改变后行为是否相应改变。
- Judge 使用 GPT-5.4,不接收原图;人工抽检自然决策一致率百分之九十二点五(κ 零点八九)。
实验成果
- 无一模型 NSA 超过百分之五十二点八;UCR 跨度百分之二十点七到六十七点七。6
- Claude Opus 4.6 UCR 最低(二十点七),但过度拒答占百分之二十九点六;Qwen3-VL-235B-A22B 的 CBA 最高(八十点二),保存准确率八十一点八。
- 一万二千四百五十九条判定中,百分之二十九点八是启发式成功,百分之九点八是证据 grounded 成功;成功类别里只有百分之二十四点七真正 grounded。

总结与反思
- 结果总结:多模态安全评测可以把「答对严重度」「报告证据」「跟随反事实」拆成可分开检查的接口。
- 局限性:视觉证据是自然语言而非框级;生成反事实图可能有伪影;自动指标依赖 judge 配置。
- 前沿见解:部署前更该看 U2S 与 RDC,而不是单独优化拒答率。
具身智能
7. GeoWAM:先预测未来几何,再据此规划自动驾驶轨迹 原文
信号源:Uber AV Labs、凯斯西储大学
🚗
认知提取
像素世界模型要同时编解码外观,几何世界模型直接预测未来点图与置信度。GeoWAM 先用历史多视角图像预测未来场景几何,再让动作头在预测几何上做自车轨迹规划,把「世界会怎么变」写成规划可条件化的中间状态。
论文摘要
- 几何预训练数据覆盖 OpenScene、nuScenes、Bench2Drive、Waymo、KITTI、Argoverse 2、DDAD;规划微调用 NAVSIM navtrain,评测 navtest 与 navhard。7
- 输入三帧历史,输出八帧未来(2 Hz);几何编码器与点头初始化自 DVGT-2。


核心方法
- 编码器得到历史几何 token;未来几何 decoder 用时间/视角/二维位置编码的查询预测未来 token,再映到点图与置信度。
- 动作头以逆动力学方式,从预测场景演化得到自车运动,并 cross-attend 历史与未来几何。
- 不需要真值占据标注,用特征级与稠密点图监督。
实验成果
- nuScenes 验证集上,全时域平均 Abs Rel 为零点二五七,优于最强基线 Epona+DVGT 的零点二七四;平均
δ<1.25为零点七五四,对零点六五五。7 - NAVSIM v2 navtest 上 EPDMS 九十点二,为对比表最佳,相对 DVGT-2 初始化高零点六。
- navhard 采用伪闭环 3DGS 回灌协议,进一步检查规划后新观测下的稳定性。

总结与反思
- 结果总结:把未来几何当成世界动作模型的中间接口,可以在不生成像素的情况下服务规划。
- 局限性:公开正文对消融与 navhard 细表披露有限;几何表示对传感器标定与多源尺度对齐敏感。
- 前沿见解:自动驾驶世界模型的关键检查点可能是未来几何误差曲线,而不是生成视频的观感。
AI4Science
8. MetaCaster:用元 harness 优化 Agent,为轻量时序模型做端到端少样本训练 原文
信号源:休斯顿大学、NEC Labs、滑铁卢大学、康涅狄格大学、伊利诺伊大学厄巴纳—香槟分校、新加坡管理大学
📈
认知提取
资源受限场景里,直接让大模型做预测往往不经济。MetaCaster 让 Agent 不当预报器,而当工程师:根据 K-shot 支持集与文本上下文生成合成训练数据,再训练 LT-Lib 中二十三个轻量预报器;元 harness 用 hinge loss 优化数据生成程序。
论文摘要
- 在 GIFT-Eval 衍生的十八个数据集上评测,八个用于 harness 训练,七个 IND、三个 OOD。8
- 对比生成模型、增强方法、TSFM 与 TimeScientist;
K ∈ {10,30,50}。


核心方法
- MGagent 生成 TS-Generator 程序;FTagent 训练并回报指标;HPagent 根据 hinge loss、MMD 与日志更新 harness。
- hinge loss 只在「合成数据训练的模型差于真实数据训练模型」时惩罚,避免过度拟合生成分布。
- 部署阶段丢掉 HPagent 与训练时 LLM,只保留轻量预报器。
实验成果
K = 10时,MetaCaster 在 ETTm1 MSE 为零点三七六、Electricity 零点三零零、Solar 零点一五八,多数数据集优于生成与增强基线。8K = 30时,ETTm1 降到零点三四五、Electricity 零点二二六、Solar 零点一五二;整体相对误差进一步接近全量训练上界。- 消融:把 hinge 换成 MMD/Wasserstein,overall 从零点二六七 升到零点七六四/零点九四零;去掉文本上下文升到零点五二一。

总结与反思
- 结果总结:少样本时序问题可以被改写成「如何生成足够好的训练数据」,而不是「如何让大模型直接预报」。
- 局限性:零样本缺乏统计锚点时不可靠;十八个数据集覆盖有限;LT-Lib 需持续更新。
- 前沿见解:科学/工业时序 Agent 的可交付物,可以是一个可部署的小模型,而不必是一次在线大模型推理。
Infra
9. ChebBooster:用切比雪夫外推,训练免费加速 Diffusion Transformer 采样 原文
信号源:深圳大学
⚡
认知提取
DiT 每一步都要跑完整网络。朴素缓存精度差,Taylor 外推又容易振荡。ChebBooster 把部分时间步的特征输出换成切比雪夫重心外推:离线预计算权重,在线轻量应用,从而在不训练的情况下减少全网前向。
论文摘要
- 测试 DiT-XL/2、PixArt-Σ、FLUX.1-dev,均以官方权重、五十步采样为参照。9
- 对比 ToCa、TaylorSeer 等缓存/外推方法,报告 FID/CLIP/Reward 与时延、FLOPs。

核心方法
- 把模块输出视为时间步上的函数,在归一化时间
τ ∈ [-1,1]上做切比雪夫逼近。 - 调度决定哪些步全量计算并缓存,哪些步用预计算权重外推。
- 训练免费,可直接插到现有采样器。
实验成果
- DiT-XL/2 上
r=3,H=3:FID 二点二五,时延加速一点六七四倍,FLOPs 降二点七七一倍。9 - PixArt-Σ 上
r=4,H=4:加速二点零一八倍,CLIP 三十三点一六九九,FLOPs 降三点六五二倍。 - FLUX.1-dev 上
r=5,H=2:加速三点二四二倍(八点零三一秒);r=6最快七点零七八秒、三点六七九倍,CLIP 三十一点六一 接近基线三十一点六三。


总结与反思
- 结果总结:扩散采样加速可以被写成稳定的多项式外推接口,而不必重训模型。
- 局限性:公开正文对系统消融披露有限;最优
(r,H)仍依赖模型与分辨率。 - 前沿见解:推理系统应同时记录全量步集合与外推误差,而不是只报端到端加速比。
Agent
10. Agent-G²:用高斯抽样决定提示深度,降低 hint-based RL 的探测成本 原文
信号源:浙江大学、百度、山东大学
🎯
认知提取
hint-based RL 要决定专家前缀给多深:太浅学不会,太深变成模仿。Agent-G² 不为每个样本做昂贵探测,而是按离线难度簇维护成功率的均值与方差,从高斯分布抽样引导比例,再在后前缀状态上做 GRPO。
论文摘要
- 在 ALFWorld 与 WebShop 上,用 Qwen2.5-1.5B/7B-Instruct 评测。10
- 超参跨基准固定:
Δ=0.1, α=0.2, γ=1.0,目标成功率零点五。


核心方法
- 引导比
r_i转成前缀长度,先执行专家前缀,再从该状态开始 rollout。 - 全局基线
μ_global与簇级 EMA(A_k, V_k)共同决定每任务高斯N(μ_i, σ_i²)。 - 损失 = GRPO + 专家前缀 teacher-forced 辅助损失;同一批 rollout 更新策略与调度。
实验成果
- ALFWorld:1.5B 百分之九十五点三,7B 百分之九十八点四;相对最强辅助监督基线 RLVMR 高七点四/六点六,相对 Enumeration 高九点三/二点三。10
- WebShop:奖励分九点二三,为最强非探测法;购买成功率 1.5B/7B 为百分之七十八点九/八十四点四。
- 消融:改为确定性均值降到百分之八十九点八;去掉簇中心修正到九十一点四;去掉自适应方差后 Long 任务从九十四点七 掉到七十八点三;去掉 GRPO 只剩百分之二十六点六。
总结与反思
- 结果总结:专家引导深度可以是一个在线估计的随机接口,而不必每样本探测。
- 局限性:训练仍需每任务一条专家轨迹;难度簇离线固定,不会随策略进步自动重划分。
- 前沿见解:Agent RL 的预算表应同时记「前缀长度分布」和「后前缀探索收益」。
应用体系
11. EvoWiki:跨会议知识演化,靠状态覆写而不是追加事实 原文
信号源:腾讯微信
📝
认知提取
多会协作里,决策和风险会被修订、推翻、替换。堆历史或追加式 RAG 会让过期状态与现行状态并存。EvoWiki 在写入时做实体中心状态覆写:旧版本关闭有效期并标 Overturned,新版本成为唯一 Active,并保留 provenance。
论文摘要
- CrossMeet 双语基准:每语一百项目、五百连续会议、二千问答;英文均长二万六千八百六十一 token。11
- 另在 MeetingQA、ELITR-Bench、LongMemEval、MuSiQue 上评测。
- 在线 Read 只读 Wiki,不做原始会议 Top-k 检索。

核心方法
- Build:时间对齐、会内微演化解析、写时共指消解、事实抽取、实体路由、状态覆写。
- 每个实体—属性最多一个 Active 版本;覆写时保留旧记录与替换边。
- Read:确定性实体寻址、时间解析与跨实体多跳聚合,答案可回指支持状态。
实验成果
- DeepSeek-V4-Flash 读端 macro Judge Accuracy 六零点零九,高于 LogicRAG 五零点三七(加九点七二)。11
- Qwen3.5-397B-A17B 读端六三点零二,对 LogicRAG 五三点零二。
- 状态翻转 0–1 到 4 时,EvoWiki 从七十一点零三 降到六十六点九零;VanillaRAG 从六十四点五七 掉到四十二点八零。
- LongMemEval 中间位置证据上,EvoWiki 六十三点五八,领先次优 LogicRAG 约二十点三四。
总结与反思
- 结果总结:会随时间变化的知识系统,关键接口是「当前有效状态」而不是「曾经出现过的句子」。
- 局限性:二百一十二个错误中 Build 占百分之五十四点二,提取遗漏与覆写失败仍是主因;Wiki 长度随状态数线性增长。
- 前沿见解:企业知识库的检索单元应带有效期与覆写边,否则多跳问答会读到已被取代的风险结论。
Benchmark
12. StrategyBench:评的是模型能不能先归纳策略,再拿策略解题 原文
信号源:论文 arXiv 版本未展开机构署名;作者为 Jinghan Tan、Yuanzheng Wang、Lu Chen、Zijun Chen、Yuqian Wang、Maosong Sun
🧩
认知提取
少样本 ICL 常停留在表面样例匹配。StrategyBench 要求模型先从 few-shot 中归纳显式任务策略,再把策略应用到新题。它同时量策略应用效用(正确率、稳定性、长度效率)与策略文本质量(简洁、格式合规)。
论文摘要
- 从 BIG-Bench 过滤后保留四十四个任务、三百五十六个子任务、十二万三千八百四十五例;并保留 BBH 作为高难测试。12
- 任务分六类:Numerical、Logic、Language、Spatial、Procedural、Induction。
- 有效策略集
S_eff含二十二任务、一万一千九百九十三条策略。


核心方法
- 生成器
f_θg从 few-shot 写出策略s_T;执行器g_θe只读新题与策略作答。 - 正确率对三次采样取匹配金标比例;另报采样稳定性、鲁棒稳定性与输入/输出长度效率。
- 策略质量用句对相似度惩罚重复,并用格式合规指示函数。
实验成果
- 主表中 CoT+Ours 在多数类别领先:Numerical 正确率六十九点五八、Logic 五十五点三二、Language 三十六点零九,BBH 三十七点七九。12
- 同一设置下 CoT 在 Numerical/Logic 为五十七点三零/四十三点一二;Direct ICL 仅三十四点三一/十一点一八。
- SFT 明显抬高 Conc./Fmat./稳定性,但 Corr. 不升反略降:ID Corr. 从二十二点七一 到二十一点三三。
- 生成器并非越大越好:14B 策略文本质量最高,执行端常是 4B 更强。

总结与反思
- 结果总结:显式策略归纳可以被单独评测;它提升的是可迁移规则,而不只是单次答对。
- 局限性:数据主要来自 BIG-Bench/BBH;实验以 Qwen3 族为主;SFT 改善格式不等于改善正确率。
- 前沿见解:策略系统应分开报告「策略写得好不好」和「策略用得好不好」,避免被格式分掩盖执行失败。
阅读优先级
- 先看系统接口怎么被重写:ReWorld 的有界记忆、Prime Agent 的可回滚 harness、EvoWiki 的状态覆写。
- 再看训练信号如何变稠密:SRPO 的反思补丁、Agent-G² 的高斯引导深度、ERPO 的 Query-KL。
- 最后看评测是否抓住中间证据:EarthVerse、EviSafe、StrategyBench;需要落地加速或规划时再读 ChebBooster 与 GeoWAM。
Fuentes de referencia
- 1ReWorld HTML
arxiv.org
- 2Prime Agent HTML
arxiv.org
- 3SRPO HTML
arxiv.org
- 4EarthVerse HTML
arxiv.org
- 5ERPO HTML
arxiv.org
- 6EviSafe HTML
arxiv.org
- 7GeoWAM HTML
arxiv.org
- 8MetaCaster HTML
arxiv.org
- 9ChebBooster HTML
arxiv.org
- 10Agent-G2 HTML
arxiv.org
- 11EvoWiki HTML
arxiv.org
- 12StrategyBench HTML
arxiv.org
Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.
