
8月11日论文雷达:36篇直接命中、3篇邻近,先看失败如何变技能
从8月11日人工智能栏目筛出36篇直接命中与3篇邻近工作,重点比较失败轨迹蒸馏、技能门控、长程恢复、因果归因与安全回滚。
截至 8 月 13 日 19:00,8.11 批次的允许栏目中仅见「人工智能学术速递」上线,NLP 与语音栏目尚未见发布。因此本期只筛这一栏的 223 篇条目:36 篇直接命中、3 篇邻近跟踪,另有 1 篇边界项排除,不把统计学栏目纳入候选池。阅读主线围绕长程任务训练与评估、轨迹学习、自进化、技能生命周期、记忆治理、验证成本与安全防护展开。
如果只读 8 篇
| 顺序 | 原题 | 重点读什么 | 判定 |
|---|---|---|---|
| 1 | Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills | 失败轨迹怎样被离线蒸馏成可复用技能,且不更新权重 | 精读 |
| 2 | FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents | 持续失败如何转成训练信号并内化到代码智能体 | 精读 |
| 3 | Branch2Skill: Efficient Skill Evolution Through Reasoning Trees | 推理树如何变成稠密技能更新证据,降低 token 成本 | 精读 |
| 4 | OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks | 在线/离线自进化如何做门控、回滚和版本发布 | 精读 |
| 5 | SHE: Trajectory-driven Safety Harness Evolution for LLM Agents | 安全 harness 如何按轨迹归因局部进化 | 精读 |
| 6 | Controlled Memory Interference in Continual LLM Agents | 记忆的干扰、更新权威性与投毒边界 | 精读 |
| 7 | Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents | 哪一阶段剪枝最省 token,又不把验证当成剪枝 | 精读 |
| 8 | Agentic Auto-Research is Fuzz Testing | 研究代理为何应把中间进展信号当作 fuzzing 覆盖率 | 邻近跟踪 |
上面 8 篇不是横向排行榜,只是最能改变训练、路由、执行、验证决策的阅读优先级。
一、36 篇直接命中
1. Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.07885
- 研究问题:推理模式模型在 agentic 任务上更强,但每次 episode 要付出重复的输出 token;能否把这种推理溢价一次性蒸馏成可复用 skill。
- 方法/训练流程:被动 skill distillation。先从训练 split 收集轨迹语料,再由 Claude Code + Claude Sonnet 5 对失败模式做统计,提炼成 40–130 行 markdown skill;skill 直接注入非推理模型 system prompt,不更新权重,不做额外 rollout。
- 基准与样本:ALFWorld、SpreadsheetBench-Verified、τ²-telecom 各 50 题,τ²-retail 35 题,均为 held-out 评测;GPT-5.4-mini 与 Qwen3.6-27B 每格运行 3 个种子。
- 关键结果:GPT-5.4-mini no-think+skill 在 ALFWorld 上 0.787,think 0.713、no-think 0.567;token 832 对 3,723。Qwen3.6-27B 在 ALFWorld 上 0.980,think 0.773、no-think 0.827;token 少 14.9×。与 GEPA 比较,retail 45.8% 对 39.2%,telecom 32.5% 对 30.8%,生产成本 3.72 美元对 15.28 美元。
- 证据强弱:中强。
- 局限:只测 2 个模型和 4 个领域;蒸馏方差未测;跨模型迁移未测。
- 复现条件/代码:需训练轨迹、GPT-5.4-mini 或 Qwen3.6-27B,以及 Claude Code + Claude Sonnet 5 蒸馏环节;原文未报告代码或项目链接。
- 目标线关系:轨迹→可复用技能的被动蒸馏,回答「失败轨迹能否变成技能」这一最前端问题。
- 结论:精读。
2. FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08570
- 研究问题:RFT 会丢掉全部失败集,但失败轨迹本身最接近能力前沿,信息量最大;如何把持续失败转成训练信号。
- 方法/训练流程:五阶段流水线:naive RFT、诊断 agent 从失败轨迹与 gold patch 提炼四段式 method skill、leakage filtering、skill-guided re-rollout、剥除 skill 后做 NLL 微调内化。
- 基准与样本:SWE-Gym 的 2,401 个 Python 任务用于训练;SWE-bench Verified 500 题与 MultiLingual 用于评测。teacher 为 Kimi-K2.6 + OpenHands,student 为 Qwen3.5-4B/9B。
- 关键结果:SWE-bench Verified 4B 从 54.0 到 66.2;9B 从 63.6 到 67.2。MultiLingual 4B 从 52.3 到 55.7,9B 从 59.7 到 61.3。恢复了 218 条失败轨迹,约 26.2%。
- 证据强弱:强。
- 局限:无独立 Limitations 节;算力未报告。
- 复现条件/代码:需 SWE-Gym、OpenHands、Kimi-K2.6、Qwen3.5-4B/9B 与 GPT-5.4 judge;原文未报告公开代码。
- 目标线关系:完整的失败→技能→内化流水线,适合当「失败如何变技能」的主样本。
- 结论:精读。
3. Branch2Skill: Efficient Skill Evolution Through Reasoning Trees
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08677
- 研究问题:单条轨迹只给一个弱更新信号,早期错误会沿后续步骤传播;技能演化需要更稠密的证据。
- 方法/训练流程:每轮固定 skill,对训练问题建 PUCT 推理树;从成功终局路径与 sibling 对比证据里提取局部监督,交给 GPT-5.5 产出候选 skill,再由验证集门控接受或回滚。
- 基准与样本:覆盖 SearchQA、SpreadsheetBench、OfficeQA、DocVQA、LiveMathematicianBench、ALFWorld;默认每节点 3 个 children、深度 6、40 轮迭代,目标模型横跨 GPT-5.5/5.4/mini/nano 与 Qwen3.6-35B-A3B。
- 关键结果:30 个 setting 中 26 个 best/并列 best,平均 50.8→69.1,SkillOpt 为 66.0。六个 GPT-5.5 实验累计 141.3M tokens,对 SkillOpt 的 526.7M 少 73.2%。
- 证据强弱:强。
- 局限:部分 baseline 数字来自 SkillOpt 原文;无独立 Limitations 节。
- 复现条件/代码:需 GPT-5.5 作为 skill model、PUCT 搜索和独立验证集门控;原文仅说明代码将发布。
- 目标线关系:把推理树变成技能更新监督源,是长程轨迹里「局部证据→技能修订」的典型做法。
- 结论:精读。
4. Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.09555
- 研究问题:有技能库不代表会用技能;如何把技能利用过程本身变成可学习信号。
- 方法:用双视角自蒸馏+GRPO 强化外部技能利用,把 skill-bank 变成执行信号。
- 关键结果:Qwen2.5-7B 在 ALFWorld 上 83.6%,提升 3.1 点;Qwen2.5-3B 在 ALFWorld 上提升 5.4 点、WebShop 上提升 4.4 到 9.4 点。
- 证据强弱:中强。
- 局限:仅两个交互基准;无独立 Limitations 节;Meta-Skill 提取模型未明示。
- 目标线关系:强调显式技能不等于会用技能,属于技能利用能力路线。
- 结论:精读。
5. SkillReason: Reasoning-Enhanced Agent Skill Retrieval for Implicit User Requests
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08640
- 研究问题:真实用户请求常只给目标不给步骤,技能检索难,而现有基准对这类隐式请求覆盖有限。
- 方法:SkillReason-Bench 有 3,729 查询和 61,228 技能语料;Stage I 用 Claude Sonnet 4.6 生成能力推理轨迹,经过规则检查、去重和 DeepSeek-R1 过滤后重平衡为 30K 训练实例;Stage II 用检索引导 GRPO,每查询 8 次 rollout,并把查询改写成更隐式形式。
- 关键结果:SkillReason-0.6B 相对 Qwen3-Embedding-0.6B 在 Recall@10 平均提升 17.56 点;4B 管线在 5 个下游任务上成功率提升 14.66–25.03 个百分点。
- 证据强弱:中强。
- 局限:发布物缺失;训练和评测查询分布不同;隐式请求的人工改写可能带偏差。
- 目标线关系:把能力推理蒸馏进检索表示,是技能路由环节的核心方法。
- 结论:精读。
6. Emotion2Skill: Model-Internal Emotion Signals for Adaptive Skill Selection and Evolution
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.09248
- 研究问题:技能路由只看文本信号,没有利用模型内部状态;内部情绪表征是否能提供更稳定的选择与演化信号。
- 方法:从 residual stream 提取 27 维情绪状态,经编码器和 confidence-gated summary 注入路由 prompt;再用情绪轨迹突变检测做定向 SOP 重写。
- 关键结果:Qwen3-8B 在 WebShop 29.7%、ALFWorld 47.4%;Qwen3-14B 在 WebShop 30.7%、ALFWorld 52.3%。OOD 上 MATH 54.8→69.2%、MBPP 60.0→71.8%。
- 证据强弱:中强。
- 局限:情绪因果性仍是相关性论证,且更偏 Qwen 系。
- 目标线关系:把模型内部状态变成路由和演化信号,是技能编排里最跨层的一篇。
- 结论:精读。
7. Agentic Router: An Execution-Grounded Continual Learning Approach With Memory
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.09184
- 研究问题:CLI 运维里,语法可行不等于后果正确,必须靠执行反馈来持续学习。
- 方法:proposal 侧把成功/失败/恢复经验蒸馏成 operational lessons;selection 侧用真实 SSH 反馈做会话级 LoRA 更新;最终用效用-风险重排选动作。
- 关键结果:正文没有表格数字,只给图;但全框架在三种模型规模下 top-1 成功率都最高,140 轮内持续提升。
- 证据强弱:中弱。
- 局限:单环境、单固定请求序列,数值全在图里。
- 目标线关系:执行落地的持续学习样本,把设备后果写回模型。
- 结论:精读。
8. Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines?
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.09629
- 研究问题:当优化器本身已经很强时,任务专用的预设优化管线还必要吗。
- 方法:Open-Ended Optimization,把改进过程的组合交给 GPT-5.5 在线编排,并对照 SkillOpt 和 GEPA。
- 关键结果:OEO 对 SkillOpt 12 胜 1 平 1 负,对 GEPA 5 胜;中位只用了 SkillOpt 目标 token 预算的 34.3%。
- 证据强弱:中强。
- 局限:optimizer 只用了 GPT-5.5,属于能力敏感方法。
- 目标线关系:技能生命周期的元层问题:预设管线与开放编排的边界在哪里。
- 结论:精读。
9. GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.07905
- 研究问题:具身规划器会有物理幻觉、长程泛化差和环境感知缺失。
- 方法:任务图 + 场景图双图闭环;任务图既引导生成,也给外部验证器做迭代修正,还在 GRPO 中提供图奖励;场景图驱动事件型重规划。
- 关键结果:ALFRED unseen SR 68.52、GC 75.76;高层规划器长程 90.04%,同骨干 SFT 仅 20.57%。
- 证据强弱:中强。
- 局限:长程与新任务数据集自建,独立复现还不够。
- 目标线关系:长程规划的结构化样本,可用来对照 loop policy 和 replay 的设计。
- 结论:精读。
10. An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.07542
- 研究问题:LLM 驱动的自主研究循环会漂移,朝当前最优指标的局部修正收敛,而不是检验假设。
- 方法:不可变 experiment card、专职 subagent、以及把研究品味编码成知识图的 kkanbu oracle;双臂对照有/无 oracle。
- 关键结果:with-kkanbu 与 without-kkanbu 两臂都没有单向压倒性优势;最优训练策略反而来自无 oracle 臂;轨迹和速度过滤器类推理期技术也很强。
- 证据强弱:中强。
- 局限:单域纯仿真;臂与操作者混杂。
- 目标线关系:研究代理防漂移的结构性样本。
- 结论:精读。
11. OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.09380
- 研究问题:长程复杂任务中的 loop policy 被固定在单一上下文里,无法跨历史轨迹积累复用控制经验。
- 方法/训练流程:把 loop policy 视为可治理资产,分在线与离线两种演化模式。在线模式每轮只生成 1 个 challenger,经过 canary monitor 和任务边界激活后发布;离线模式从归档轨迹和失败证据里搜索多候选,多代保留非支配解。
- 基准与样本:YC-Bench 模拟经营一整年,使用 3 个官方种子;骨干为 deepseek-v4-flash 的 medium 配置。
- 关键结果:平均最终资金从 Native 518,158.46 到 OLE-online 878,601.79,再到 OLE-offline 974,627.52;成功率从 77.23%到 87.87%再到 91.80%;token 成本分别为 64.52M 与 59.63M。
- 证据强弱:受控模拟较强。
- 局限:单一基准、单一模型族,进化成本高,跨场景有效性未建立。
- 复现条件/代码:GitHub 仓库已报告;YC-Bench 与 deepseek-v4-flash。
- 目标线关系:长程循环自进化的正面样本,尤其适合作为在线/离线、门控、回滚的结构参考。
- 结论:精读。
12. Controlled Memory Interference in Continual LLM Agents
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.07622
- 研究问题:持续记忆不只是「存更多」,记忆之间会在状态、时效和权威性上相互干扰。
- 方法/训练流程:定义 L0–L6 记忆增长、关系组合和权威性探针;用 BM25 与稠密检索器做混合选择器,并用干扰样本增强训练。
- 基准与样本:覆盖 TravelPlanner、PERMA、LongMemEval、HorizonBench、MEME Tracking;包含噪声增长、关系组合和固定 L3 投毒实例。
- 关键结果:same-slot conflict 的塑性显著下降;固定 L3 投毒下权威性线索比 recency 更敏感;增强训练后 MEME Tracking 成功率从 0.314 升到 0.929,TravelPlanner 从 0.386 升到 0.686。
- 证据强弱:强。
- 局限:选择器只在数据集内训练;跨数据集迁移未宣称。
- 复现条件/代码:有官方 GitHub 仓库。
- 目标线关系:持续记忆、投毒和更新权威性线索,直接对上长程系统里的记忆面。
- 结论:精读。
13. Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08389
- 研究问题:长程研究 agent 的上下文迅速膨胀,但边际证据价值下降,导致 token、延迟和噪声一起上升。
- 方法/训练流程:阶段感知剪枝;分别在 Pre-Retrieval、Post-Retrieval、Pre-Synthesis 三个位置做边际价值估计,并比较 MMR、Novelty、DPP、Submodular Coverage 等策略。
- 基准与样本:从 DeepResearchGym 固定抽取 100 条查询,并补充 DeepResearch Bench;完整管线基于 GPT-Researcher。
- 关键结果:无剪枝基线 29.0 节点、375.4k tokens、3422.6s;Post-Retrieval MMR 可降到 114.6k tokens 和 8.84 节点;三阶段 MMR 到 100.1k tokens、7.82 节点。
- 证据强弱:受控对比完整。
- 局限:质量指标高度依赖 judge;剪枝不能替代验证。
- 复现条件/代码:GPT-Researcher + DeepResearchGym + Researchy Questions;原文未报告自有代码。
- 目标线关系:深度研究长程管线里,何时该停、何时该剪,是很实用的系统问题。
- 结论:精读。
14. TRACE-Memory: Public-Conditioned Retrieval and Utility-Aware Evidence Admission for Personalized Generation
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08446
- 研究问题:个性化生成里,语义相关的历史不一定该被用,必须看它有没有增量效用。
- 方法:两阶段选择性个性化:先生成公共条件查询,再在证据准入阶段决定保留紧凑子集还是 EMPTY 空集,EMPTY 即纯公共路径。
- 关键结果:六种固定生成器设置都优于 Random 和 BM25,四种设置优于 Semantic Similarity;32B 时与前沿管线的差距收敛到 0.00。
- 证据强弱:中强。
- 局限:依赖 DeepSeek-V4-Flash 构造训练信号,且无独立复现。
- 目标线关系:回答「何时不使用记忆」,与记忆写入/呈现边界直接相连。
- 结论:精读。
15. SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08055
- 研究问题:助手要记住当前为真,而不是记住曾经说过什么;扁平日志和普通 RAG 难以处理时效、溯源和时间顺序。
- 方法:把事实抽成带来源跨度的 FactEvent,落到时间图里,配合 SQLite、BM25+稠密索引和 planner-reader 循环。
- 关键结果:LongMemEval-S 500 题、约 115k token 历史下,准确率 92.8%,成本均值 0.00161 美元/题。
- 证据强弱:系统论文偏强。
- 局限:自评会削弱可比性,且是单 store-of-record 配置。
- 目标线关系:持续记忆的底座契约,强调证据锚定的时间知识图。
- 结论:值得扫读。
16. Mitigating Over-Personalization in LLMs via Structured Memory
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08300
- 研究问题:记忆注入上下文会导致跨域泄漏和记忆诱导谄媚。
- 方法:不改模型,只改记忆呈现结构:固定域分区、动态域分区和记忆树分区。
- 关键结果:动态分区相对扁平基线平均降低跨域泄漏 8.8%,同时 beneficial memory failure 也更稳。
- 证据强弱:中型受控实验。
- 局限:只限 PersistBench,sycophancy 仍几乎天花板。
- 目标线关系:记忆呈现层的安全干预样本。
- 结论:精读。
17. Janus: An Algorithm-Evaluator Co-Evolution Framework for LLM-Driven Discovery under Expensive Evaluation Budgets
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08189
- 研究问题:真实评估很贵,固定评估器会被搜索分布漂移和稀疏偏置标签拖垮。
- 方法:让 LLM 同时进化目标程序和可执行评估器,评估器以真实结果校准并随搜索共同进化。
- 关键结果:5 个域的 Calls@99% 均值减少 59.1%;NDCG@3 提升明显。
- 证据强弱:较强。
- 局限:评估器构造细节和基线对齐要看附录。
- 目标线关系:评估器协同进化,是「算法与评估一起变」的典型样本。
- 结论:精读。
18. PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08700
- 研究问题:工具路由评估常被长尾、硬负样本和未经验证的 LLM 标注污染。
- 方法:PCCF 两阶段闭环,先做执行落地标注,再做 capability/intent/boundary 分解。
- 关键结果:3,000 人工验证实例、54 插件、63 工具、9 域;Claude Opus 4.6 原分布 Recall 67.60%、Acc 68.17%;hard 实例上最优模型 Recall 仅 10.8%。
- 证据强弱:较强。
- 局限:裁判也是 LLM,自建自评属性明显。
- 目标线关系:函数调用归因的诊断基准,和长程系统的错误定位链条直接相关。
- 结论:精读。
19. AI Evaluation Should Measure Verification Cost, Not Correctness Alone
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08709
- 研究问题 / 立场:评估 AI 不能只看正确性,还要看预算内验证成本。
- 方法:提出 Verification-Cost Errors(VCE)和六步验证感知基准协议。
- 证据强弱:弱。
- 局限:纯概念论文,没有自有实证。
- 目标线关系:验证成本的理论骨架。
- 结论:值得扫读。
20. TRACE: TRajectory Attribution for Automated Context Engineering
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.09153
- 研究问题:生产 agent 的上下文源出错或缺失时,人工日志审查不可扩展。
- 方法:Detector、Root Cause、Recommender 三层回路,先做信号检测,再做 delta-guided 归因,最后主动探索并建议修复。
- 关键结果:75 条合成轨迹中,Root Cause node accuracy 72.7%,Recommender operation accuracy 96%,Fix effectiveness 82%。
- 证据强弱:中。
- 局限:真实生产泛化未验证。
- 目标线关系:轨迹归因和上下文修复,对长期 agent 很关键。
- 结论:精读。
21. Query-Only Backdoor Attacks on Self-Evolving Skills via Trajectory Poisoning
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08303
- 研究问题:自进化技能管线会把攻击者诱导出来的受损轨迹当作正常训练信号。
- 方法:TBA 三组件:反事实轨迹诱导、轨迹级策略外化、跨任务证据构建。
- 关键结果:SkillOpt 45.6、Trace2Skill 51.1;GPT-5.4/5.5 触发下 TASR 最高到 70.0–70.6。
- 证据强弱:强。
- 局限:无独立复现;不宣称通用适用。
- 目标线关系:轨迹投毒是自进化管线的攻击面核心证据。
- 结论:精读。
22. OBLIVION: Workflow-Level Operational Skill Unlearning for Deployed Agents
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08264
- 研究问题:技能从显式注册表移除后,agent 仍可能从 archives、transcripts、schemas、memory entries 里重建出来。
- 方法:AgentForgetBench + OBLIVION,做跨表面擦除、冻结工作流修复和 Anti-ReDerivation Guard。
- 关键结果:160 个 locked 案例、40 个 sandbox 案例、128 个 live rollout;locked 上 ASR 从 1.0 降到 0.114,效用保持 1.0;sandbox 上从 1.0 降到 0.2。
- 证据强弱:受控较强。
- 局限:仍有残余成功和效用权衡。
- 目标线关系:操作级撤销,是技能生命周期里最重要的防护问题之一。
- 结论:精读。
23. ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.09577
- 研究问题:技能供应链里,单一被投毒技能就能持续危害每个安装者,但现有攻击缺少条件式、低成本、单技能后门。
- 方法:把规则 R 写进 Skill.md、触发器 T 写进用户查询,只在共现时触发;用遗传搜索进化 T,再按 lower confidence bound 选终方案。
- 关键结果:12 个设定平均 ASR 89%,FPR 6%,ΔCAC 3%。
- 证据强弱:强。
- 局限:沙箱化实验,不是现实部署。
- 目标线关系:技能供应链攻击面,和 TBA 形成文档植入与轨迹投毒的两端。
- 结论:精读。
24. SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.09253
- 研究问题:agent 会在相似任务里重复失败,说明执行期也要有运行时保障。
- 方法:从 Skill 文档提取 DSL 规格,再从执行轨迹里挖掘经验;在 Claude Code/Codex hook 上做 step-aware runtime assurance,并用新轨迹继续自演化。
- 关键结果:15 个可执行技能、1,200 条查询、10 次演化迭代×5 次重复;平均成功率从 62.6%升到 77.7%,波动下降 41.1%,自身开销约 0.8%。
- 证据强弱:多配置、重复和留出集都在,但技能集有限。
- 局限:依赖 Claude Code/Codex hook。
- 目标线关系:执行期保障,是技能从路由到落地之间的最后一道门。
- 结论:精读。
25. Yesterday's Shield, Today's Spear: A Self-Evolving Safety Guardrail in Production
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08471
- 研究问题:生产 guardrail 静态冻结,跟不上新 jailbreak 和新有害类别。
- 方法:SESG 让生成、验证和路由三个智能体接力,沿生产失败流量持续进化。
- 关键结果:TSM 场景 F1 从 21.56 提到 98.98;在线部署 2026-04 至 06 期间自动关闭 14 个新威胁场景。
- 证据强弱:有真实生产部署和完整消融。
- 局限:内部流量无法外部复核,低资源语言仍是难点。
- 目标线关系:生产环境自进化安全 guardrail,是技能攻防与防护面的现实样本。
- 结论:精读。
26. What Keeps Agent Skills from Being Reusable? Evidence from 138K SKILL.md Files
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08453
- 研究问题:Agent Skills 为什么总是难以复用,问题究竟出在 metadata、文档规范还是组织流程。
- 方法:大规模统计 138K SKILL.md 文件,分析路由元数据、规范字段和质量保障工作流。
- 关键结果:91.8% 技能含至少 1 个缺陷;89.3% 违反至少 1 条官方规范;BM25 下 clean 元数据更易检索。
- 证据强弱:中强。
- 局限:Regex 启发式,BM25 不是生产路由,R2–R7 无端到端任务基准。
- 目标线关系:技能复用与生命周期的地基性实证,重点在生成期质量保障。
- 结论:精读。
27. SkillSmith: Enhancing Locally Deployed Agents via Automatic Skill Construction and Evolution
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08037
- 研究问题:本地部署 agent 能否先在云端自动构建并演化技能,再迁移到本地执行。
- 方法:云端自动构建技能,围绕版本、筛选和迁移做闭环,后续下发本地部署 agent。
- 关键结果:AppWorld PR 78.6/74.9/89.0;WorkBench 89.0;比最强非参数基线高 11.3–26.2 点。
- 证据强弱:中强。
- 局限:只测 2 个数据集;无多次分割或显著性检验;无代码/复现材料。
- 目标线关系:技能生命周期闭环的完整案例,适合作为生成+演化的工程模板。
- 结论:精读。
28. Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.07955
- 研究问题:工具推理和几何代码块如何组合成可演化技能,并在轨迹中自我改进。
- 方法:将工具推理与几何代码块做成神经符号技能,并在轨迹中自演化。
- 关键结果:GPT-5.4 上 MMSI 49.50(+1.50pp)、MindCube 71.50(+0.49pp);Gemini 2.5 Pro 在三基准上全最优。
- 证据强弱:中。
- 局限:仅选定基准与工具环境;无开源复现。
- 目标线关系:工具增强自演化技能样本,但需注明基准与环境边界。
- 结论:值得扫读。
29. Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.08466
- 研究问题:任务特定 agent harness 是否可以被显式建模为可进化框架。
- 方法:任务特定可进化 agent harness 框架,围绕策略、约束和反馈建立演化链路。
- 关键结果:本期摘要未给出可核验主数值。
- 证据强弱:中。
- 局限:以框架与方法论为主。
- 目标线关系:长程任务与自进化 agent 的控制壳层。
- 结论:值得扫读。
30. SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
- 公众号原题入口:见上方公众号入口
- arXiv:https://arxiv.org/abs/2608.09885
- 研究问题:安全 harness 不是静态配置,而是可以被轨迹驱动进化的工件集合。
- 方法/训练流程:把 harness 拆成 System Prompt、Rule Bank、Safety Memory、Tool Policy 四个工件,按 rollout 评估→结构化诊断→工件路由→有界编辑→安全-效用验证的闭环进化。
- 基准与样本:在 Agent-SafetyBench 前 200 个任务上构造 6 种条件,并迁移到 AgentHarm 的 440 个增广有害行为。
- 关键结果:对静态 SafeHarness,ASR 从 17.1%降到 5.5%,UA 从 31.6%升到 47.6%。在 AgentHarm 上,Harm Score 从 19.8%降到 9.8%,Benign NR 基本不变。
- 证据强弱:结构完整,含 held-in、held-out 和跨模型迁移。
- 局限:进化子集只有 15 任务,仍是内部评测。
- 复现条件/代码:论文报告了官方 GitHub 项目;复现需 Agent-SafetyBench、AgentHarm 与四类 harness 工件的编辑/验证流水线。
- 目标线关系:安全边界变成可演化工件,是自进化系统里最清楚的一条防护线。
- 结论:精读。
31. From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents
- arXiv:https://arxiv.org/abs/2608.09168
- 研究问题:检索到「相关」技能束不等于值得执行;每次 skill-conditioned rollout 又很昂贵,因而需要在检索后、执行前单独判断效用。
- 方法:RADEG 对同一查询的技能束做删除、添加或替换扰动,用匹配 rollout 隔离技能组成对 verifier reward 的影响;部署时只更新轻量 logistic head,不重训检索器或 agent。
- 关键结果:GoS 的 288 个 rollout 上,5 折 AUROC 0.717、AUPRC 0.570;默认阈值跳过 68%调用,保留 61% verifier reward。40%预算下保留 61%奖励,PPR-Gate 为 40%。
- 证据强弱与局限:中等。多分割、bootstrap、跨 agent 与跨检索器实验齐全;但样本仅 288 个 rollout、只有一个基准,且依赖日志型 verifier 反馈。
- 复现条件/代码:附录给出环境与协议;未报告代码或数据链接。
- 目标线关系:把「检索相关性」与「执行效用」拆开,是技能选择之后、执行之前的门控层。
- 结论:精读。
32. SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning
- arXiv:https://arxiv.org/abs/2608.07959
- 研究问题:超长视频中的稀疏证据跨越数十分钟乃至数天,刚性 zoom-in 会传播早期错误,多轮工具强化学习又缺少细粒度信用。
- 方法:SCOUT 在 Refine 与 Recover 之间自适应切换;UPS-GRPO 对不确定的 post-tool 状态优先采样,并把轮级工具奖励与最终答案奖励相乘,缓解长轨迹信用分配。
- 关键结果:Video-MME Long、EgoLifeQA、Ego-R1、HourVideo 上分别达到 63.0、47.6、49.0、35.8;相对最强 agentic 基线,EgoLifeQA 提升 9.1 点、Ego-R1 提升 6.0 点。RL-only 明显退化,SFT+RL 才达到完整结果。
- 证据强弱与局限:中强。四基准且公开负结果;但主要只有 7B 单骨干,无独立复现,较短视频上的优势较弱。
- 复现条件/代码:需 Qwen2.5-7B-Instruct、LLaMA-Factory 与 verl;训练数据和代码未报告公开。
- 目标线关系:给长程工具 agent 补上「恢复」动作,也把中间工具轮次变成可训练的信用单位。
- 结论:精读。
33. Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution
- arXiv:https://arxiv.org/abs/2608.07645
- 研究问题:从单条失败轨迹做自修改,忽略了同一 agent 的重复失败与不同谱系之间的比较信号。
- 方法:MGM 在克隆突变之外加入反应规范突变与跨谱系杂交,复用档案轨迹比较重复失败和成功谱系,不增加额外评估;论文另在简化适应度景观上证明比较证据可提高有效修复概率。
- 关键结果:SWE-bench Verified-60 从 68.3 升到 78.3,Polyglot-60 从 50.8 升到 93.2;冻结后迁移到完整 225 题 Polyglot,DeepSeek-V4-Pro 达 96.89%。一次进化平均约 68 小时。
- 证据强弱与局限:较强。理论、仿真、双基准、跨模型和消融均有;但只覆盖编码 agent,60 题子集和种子有限,档案稀疏时会退化为单轨迹方法。
- 复现条件/代码:官方项目页与代码仓库已报告;需 Qwen3.6-35B-A3B 或 DeepSeek-V4 系列及仓库级评测环境。
- 目标线关系:它把轨迹档案从日志升级为进化素材,直接回答「跨轨迹比较是否比单失败修补更可靠」。
- 结论:精读。
34. TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?
- arXiv:https://arxiv.org/abs/2608.07899
- 研究问题:能检测到失败,不代表能定位失败起源;终态和常规遥测究竟缺了什么因果信息。
- 方法:构造 312 条带因果阶段标签的受控轨迹,覆盖 3 个领域、4 种九组件循环和 6 类延迟绑定故障;分开评估失败检测、起源定位与证据不足时的安全弃权。
- 关键结果:完整遥测下,多数前沿模型的 origin-step Top-1 为 84.7%–97.2%,但 Metadata、OpenTelemetry、OpenInference 视图虽然检测 F1 仍达 99.5%–100%,起源定位不超过 0.5%;去掉决策内容后,720 次评估的起源精度为 0%。
- 证据强弱与局限:强受控基准,有盲 holdout、bootstrap 和多模型;但仅覆盖一种合成故障机制族,主面板多数条件为单次响应。
- 复现条件/代码:论文给出匿名评审数据与实现链接;API 实验成本约 2400 美元。
- 目标线关系:为轨迹归因划出硬边界:检测依赖终态即可,因果定位需要显式的 decision-to-provenance 链接。
- 结论:精读。
35. Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation
- arXiv:https://arxiv.org/abs/2608.09263
- 研究问题:训练期的特权上下文能改变 token 似然,但这种变化是否真的等于结果信用。
- 方法:把问题拆成结果对齐、反馈分配和损失诱导行为三项检查,并在 gpt-oss-20b 的 AIME 2025 训练中,对 outcome-only 与五种 token 分数配方做匹配比较。
- 关键结果:已实现的 additive 分数 pooled AUC 为 0.505,接近随机;outcome-only 的 avg@4 为 64.2–64.3,五种 token 分数配方仅 24.2–33.9,全部落后 30.4–40.0 点。
- 证据强弱与局限:形式化分析加匹配训练负结果,警示很强;但仅单模型、单数学基准、单 seed,且反馈来自外部 LLM judge。
- 复现条件/代码:需 gpt-oss-20b、AIME 2025、外部 judge 与论文六套训练配置;原文未提供代码或数据链接。
- 目标线关系:它直接否定「似然变化可以默认充当长轨迹 token 信用」这一捷径,适合与失败轨迹蒸馏并读。
- 结论:精读。
36. Long SKILL Compliance as Logical Reasoning: Closure-Grounded Detection with Scaling-Guided On-Policy Distillation
- arXiv:https://arxiv.org/abs/2608.08146
- 研究问题:长 SKILL 文档的合规审计既要恢复强制前置条件,又要保留义务到证据的溯源;直接把全文交给大模型成本高且不稳定。
- 方法:SkillCDG 先做 SKILL 级与约束级两层检索,再在带来源跨度的约束依赖图上求传递闭包,最后让模型判断合规;训练侧用规模与图复杂度估计师生 headroom,筛选 OPD 样本。
- 关键结果:Fulfillment 上 4B 模型 F1 提升 12.8 点,在线 token 从 35.0k 降到 12.5k;公开 CompliBench/Long 提升 1.5–3.8 点。但在部分大模型上,ACC 反而低于 RawSkill。
- 证据强弱与局限:中强。5 数据集、3 模型族、4 种规模和消融齐全;企业数据未公开,经验缩放式不是通用 scaling law,公开集绝对准确率仍低。
- 复现条件/代码:开源裁判需 8×H20 96GB,OPD 需 2×RTX PRO 6000 96GB;未报告代码或数据发布。
- 目标线关系:补齐技能生命周期里的审计与合规层,也说明结构化闭包对小模型有用、对大模型却未必单调增益。
- 结论:精读。
二、3 篇邻近跟踪
1. Agentic Auto-Research is Fuzz Testing
- arXiv:https://arxiv.org/abs/2608.09855
- 研究问题:自主研究代理生成候选的速度快于验证速度,最终稀疏分数不足以决定下一次搜索。
- 方法/训练流程:立场论文把 auto-research 控制回路类比为 greybox fuzzing,主张用廉价、密集的中间进展信号引导下一次干预,同时把最终验证留在受保护通道。
- 基准与样本:无自有实验、无自建基准;全文以外部工作和三条可证伪预测支撑论点。
- 关键结果:无自有实验;文中证据来自外部工作与三条可证伪预测。
- 证据强弱与局限:弱。论证清楚,但不能当作性能进展证据。
- 复现条件/代码:无实验、无代码。
- 迁移连接点:可把长程研究 agent 的反馈拆成「引导搜索」与「裁决结论」两路,避免用同一个脆弱分数同时承担探索和验收。
- 结论:邻近跟踪。
2. Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models
- arXiv:https://arxiv.org/abs/2608.09109
- 研究问题:一条用户反馈可能包含应全局固化的修正、只在特定任务应用的精修,以及不应产生更新的噪声。
- 方法:SLIFT 把反馈拆成 Fix、Spec、Null;Generalist 用自蒸馏固化 Fix,Specialist 只在适用且未满足时应用 Spec,Null 不产生正向更新。
- 关键结果:Ministral3-14B 消融中,完整模型的 MemoryBench Norm-Score、IFEval、AlpacaEval LC 分别为 53.22、69.71、66.35;去 KEEP 监督后 IFEval 降至 57.63。真实 WildFB 中增益较小,约 37.7%反馈成分没有可靠更新目标。
- 证据强弱与局限:中。双基准、双骨干、5 次运行与消融完整;但 MemoryBench 使用模拟反馈,真实反馈域内增益有限。
- 复现条件/代码:论文声明匿名评审代码链接,当前可达性未完全确认;依赖 MemoryBench、WildFB 与 Qwen3.6-Plus 反馈模拟器。
- 迁移连接点:对 agent 轨迹学习最可迁移的是「不是所有反馈都该更新」;Fix、Spec、Null 可对应全局策略、局部技能和应丢弃轨迹。
- 结论:邻近跟踪。
3. LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling
- arXiv:https://arxiv.org/abs/2608.09343
- 研究问题:仿真优化只给聚合分数,不能解释失败原因,也不能指出该改哪段策略逻辑。
- 方法:每个候选做 10 次评分复现和 1 次诊断回放;manager 从最低分回放的 event-level trace 提出瓶颈假设,多个 editing agent 并行改代码,best-so-far 只接纳改进。
- 关键结果:最佳 Gemini-3.1-Pro run 从 62.49 升至 78.61,5 次 run 最终均值平均 77.51;独立 100 个匹配种子重评中,每个种子都优于代表性基线。但部分优势来自框架拥有更宽的主动充电决策空间。
- 证据强弱与局限:中。5 次独立运行、多骨干、匹配种子检验与消融齐全;但只有一个自建仿真案例,最低分 trace 未必代表典型状态。
- 复现条件/代码:附录给出环境和协议;未报告公开代码、仿真器或数据。
- 迁移连接点:它示范了如何把长程 trace 从「排名依据」升级为「诊断后再改代码」的搜索信号,可迁移到 loop policy 和技能演化。
- 结论:邻近跟踪。
三、排除项
Mismatch Matters: On-Policy Distillation Beyond Token Agreement
- arXiv:https://arxiv.org/abs/2608.09836
- 排除说明:论文研究 on-policy distillation 中 student-excess 与 student-deficit 两类 token 失配,重点是数学推理后训练的稳定性;没有 agent、自主闭环或长程任务机制。它与「选择性更新」只有概念呼应,因此不计入本期收录。
四、整体判断
- 失败轨迹已从废料变成资产:Reason Wide、FailForge、Branch2Skill 和 MGM 分别展示了离线蒸馏、失败再生成、树上局部监督和跨谱系比较;共同约束是更新前必须有泄漏过滤、验证门控或对照证据。
- 路由、执行与验证必须分层:SkillReason 解决「找什么」,RADEG 解决「值不值得执行」,SkillSentry 解决「执行时是否偏离」,TelemetrySuffBench 则说明「发现失败」不等于「定位起源」。
- 记忆治理包含写入、呈现与撤销:SodaMem 管时效与来源,TRACE-Memory 决定何时不用历史,Structured Memory 控制跨域泄漏,OBLIVION 处理删除后的重建风险。
- 自进化的最低治理单元是可回滚工件:OpenLoopEvolve 管 loop policy,SHE 管四类 safety harness,SESG 管生产护栏;没有版本、门控、归因和独立验证,进化只会把错误放大。
- 邻近项的价值都在可迁移结构,而非直接性能结论:fuzzing 类比提供反馈架构,SLIFT 提供选择性更新分类,仿真轨迹论文提供「诊断—改码—独立复评」闭环。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
