
后果归因、可审计记忆、自进化负结果与闭环 TTS:9.1 论文雷达(26 篇)
从 9.1 批三个指定栏目筛出 26 篇论文,重点拆解长程后果归因、记忆操作信用、自进化负结果和 LoopTTS 闭环,并给出原文优先级与研发验收表。
9 月 1 日这一批有两个值得先读的信号。
第一个信号来自长程智能体:新论文开始把“压缩了多少 token”“记住了多少条目”往下追一层,直接问某次压缩、写入、删除或工具动作怎样影响后续结果。第二个信号来自自进化:几篇大规模实验同时给出负结果——系统能够运行不等于能力会稳定增长,自我判断也不等于真正改进。
音频线终于出现一篇文本转语音(text-to-speech,TTS)直接命中。LoopTTS 不再把生成器当作一次调用,而是把过滤、诊断与再合成接成有界闭环。同期仍没有播客生成或播客评估的直接命中;TEMPO 与长段落音频字幕只进入邻近跟踪,因为两者处理的是时间定位与内容忠实度,不是播客生成质量。
本期候选池只来自公众号「arXiv 每日学术速递」9.1 批的三个允许栏目:人工智能学术速递、自然语言处理学术速递与语音与音频学术速递。三个栏目正文共提取到 431 个不重复的 arXiv 条目,本期逐条做了覆盖审计;arXiv 与论文原文明确链接的代码、项目和数据页只用于核验,没有扩展候选池。
先看阅读优先级
| 建议 | 论文 | 先读什么 | 证据判断 |
|---|---|---|---|
| 精读 | TRACER | 压缩决策如何获得未来工具后果的信用 | 5 seeds、跨后端迁移;外部迁移有反例,中强 |
| 精读 | Reconciling Process Supervision with Outcome-Based Credit(TASPO) | 动作级信用怎样保持 outcome 更新方向 | 3 seeds、多基准;部分超参数仍为占位符,中强 |
| 精读 | Hindsight Memory-PRM | 用删除重答与引用痕迹监督记忆操作 | 3 seeds、完整消融;依赖闭源 probe,中强 |
| 精读 | Selective Forgetting | 图记忆未胜向量基线的负结果 | 四次运行、配对区间;仅单模型单基准,中强 |
| 精读 | APIFlow-Bench | 到达正确状态与正确交付为什么要分开 | 冻结合成基准、公开轨迹;现实性受限,中强 |
| 精读 | Self-Evolving Skills via Surrogate-Guided Solve-and-Reproduce(reSolve) | 一次成功如何变成 fresh container 可复现技能 | 3 次运行与 bootstrap;未开源,中强 |
| 精读 | S3Gym | 自测试、自判断与自提升为何不等价 | 98 runs、明确负迁移;任务域有限,中强 |
| 精读 | Aspire | 模糊目标下权重与 harness 自进化能否超过基线 | 24 个 final-only runs;多数 cell 单次,中 |
| 精读 | Diagnose, Then Refine(LoopTTS) | AudioLLM 诊断能否带来可听见的定向修复 | 主观听测与多类指标齐全;外部 judge、成本高,中强 |
| 值得扫读 | LiteSearch-VL · NavMCP · SkillZip Pro | 轨迹蒸馏、长时程具身脚手架、技能包压缩 | 有受控结果;迁移或复现入口不完整,中 |
| 值得扫读 | Measure Before You Manage · Agent Zero Memory | 工作记忆测量层次与溯源架构 | 前者样本小;后者缺组件消融,中弱 |
| 值得扫读 | Beyond Uncertainty · DataFoundry | 课程信号与数据构造器的演化边界 | 都出现回退或小增益;独立重复不足,中弱 |
| 值得扫读 | EvoSkill Injection · GenRubric | 自进化技能的持久化攻击面与自生成评分规则 | 多条件对照;两者都依赖模型 judge,中 |
| 值得扫读 | Using Grounded Theory for Agent Behavior Analysis at Scale · RetroGen · WebWorld | 轨迹分析、从成品回溯轨迹、可执行证书 | 方法新颖;后两者代码未公开,中 |
| 邻近跟踪 | UTILMEM · ODR · TEMPO · SCC · Textual Acoustic Grounding | 记忆利用、最终语义、时间戳、长字幕忠实度、深伪检测 | 迁移接口明确;都不是 TTS 或播客生成的实验结论 |
这里的“中强”不是对论文总质量打分。它只表示本期关心的结论是否有受控比较、重复运行、明确效果量与可复现入口支撑。
这批论文把系统改动放在了哪里
| 生命周期位置 | 代表工作 | 实际改变了什么 | 不能混写成什么 |
|---|---|---|---|
| 工具输出进入上下文 | TRACER、Measure Before You Manage | retention ratio、delivered context 与管理工作量 | 不是模型记忆容量提升 |
| 长期记忆写入与删除 | Hindsight Memory-PRM、Selective Forgetting、Agent Zero Memory | 操作信用、图剪枝或溯源存储架构 | 不是同一种“记忆准确率” |
| 轨迹监督 | TASPO、LiteSearch-VL、RetroGen | 动作级 advantage、公开轨迹蒸馏、从成品回溯过程 | 不能只看最终 pass@1 判断监督来自哪里 |
| 技能与课程自进化 | reSolve、SkillZip Pro、Beyond Uncertainty | 可复现技能、技能包部署、出题信号 | 不是基础模型自动获得通用能力 |
| 自进化验收 | S3Gym、Aspire、DataFoundry、WebWorld | 隐藏评测、冻结基线、停止/回滚、可执行证书 | 不能用自评或最后一次 checkpoint 代替独立验收 |
| 评测与故障定位 | APIFlow-Bench、GenRubric、AutoTraceGT | 长依赖 grader、rubric 生成、轨迹行为分类 | 评测工具的提升不等于 agent 权重提升 |
| 生成式音频闭环 | LoopTTS | 过滤、AudioLLM 诊断、引导式再合成 | Judge 分数不是最终听感 |
| 音频邻近验收 | ODR、TEMPO、SCC、Textual Acoustic Grounding | 最终意图、时间边界、字幕忠实、深伪检测 | 不是 TTS 或播客生成效果 |
最重要的比较发生在“后果”这一列。TRACER 给被压缩的工具输出分配未来后果;Hindsight Memory-PRM 给记忆条目分配删除后的回答后果;TASPO 用同一任务的成功轨迹帮助判断当前可执行动作;LoopTTS 则要求诊断最终回到一段新的音频上。四篇论文都在反对只优化一个中间代理指标,但四种后果分别是工具重调用、回答质量、轨迹 outcome 与人类听感,不能共享同一个分数。
重点精读
1. TRACER: Per-Tool Context Retention for LLM Agents via Consequence-Attributed Reinforcement Learning
TRACER 把每次上下文压缩变成逐工具输出的保留比例决策。REINFORCE 策略同时考虑任务是否成功、消耗多少 token,以及压缩后是否不得不再次调用工具。一个单工具反事实模型再比较“保留这段输出”和“压缩这段输出”两种情况下的后续结果,把差异作为信用信号。
120 条生产查询被分成 80 条训练与 40 条测试,实验覆盖 3 个压缩后端与 5 个随机种子。相对 Keep-all,TRACER 节省 29%–46% token,重调用比例不超过 2.5%;引入后果归因后,成功率再升 2.2–4.8 个百分点。后果预测与实测的 Spearman ρ 为 0.66,Top-3 命中率为 82%。迁移并非全胜:AGORA 后端零样本成功率为 0.62,低于 Uniform-0.25 的 0.65。
这篇论文的新意不只是“可学习压缩”。TRACER 把压缩动作与未来恢复成本接在一起,正好补上只报 token saving 的常见缺口。证据边界也清楚:论文没有形式因果保证,也没有报告单条轨迹含 16 个以上可压缩工具输出时的结果。跨后端结果只能算初步迁移证据。论文给出策略结构、174 维特征、Beta action、种子与伪代码,但没有代码或数据仓库入口。
2. Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization
TASPO 处理的是另一类后果:终局奖励已经可靠,但奖励无法告诉训练器是哪一个中间动作起作用。TASPO 先从同一任务组中已验证成功的轨迹提炼指导信息,再把指导信息对齐到当前轨迹的具体决策位置。算法以环境真正执行的一整条动作为信用单位,比较该动作在指导信息出现前后的似然变化。TASPO 只在动作之间重分配原始 GRPO advantage,不改变终局结果决定的更新方向与平均尺度。
实验覆盖 ALFWorld、Search-QA、WebShop,使用三种 Qwen 模型、每题 8 条 rollout、150 次更新与 3 个随机种子。论文摘要报告 TASPO 相对 GRPO 的总体相对增益为 10.6%,三个模型在 ALFWorld 上的平均相对增益为 16.9%。在同一训练协议下,不同指导信息构造方式的任务成功率分别为:GRPO 74.2%、通用任务技能 76.9%、随机成功轨迹 79.2%、最近邻成功轨迹 81.1%、TASPO 86.3%。在 ALFWorld 的信用粒度对照中,动作级成功率为 86.3%,token 级为 79.7%。
这组结果支持“细粒度监督不自动等于细粒度信用”。不过,TASPO 需要同一问题组里存在可对齐的成功轨迹,并依赖冻结的分析模型;没有可用指导信息时,算法回退到 GRPO。论文公开任务、horizon、batch、学习率和种子数,但没有代码、数据或 checkpoint;部分 τ/ε 参数在当前版本仍是占位符。
3. Hindsight Memory-PRM: Supervising Memory Management with Auditable Hindsight Credit
Hindsight Memory-PRM 不为每次写入或删除额外收集人工标签。系统先记录某条记忆是否被检索、回答是否引用了该记忆,再删除这条记忆并重新回答一次。删除前后的差异形成条目级信用信号;一个区分写入、更新和删除操作的 critic 学习这个信号,再沿记忆版本链把奖励分给具体操作。
LoCoMo 的 975 道 held-out 题上,该方法的回答准确率为 77.5%±0.8%,SFT 为 62.5%、Outcome-only GRPO 为 63.4%、Mem0 top-10 为 69.7%;LongMemEval 的 400 题上,该方法为 79.0%,MemBuilder 为 66.0%。LoCoMo 的信用机制逐步加入后,准确率从 63.4% 升到 70.2%,再到 77.5%;移除 critic 下降 6.5 点,移除 audited terms 下降 8.1 点。
这篇论文最值得迁移的不是某个 memory schema,而是让记忆条目留下机器可审计的轨迹证据。局限同样重要:schema 需要按域设计,LoCoMo 到 LongMemEval 的直接迁移从 77.5 降到 58.4;反事实重答使 quiz 成本约翻倍,probe 还依赖闭源模型。论文计划发布缓存、请求响应、prompt、split、seed 与 replay script,但当前原文没有 GitHub 入口。
4. Selective Forgetting: A Graph-Based Memory Framework for Long-Term LLM Agents
这篇论文保留了一个有用的负结果。系统把对话拆成 typed nodes/edges,取 top-5 roots 后做两跳扩展,并每 400 turns 依据新近性、访问、中心性与年龄剪枝。在 LongMemEval 的 500 题上,两套系统检索相同数量候选时,图记忆 token F1 为 0.417,flat vector 为 0.468;配对 bootstrap 差值为 -0.050,95% CI 为 [-0.085, -0.016]。
选择性遗忘把 27,021 个节点、46,538 条边和 440.6 MB 存储降到 24,368 个节点、43,978 条边和 398.6 MB。遗忘前后的 token F1 差值为 +0.001,judge accuracy 差值为 -0.016,区间包含零。实验支持的结论只有两个:这条图抽取管线没有胜过 flat vector;这套剪枝在本设置中减少了存储而没有显示显著质量变化。
论文只有单模型、单基准和四次完整运行,没有同压缩比例的随机剪枝对照,也没有扫描遗忘权重、阈值与间隔。因此,这篇论文不能证明图记忆普遍无效,也不能证明遗忘普遍安全。它真正提供的是一个研发提醒:结构更丰富并不自动提高长期召回,剪枝收益必须与同预算简单基线配对检验。
5. APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows
APIFlow-Bench 含 467 个任务、13 个合成 REST API 世界,任务由 241 个单任务与 226 条最长 20 子任务链组成。基准把认证、发现、schema 修复、多步执行、错误恢复、分页与状态性拆开,并在统一
react() harness 上评测 19 个模型。单任务通过率为 92.9%,不含共识未解任务格的 20-subtask 链通过率为 74.4%。在 headline slice 中,把 18 个模型都未解出的任务格也计入分母后,通过率为 60.9%。19 个模型的 best-of-five 通过率范围只跨约 7 个百分点,all-five-of-five 范围却跨 44 个百分点。在不含共识未解任务格的失败样本中,77% 已经到达正确最终状态,只在最后的 answer card 交付失败。
这说明“系统状态正确”和“向用户完整交付”应当分开验收。公开仓库提供 hash-pinned task bank、golden replay 和 44,362 条未脱敏轨迹;完整 leaderboard 仍需要模型提供商 API key。合成 mock 提高了冻结与复现能力,也牺牲了生产现实性;11 个 world 的 headline slice 区间重叠,论文不支持细粒度模型排名。
6. Self-Evolving Skills via Surrogate-Guided Solve-and-Reproduce
reSolve 把 solving 与独立 fresh-container reproduction 分开。系统先用 surrogate verifier 补稀疏奖励,再用 verifier-guided beam search 演化一个自包含技能。SkillsBench v1.1 的 86 个公开任务上,每题运行 3 次;DeepSeek-V4-Pro 的 mean-of-3 从 No skill 的 30.6、Curated 的 60.1,升到 reSolve 的 74.9。相对 curated 的差值为 14.8,95% CI 为 [9.4, 20.6]。
消融也有辨识度:去掉 surrogate 后为 66.0,去掉 beam 为 59.4,去掉 curated anchor 为 44.0。三试全部通过的任务数分别为:No skill 12 个、Curated 37 个、reSolve 56/86 个。另一方面,finance/economics 只有 55.6,software engineering 为 51.7;在至少有两次奖励观测的 85 个任务里,20 个出现同一 package 跨试验 reward 变化。
这篇论文把“幸运地跑通一次”与“形成可部署技能”区分开了。论文给出 1,800 秒、80 步、每命令 120 秒等预算与 bootstrap,但没有代码或数据入口;surrogate 仍可能被过优化,from-scratch 结果也远低于带 curated anchor 的版本。
7. S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?
S3Gym 用 7 个文本游戏比较 History-ICL、Summary Memory 与 Parameter Training,并把探索数据与隐藏 evaluation seed 严格隔离。98 次运行共收集 116,117 个 transition;Qwen3-8B 另有 20 个 checkpoints。
结果没有形成统一的“自提升曲线”。AUC+ 表示探索过程中高于初始分数的持续增益面积;不同游戏的原始分数尺度不同,AUC+ 只能在同一游戏内比较。Gemini-2.5-Flash 在 Minesweeper 上的 Summary AUC+ 从 0 升到 7.794,在 PvZ 上从 24.402 升到 238.501;GPT-5.5 在 PvZ 上却从 548.499 降到 33.219。Qwen3-8B 参数训练在 Trust Evolution 的 19 个 checkpoint 中有 18 个超过 baseline,但在 PvZ 上从 23 持续降到 6。
更关键的是,自判一致性从 Chess 的 0.496 到 PvZ 的 0.881。自判与后续改进的整体相关性接近零:每个探索块的事件判断一致性,与下一次归一化评测增益之间的 Spearman ρ 只有 -0.010。S3Gym 因此提供了本批最直接的验收原则:自测试、自判断、自提升必须分别报告;判断器看起来稳定,不能证明更新方向正确。 论文只测 7 个游戏与有限模型,项目页也没有给代码或数据直链。
8. Aspire: Can Models Self-Evolve from Vague Goals?
Aspire 给智能体的只有宽泛能力目标,系统必须自行选择数据、更新、验证和停止方式。论文分别测试权重演化与 harness 演化。隐藏评测含 520 题、6 个目标;Final-only 共有 24 次运行,每次预算 40 GPU-hours。
论文把初始指令微调 checkpoint 在同一隐藏目标上的分数定义为 base score。24 个最终 checkpoint 里只有 3 个超过各自的 base score;12 个“模型×目标”组合中,只有 Qwen3.5-9B 的科学与学术推理在两次运行均值上超过 base,分数从 45.33 升到 48.00,增加 2.67 点。Adaptive-feedback 的 30 个“配置×目标”单次运行里,只有 2 个 best checkpoint 超过 base;只有 GPT-5.6 Terra 数学的 +2.24 同时通过预先声明的资格检查,并被回滚机制保留。Harness 演化只做一步,3 个有效 successor 都低于手工 Qwen-Agent 参考 28.64。
这篇负结果直接约束研发叙事:基础循环能运行,不代表权重或 harness 会稳定优于冻结参考。Terra 的改进还来自对同一 evaluation slice 反复使用 aggregate feedback,不能当作独立复现;多数 cell 只有一次 canonical run。当前版本也没有代码或数据直链。
9. Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction
LoopTTS 把开环 TTS 改成 Filter–Judge–Refiner 三阶段。Filter 用 WER 与 UTMOS 排除灾难性输出;AudioLLM Judge 给出 1–10 分,并生成全局情绪、速度、音高与词级重音、停顿指令;Refiner 再以初始音频、文本和指令为条件,重新合成整段语音。系统不会只修改被标记的波形片段,因此未请求区域与说话人嵌入仍可能变化。
Refiner-DB 含约 42K 个弱标注对比样本,来自 6 个公开语料库。Stage 1 最多重生成两次,只有 WER≤3.0% 且 UTMOS>3.0 才通过;Stage 2 对 Judge 分数低于 5 的样本诊断。主观评测使用 6 名评估者。在被 Judge 标记的缺陷样本上,一轮闭环在中性文本与情绪文本条件下的 MOS 分别为 4.17±0.12 与 4.01±0.14。另一组独立的指令跟随实验只评 Refiner:WER 为 2.90、SIM 为 0.68、UTMOS 为 3.60、MOS 为 4.21±0.14,五类控制的平均 MOS-I 为 4.04±0.10。
指标必须分开理解:WER 测转写,UTMOS 测自动质量估计,SIM 测说话人相似度,MOS 测主观自然度,MOS-I 测指令执行。AudioLLM 的分数只负责触发和指导,不是最终质量证明。论文也给出成本边界:42K 条标注按 Gemini-3-pro 估算约 907.2 美元;多轮后 SIM 下降,收益在 1–2 轮后趋于饱和。当前数据下载入口未报告,外部 Judge 的版本变化、实时性与部署成本仍未解决。
直接命中:值得扫读
10–12. 轨迹蒸馏、具身脚手架与技能包压缩
LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO — Saeed Khaki 等用 36,592 条 OpenSearch-VL 轨迹做 LoRA 全轨迹 SFT,再以 GPT-5 生成五类局部 hard negative 做 step-DPO。2B base 的宏平均 Pass@1 为 0.1%,全轨迹 SFT 为 28.4%,4B SFT+DPO 最佳为 30.8%;DPO 本身只贡献 1.0–1.7 个百分点。在 VDR 评测中,把允许的工具调用步数从 5 增到 8 后,“无法作答”的比例下降 33%–50%,但 Pass@1 约只变 1 点,瓶颈更接近答案验证而非搜索深度。代码、配置与 judge prompt 被承诺发布,当前没有可访问仓库。入口:公众号。结论:值得扫读。
Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation — Zixing Lei 等让 VLM 负责规划与取证,让固定导航模型负责执行,再用 intent、observation、memory 三通道维持持久交互。固定代理对照中 episodic interface 为 59.1,完整系统为 74.0;Unitree Go2 的 60 次真实机器人实验中总体成功率为 78.3%。优势随任务 horizon 增长,但系统依赖大 VLM,代码与数据入口未报告。入口:公众号。结论:值得扫读。
SkillZip Pro: Execution-Aware Dynamic Compression of Progressively Loaded Skills for Self-Evolving Agents — Xiaofan Bai 等把 skill 当成含 root、reference 与 subskill 的目录 bundle,而不是一段 prompt。在一次性压缩实验中,SkillZip Pro 的平均成功率为 0.560;未压缩的演化技能包为 0.541,人工技能为 0.564。压缩后需要随包发布的 token 减少 19.7%,每次运行实际加载的 token 减少约 12.1%–17.9%。在技能库持续更新的实验中,只有定期重新打包时,随包发布的 token 才减少 48.1%;不重新打包时只减少 2.7%。结构保证不等于行为等价,失败时系统会回退未压缩版本。原文未给公开代码、模型或数据。入口:公众号。结论:值得扫读。
13–14. 工作记忆测量与溯源架构
Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents — Le Chen 等分析 55 条归档编码轨迹,提出 stored state、delivered context、management work、task/process outcome 四层测量。策略在 15 条 calibration 轨迹上有增益,却在 8 条 held-out 轨迹上未通过 Holm 校正。在 8 个完整跑完六种策略的任务中,改造后的检索策略 GA 相对 FIFO,每条完整轨迹平均多耗 67.45 秒;这个数字衡量整条轨迹的系统开销,包含工具路径和辅助调用变化。论文的价值在测量框架;完整匿名数据与服务修订版没有固定。入口:公众号。结论:值得扫读。
Agent Zero Memory: Provenance-Aware Long-Term Memory for LLM Agents — Ming Wu、Pengyuan Zhu 组合 episodic timeline、entity-event graph 与 citation-locked hierarchical documentary memory。LongMemEval 为 95.60%,LoCoMo 为 93.60%;同一记忆架构换用八个 backbone 后,准确率落在 92.20%–95.60%,单次 query 的估算成本相差约 30 倍。论文支持“溯源架构可能比更贵 backbone 更重要”,却缺组件级消融、冲突仲裁、遗忘机制与公开代码;跨系统最优值也不是受控 head-to-head。入口:公众号。结论:值得扫读。
15–17. 课程、数据构造器与技能攻击面
Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula — Vinoth Selvendran、Zhanming Zhang 用异构三求解器的分歧熵替代单求解器不确定性。竞赛数学平均 pass@1 从 44.35 升到 45.69,但 GSM8K 下降 0.60;实验只有一次 Challenger 迭代与 8 个 batch,没有独立消融,GPU-hour 约增至 3 倍。结果更像“课程信号有潜力”,还不是稳定自进化。入口:公众号。结论:值得扫读。
DataFoundry: Evolving Data Preparators via Recursive Self-Improvement — Cehao Yang 等把 data preparator 写成可演化模块,在小 pilot set 上诊断后只修改缺陷组件。在 DataPrep-Bench 的领域平均分上,DataFoundry 训练出的 Qwen2.5-7B 相对同样使用 GPT-5.6 Sol 的 DataPrep-Skill,数学、金融、法律、医学分别高 3.8、6.2、7.9、5.9 点;数学到第三轮又从 28.8 降到 26.1,金融从 66.1 降到 58.3。过度演化会退化,停止与回滚因此属于算法的一部分。训练使用 8×H800,原文没有 DataFoundry 代码或专属数据入口。入口:公众号。结论:值得扫读。
EvoSkill Injection: Red-Teaming Autonomous Skill Generation and Evolution in Self-Evolving Agents — Doyun Kim 等用 SARGE 对 AutoSkill、Voyager、ExpeL 发起 generation、escalation、reinforcement 三类交互攻击。GPT-4o-mini+AutoSkill 的受攻击 unsafe rate 为 19.2%,clean 为 6.5%;verification/conflict prompts 把 19.2% 降到 8.4%,却无法阻止恶意技能被生成、存储和继续演化。当前原文只承诺发布代码与基准,没有可访问入口。入口:公众号。结论:值得扫读。
18–21. 评分规则、轨迹分析、回溯监督与可执行证书
GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation — Yifan Chen 等让模型为同一 query 独立生成多组 rubric,再让不同 rubric 交叉评分各自诱导出的回答;一个 rubric 能否覆盖其他 rubric 捕捉到的要求,构成 cross-rubric comprehensiveness 奖励。评测比较生成 rubric 与专家 rubric 对八个候选回答的排序:GenRubric-8B 的 Spearman ρ 为 0.452,Top-1 一致率为 0.376;GPT-5.2 对应为 0.434 与 0.218。Spearman ρ 衡量整体排序相关,Top-1 衡量生成 rubric 选出的最高分回答能否落入专家 rubric 的最高分集合。8B 从 SFT 的 ρ=0.324 升到 SFT+RL 的 0.452。结果依赖 Qwen3.5-27B judge,辅助奖励也不是单调有效。代码与模型已在官方仓库公开。入口:公众号。结论:值得扫读。
Using Grounded Theory for Agent Behavior Analysis at Scale — Zhuoran Lu 等用多角色编码流程从 7,500 多条轨迹中生成任务定制行为 taxonomy。生成的 codebook 覆盖 ALFWorld、GAIA、WebShop 人类失败模式的 75.0%、73.7%、90.9%;用于失败预测时,GPT-5-mini ROC AUC 为 0.699–0.788。LLM 编码会继承模型盲点,codebook 不能当作行为 ground truth。代码在官方仓库公开。入口:公众号。结论:值得扫读。
From Final Artifacts to Trajectories: Retrospective Process Supervision for Evidence-Grounded Long-Form Generation — Junjie Huang 等把综述、分析报告、法律判决等最终成品视为压缩轨迹,回溯候选过程并用成品与 supporting evidence 双重验证。约 25K verified trajectories 让证据型长文相对 ForwardGen 平均提升 4.8 点;AstaBench LitQA2 accuracy 从 0.20 升到 0.40,citation precision 从 0.47 升到 0.67。方法依赖高质量且证据显式的成品,尚未验证代码执行、多模态与更长规划;代码和数据入口未报告。入口:公众号。结论:值得扫读。
WebWorld: The Browser as a World Model for Self-Improving Web Code — Jiajun Wu 等把 VLM critique 编译成 typed interaction contract,再交给浏览器执行;只有同时通过目标进展与能力保留 certificate 的修复才进入 SFT 池。Qwen3.5-27B 在 HTMLBench 从 47.4 升到 52.7,在 MiniAppBench 从 70.6 升到 85.5;9B 去掉 certificate 只增 0.4 点,完整系统增 4.8 点。实验只有单 seed,当前也只覆盖单文件 HTML;代码、日志和数据仍是计划发布。入口:公众号。结论:值得扫读。
邻近但值得跟踪
22. UTILMEM: Benchmarking Evidence Utilization in Long-Term Conversational Memory
UTILMEM 含 1,717 个实例与 5 个领域。基准不只问记忆系统能否召回事实,还问系统能否整合跨会话证据、识别隐含相关记忆、生成摘要/分析/规划并抵抗干扰。原文摘要没有给统一主表数字,因此本期不补写系统排名。
连接点:UTILMEM 把“取回证据”与“使用证据”拆开,适合补在 Hindsight Memory-PRM、Agent Zero Memory 与 LongMemEval 之后。它是一套利用能力评测,不是一种新的记忆训练算法。结论:邻近跟踪。
23. Perceptually Better, Semantically Worse: Measuring Speech Enhancement Impact on LLM-Based Voice Systems
论文提出 Output Divergence Rate:用 clean speech 的 LLM intent 分类作参考,统计语音增强后最终意图改变的比例。SLURP real test 含 2,974 条、18 个领域与 77 个 intent。MetricGAN+ 提升 PESQ,却把 ODR 从未增强噪声的 0.135 推到 0.318;DTLN-AEC 把 echo WER 从 1.448 降到 0.700,也把 ODR 从 0.836 降到 0.404。PESQ 与 ODR 的 pooled Spearman ρ 为 -0.467,SQUIM-MOS 为 -0.068。
连接点:ODR 提醒音频研发把感知代理指标、转写与最终行动分开验收。ODR 需要 clean reference,只适合离线闭集 intent 回归;论文没有测试开放式播客生成、TTS 听感或在线监控。结论:邻近跟踪。
24. TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models
TEMPO 在 Audio Flamingo 3、冻结 Whisper-large encoder 与 Qwen2-7B 上增加 0.1 秒原子时间戳 token、time-aware projector 与 distance-aware Gaussian loss,再用 GRPO 做可验证时间奖励微调。训练含 119K 样本,评测覆盖多说话人 ASR、diarization、事件定位、密集字幕与带时间戳音乐字幕。
主结果把 multi-speaker ASR WER 从 Qwen3-Omni 的 69.7% 降到 43.5%,diarization mIoU 从 44.4% 升到 71.1%。Stage 1 synthetic-only 的 ASR WER 为 94.0%,加入真实数据后为 44.7%;GRPO 在 SFT 之上只提供一致但较小的增益。
连接点:时间定位是播客检索、章节切分与可编辑字幕的基础,但 TEMPO 不生成语音,也不评价播客的内容组织或听感。冻结 Whisper 表征、区间合并和数据许可仍限制复现;原文没有代码或新数据下载入口。结论:邻近跟踪。
25. Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning
SCC 把 audio-grounded QA 放进数据构造、训练与推理三个阶段。LACap-50k 含 50,222 个 clip,平均时长 61.12 秒、平均文本 491.51 个词。“字幕作为证据”的评测先让模型生成字幕,再让冻结的文本 judge 只读字幕,回答 MMAU、MMAR、MMSU 三个音频理解与推理基准的问题。经过 SCC 训练的 Qwen2.5-Omni-7B 在三个基准上的 judge 准确率为 68.3%/57.0%/62.4%,未经 SCC 训练的同一 backbone 为 65.2%/51.8%/60.6%。一个重要的负信号是:Qwen2.5-Omni-7B 在 Omni-Cloze 选择题上为 75.0%,自由填空只有 25.8%,说明选择题能力没有直接转成忠实生成。
连接点:播客字幕与章节摘要需要事实、遗漏和幻觉验收,SCC 的“字幕作为证据”思路可直接迁移。论文同时使用模型辅助构造与模型 judge,系统又包含 audio-visual 条件;这些结果不能当作纯播客音频的人类金标。代码与 LACap-50k 下载入口未报告。结论:邻近跟踪。
26. Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection
论文把 openSMILE 声学特征写成文本 token,注入 Qwen,以弥合连续声学表征与 LLM 语义空间。Whisper 0.5B frozen 加 openSMILE 后,平均 F1 从 91.09% 升到 93.54%;Whisper 0.5B LoRA-16 加 openSMILE 后为 93.78%,没有 openSMILE 时为 86.48%。在 MLAAD(文中简称 ML)这个未见域上,Whisper 编码器经过微调而 Qwen-0.5B 冻结时,Macro-F1 为 90.50%;在同一 Whisper 编码器上只对 Qwen 做 LoRA-16 且不加 openSMILE 时,Macro-F1 降至 68.18%,加入声学文本 token 后回到 91.17%。
连接点:这是 TTS 上线后的伪造语音检测层,不是 TTS 质量评估。多编码器、模型尺度和两个 unseen domain 增强了证据,但数据仍不足以覆盖持续变化的新型克隆;论文也没有主观听者验证或专属训练代码。结论:邻近跟踪。
把这批论文变成五张验收表
- 上下文压缩表。 同一批任务配对运行 Keep-all、FIFO 与待测策略,逐条记录实际送入模型的 token、工具重调用、任务成功、恢复成本和整轨墙钟时间;importance 与 summary 等额外模型调用另列一栏。
- 记忆生命周期表。 每次回答保留写入、检索、引用和删除的条目 ID,并记录删除后的重答变化。架构准确率、检索命中、证据利用和删除副作用由此分开验收。
- 自进化对照表。 每一轮同时报告冻结 base、best checkpoint、final checkpoint 与 held-out 结果;同一 model-goal pair 重复运行,并预先写明触发回滚的退化阈值。
- 技能复现表。 技能生成后放进 fresh container 重复运行,分别记录至少一次成功、三次全部成功、成功转失败、运行成本、skill bank 变更与有害技能激活。
- 音频闭环表。 WER、UTMOS 等自动指标负责筛选候选;MOS、说话人相似度、指令遵循和未请求变化分别由听者验收。无 Refiner 对照、迭代次数、延迟与调用成本需要同时保留。
本批最值得先开的原文顺序是:TRACER → Hindsight Memory-PRM → S3Gym / Aspire → LoopTTS → APIFlow-Bench → TASPO → reSolve → Selective Forgetting。这个顺序先解决后果归因与自进化验收,再补长依赖评测、动作信用、技能复现和记忆负结果;如果当前研发主线是 TTS,则把 LoopTTS 提到第一篇。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
