9月7日论文雷达:23篇里的自进化、长程评测与四条音频近邻

9月7日论文雷达:23篇里的自进化、长程评测与四条音频近邻

本期从9月7日三个允许栏目182篇论文中收录23篇:9篇直接命中、14篇邻近跟踪,重点比较自进化、轨迹到技能、过程奖励、长程评测与记忆迁移,并明确本批没有TTS或播客生成、评估的直接命中。

9 月 7 日:三栏收录 23 篇,直接命中 9 篇,邻近跟踪 14 篇

9 月 7 日,公众号「arXiv 每日学术速递」发布了人工智能学术速递自然语言处理学术速递语音与音频学术速递。三个栏目合计 182 篇,本期收录 23 篇;9 篇为直接命中,14 篇为邻近跟踪。这 23 篇均不与频道已发文章重复。
本期没有 TTS 生成或评估的直接命中,也没有播客生成或评估的直接命中,同时没有真人 MOS 听测论文。本期的四篇音频相关论文全部落在邻近层,分别涉及口语对话加动作生成、语音服务、音乐可控性和环境音生成。这四篇的动作指标、音乐结果、环境音结果都不能当作 TTS 或播客的结论。
“长程”一词在本期 23 篇里至少有 5 种语义,读者遇到该词需先确认它指哪一层。它可能指延迟最终状态(FinalityBench),指长上下文或记忆存储(Memory Portability、RSM-full),指多步工具或长构建轨迹(KOPA-Bench、τ^τ-Bench),指推理轨迹评测(MedTraj),指基础设施与大规模轨迹评测(Harbor)。同一词在不同篇目指向不同对象,逐篇阅读时用词需要随定位而变。
本次收录形成两条主线:轨迹学习与自进化,以及长程任务训练与评估;音频是独立的第三维,四篇全部为邻近。下文把长程任务训练与评估记为主题①,把轨迹学习与自进化记为主题②。一类论文把模型自身产生的轨迹当作可以再次利用、甚至反复改写的材料,于是出现了自进化、轨迹蒸馏和技能库演化;另一类论文把「让智能体把一件事从头做到尾」当作评测与训练对象,于是出现了长程任务基准、记忆层工程与效果级计分。两条线在本批都有可核验的结果,也各自暴露了短板。
音频维度的四篇形成了独立参照系。它们与主线没有交叉,反而提醒读者,语音生成、语音服务、音乐与环境音四类工作评测的是不同问题,共享“音频”这个词不等于共享同一个评价轴。本期把音频单独成维,一是为了与主线的长程、自进化区分,二是为了守住“没有 TTS 直接命中”这一结论的边界。
主题二「轨迹学习与自进化」在本期最有辨识度,这组工作的共同前提是智能体执行后留下的轨迹本身是资产,可以被蒸馏、被改写、被重组、被复用。RISE 把它当作自改进的方向,CoSkill 把它当作技能演化的原料,Trace2Tower 把它当作技能塔的地基,SQL-Zero 把它当作自博弈的题库,From Interaction Traces 把它当作可版本化的程序库,TROVE 把它当作推理时编辑的路径。这条线回答的问题很一致:模型与系统如何把自己产生过的经验再一次用起来,而不让每轮任务都从头开始。
主题一「长程任务训练与评估」的落点更分散。它的一部分在问「怎么把一件事情从头做到尾并给出可靠评价」,于是有了以动钱结果计分的 FinalityBench、让 agent 构建 agent 的τ^τ-Bench、跨政府 API 的多步工具 KOPA-Bench,以及把 54 个基准接到一起的 Harbor;另一部分在问「长程系统在部署时靠什么撑住」,于是有了跨模型迁移的记忆可靠性、紧凑记忆的合并与组装,以及多 harness 下奖励该怎么分。两条子线合起来,把「长程」从一句口号拆成了延迟、记忆、多步、推理、基础设施五层可以分别测量的对象。
下文先给阅读优先级表,供读者决定先点开哪篇原文;随后给机制地图,讲清各篇到底改的是哪一层;再进入重点精读与值得扫读两部分;最后是可直接拿去用的复现实验检查项。

先看哪几篇:23 行阅读优先级表

这张表用于快速决定先点开哪篇原文。表内口径先在此定义,读者读表前值得先过一遍,否则会误读后续比较。
直接命中指论文主任务直接落在频道目标线上,目标线包括长程任务训练与评估、轨迹学习与自进化、TTS 生成与评估、播客生成与评估。邻近指论文主任务不在目标线上,但对其中一条目标线有明确的可迁移接口。held-out 指训练过程未使用的留出任务或评测集。KOPA-Bench 的 pass@k 指每个任务运行 k 次时至少成功一次的任务比例;FinalityBench 的 pass5 则指 5 个 seed 全部做对的任务比例,两项不能互换。最终性或效果级指以实际后果(例如动钱、现金位置)计分,而不是按单次答案正确率计分。TGC 是 task-goal completion,SR 是 success rate,Acc 是 accuracy。WER 是词错误率,UTMOS 是语音自然度的自动代理分(不是真人听测),RTF 是实时系数。AUROC、FPR、precision、recall 是奖励黑客检测(HackProbe)的指标。凡原始论文未报告的 p 值、置信区间、seed 数,正文一律写「未报告」。
表内“口径”一栏的基本格式为“指标(Table 号或§号,比较对象,增减)”。比较对象决定了增减的含义:RISE 的+2.7 是对 GRPO,CoSkill 的+3.5pp 是对最强非 CoSkill 基线,SQL-Zero 的+6.6 是对 zero-shot base,TROVE 的提分是对 AFlow、MaAS、LAS 三家。同一个“+分”符号下的参照各不相同,逐行都要看比较对象。
优先级列分成 1、2、3 三档:1 为建议精读,2 为可扫读,3 为低优先(邻近,按需点开)。优先级与「直接/邻近」是两套标签,并不一一对应。直接命中的 9 篇里有 6 篇标 1 精读(RISE、CoSkill、Trace2Tower、SQL-Zero、ConsensusBench、FinalityBench),其余 3 篇标 2 扫读;邻近的 14 篇里有 3 篇因证据或方法价值标 1 精读(Multi-Harness、τ^τ-Bench、KOPA-Bench),7 篇标 2,4 篇音频论文标 3。读者判断是否先点开原文,可以看优先级;读者判断论文是否落在频道目标线上,可以看层级。
优先级层级论文(英文原题 · arXiv ID)改动位置(维度)核心可比结果(含比较对象与口径)阅读风险入口
1直接命中CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution · 2609.04865主题②自进化·技能;模型权重+技能结构ALFWorld 平均成功率 98.4%(Table 1,+3.5pp,对比最强非 CoSkill 基线 RetroAgent);WebShop 95.9/90.6%(+4.3/+6.2pp,§4.2)单 seed、双基准(均文本交互模拟)、消融仅 ALFWorldAI 栏 · arXiv
1直接命中RISE: Recursive Improvement via Self-Extrapolating Policy Distillation · 2609.05295主题②自进化;模型权重+奖励(结果→token 级)Qwen3-8B 数学平均 60.0→62.7(Table 1,weight,+2.7);OLMo3-7B AIME24 30.2→46.9(logit,+16.7);3 seed:RISE(weight) 62.4±0.2 vs GRPO 60.1±0.2依赖轨迹低维/近线性;β不可靠无原则检测;继承 RLVR 奖励偏置AI 栏 · arXiv
1直接命中SQL-Zero: Self-Evolving Text-to-SQL · 2609.04697主题②自进化;模型权重+奖励(难度/重复惩罚)BIRD dev:3B 38.7→45.3(+6.6)、7B 51.1→58.4(+7.3,Table 1/§5);对照 human-gold 超出 1.8–3.4pp 但 McNemar 均不显著;迁移 7B 仅首轮(Spider test 82.4 vs 82.2,第 2/3 迭代低于 base)明确所有训练臂单次运行;仅 Qwen2.5-Coder+SQLiteAI 栏 · arXiv
2直接命中TROVE: Adaptive Agent Skill Orchestration via Trace-Grounded Route Validation and Editing · 2609.05019主题②轨迹→技能编排;harness(运行时)+轨迹18 个 backbone-benchmark 块:15 个最佳或并列、16 个最短在线耗时;对 AFlow 16/18 提分 0.12–31.37 分、16/18 省时 2.9–86.7%;DeepSeek 在线 token 13.45M vs 21.11M(−36.3%,§4.2)无 seed/统计显著性,无公开代码AI 栏 · arXiv
1直接命中Trace2Tower: Transition-Aware EigenTrace Induction of Multi-Level Skills for LLM Agents · 2609.05261主题②轨迹→技能结构;轨迹表示+技能ALFWorld Full 87.31%(10.35 步、0.26 非法动作),High-only 84.83%;Full 超 ExpeL 5.72pp、SkillX 8.70pp;3 独立 run(表注 mean±std)WebShop 提升小(50.67%);闭源商用 user 模型AI 栏 · arXiv
2直接命中Harness-agnostic detection and immunization of reward hacking in self-evolving language models · 2609.04665主题②自进化风控;评测/监控+奖励AUROC 0.763 vs 最强基线 0.663;FPR 0.706→0.434、precision 0.311→0.382、recall 0.845、delay 0.28 代(Table 1-4);F2 是唯一 gain/cost>1 免疫档(ratio 1.11)FPR 0.434 仍高;域限 prompt 级 host+数学探针AI 栏 · arXiv
2直接命中From Interaction Traces to Persistent Skills: Online Evolution for Computer-Use Agents · 2609.04869主题②技能库在线演化;技能/记忆+轨迹技能期 Full vs Empty 差 5.7–18.6pp(GIMP 80.2 vs 74.4、VLC 64.0 vs 45.4、Writer 63.9 vs 52.0、Thunderbird 74.7 vs 62.3);GIMP 库 27 技能、跨任务检索占 43.3%每条件-域单 run 无显著性;warm-up 已偏(Writer pre +9.1pp)不能因果归因AI 栏 · arXiv
1邻近跟踪What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents · 2609.04518主题①RL 训练;harness+评测(密封 oracle)评估 harness 把平均 solve rate 从 2.14%→9.27%(factor 4.3);训练配方只动 1.16(6 recipe 均值 5.55–6.46%);held-out harness 上 Cross−Within=+0.25pp [−0.48,+1.02]绝对 solve rate 低(1–10%);单模型族/4 harness/Python-onlyAI 栏 · arXiv
2邻近跟踪SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agents · 2609.04629主题①过程奖励;奖励+轨迹(违规几何)N=7 聚焦 21 episode:terminal 0/21、best scalar 9/21、structured 21/21;N=5 全 24 场景:structured 120/120(scenario-clustered Wilcoxon p=0.004);跨 4 模型 ANM:terminal 0/15 vs structured 15/15域窄(电力/楼宇仿真);门控依赖确定性仿真前提AI 栏 · arXiv
2邻近跟踪Iris: Climbing to the Search Frontier · 2609.04304主题①搜索智能体训练配方;模型权重+harness(CM)Iris-mini 82.2/84.8/86.9/52.3,Iris-pro 88.6/85.1/92.9/56.4(Table 1,CM=discard-all);对 XYZ 30–35B:BrowseComp +3.4、DeepSearchQA −2.6权重未发布;单 rollout 评测、未见 seedAI 栏 · arXiv
2邻近跟踪Towards Understanding Pause Token Fine-Tuning Dynamics: A Mode Retention Perspective · 2609.04489主题①推理训练动力学;模型权重+轨迹(token 层)math 增益相对 SFT +1.7~+6.3(如 Qwen3-1.7B Math Avg 51.38→53.85);MBP-GRPO vs Standard GRPO 最终四基准平均+1.31(1.7B)、+0.40(4B);boundary 放置是唯一一致胜者无 seed 统计;LoRA 初测增益温和NLP 栏 · arXiv
1直接命中ConsensusBench: Benchmark of Consensus Nodes for LLM Reasoning via Outcome Reward Densifying · 2609.04648主题①(含②)过程奖励;奖励+评测DAPO+ConsensusPR_CL on Qwen3-4B:MATH-500 58.4→66.6、AIME24 40.0(Table 3-5/§5.3);4B hard 组 DAPO 41.8→49.3(+17.9%相对);8B 峰值 GSM8K 91.2、MATH-500 77.6无 seed/统计检验;节点提取用闭源模型、数据集未公开NLP 栏 · arXiv
1直接命中FinalityBench: An Effect-Level Benchmark for Agent Decisions Under Delayed and Conflicting Financial Finality · 2609.04706主题①长程评估(延迟最终状态);评测finality gate 精确率 85.4% [79.9,90.2]、pass5=85.4%(Table II/III/IV);乐观发货策略单任务精确率 65.7%(套件第二)但 paired loss $253.53 为最差(gate $103.91),66.0%任务取不可逆动作模型臂窄(Gemini 3 档+开放档全缺);模拟世界、成本常数为“可辩护整数”AI 栏 · arXiv
2邻近跟踪Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability · 2609.05339主题①记忆可靠性;技能/记忆KG-fixed 换 writer 精度变化仅+0.0004±0.0020(Table 3);NOTES 方向不对称−13.28/+9.91pp;RAG 混索引只拿 11.90pp 全量重嵌入增益中的 4.96pp(Table 4,H2 支持+6.95pp)仅一对同规模开放模型;脚本化客观负载;v1 无公开仓库AI 栏 · arXiv
1邻近跟踪τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction · 2609.04611主题①评测(agent 构建 agent);评测最强 Claude Code+Opus 5 总分 23.9%(air 55.9/retail 72.8/telecom 48.2/bank 5.9),专家参考 82.2%(Table 2/§5);banking 全域语料档 1.1%每配置每任务单次构建;无公开代码、无同行评审痕迹AI 栏 · arXiv
2邻近跟踪Compact-Memory LLM Agents via Online Max-Member Clustering and Atom-Aware Packing · 2609.04915主题①记忆层方法;技能/记忆4k 预算 RSM-full 0.311 达 Full-Context 83%质量@32% token(Full-Context 0.373/12,519 tok vs RSM-full 4,001 tok);atom-aware vs flat 拼接+5.02±1.00pp(Table 4,t-CI [+2.54,+7.50])v1 无仓库 URL;judge 依赖 GPT-5.4 聚合端点AI 栏 · arXiv
1邻近跟踪Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe · 2609.05395主题①评测+训练;评测+权重(GRPO)+轨迹(数据合成)4B pass@1 0.1758→0.3094(+13.4pp)、pass@4 0.3103→0.4690;9B 0.3275→0.4310(+10.4pp);9B vs 未调优 27B 0.4310 vs 0.4482(96%,Table 1)live API 端点漂移限制复现;对比只对自身变体AI 栏 · arXiv
2邻近跟踪Constructing and Evaluating Clinical Reasoning Trajectories for Medical Agent · 2609.05090主题②轨迹评测;评测+轨迹表示CECMed TC 0.390→0.642(+25.2 个百分点)、QWC 0.738;hallucination QWC 0.025 vs NC 0.189(Table III/§IV-V);链长 4 步为实用上限无公开代码/数据;LLM 自循环评测;采样重复 n 未报告AI 栏 · arXiv
2邻近跟踪Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation · 2609.04298主题①评测基础设施;评测+harness模型固定效应范围 0.451 是 harness 0.087 的 5.2×;每基准 3 任务恢复系统排名平均ρ≈0.923;无配置过 30%(GPT-5.5+Codex 28.0%,native $178/run);约 1/3 最难候选任务是 broken 而非难54 基准中长程专项占比低;评测对象覆盖面受限AI 栏 · arXiv
3邻近跟踪Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue · 2609.04250语音生成(spoken dialogue+动作)邻近;音频·语音生成Seed-TTS-Eval WER:Motion-Omni-Q7 2.62(omni-modal 组最低,Table 2);VoiceBench Overall 47.63;UTMOSv2 3.77(低于 Qwen3-TTS 4.05);RTF 0.78(快于实时)无真人 MOS 听测;动作/唇形指标不得当 TTS/播客结论音频栏 · arXiv
3邻近跟踪Scalable Context Orchestration for Serving LLMs Over Voice · 2609.04288语音 serving(长会话编排)邻近;音频·serving语速对齐 MAE 38.26→18.23 WPM(降 52.4%);丢包误打断 46.0%→0.9%;MSP-PODCAST 每轮$0.005634,比 OpenAI 便宜 24.9×(RQ1/RQ2)答案质量相对 OpenAI 全历史有损(RT2 98.7%/MSP 88.7%);成本随计费模型漂移音频栏 · arXiv
3邻近跟踪Pitch-class Steering for Diffusion-based Music Generation via Latent-space Probes · 2609.04516音乐生成可控性邻近;音频·音乐λ=0.05 melodic coherence 0.274±0.084 vs baseline 0.112(相对 2.4×,p_base 5.7e-6);CLAP 0.279 vs 0.274、FAD-OpenL3 260.4 vs 267.7(均无显著退化)单基座(Stable Audio Open)、独奏钢琴域;无听测音频栏 · arXiv
3邻近跟踪SCAPES: Semantically Conditioned Autoregressive Prior for Environmental Sounds · 2609.04634环境音生成邻近;音频·环境音Applause FAD 4.35 vs RAVE 39.06;36M 参数、RTX 4090、<8GB VRAM、约 1h 训练、2×实时(§4.1);但非全胜(Forests FAD 11.05 vs 3.49 RAVE 胜)与 RAVE 比较不对称(作者自认);作者自述不支持语音/复杂复调音乐长程结构音频栏 · arXiv
表外两条口径约束需要读者提前知道。τ^τ-Bench 的 23.9% 与 KOPA 的 pass@1 0.43 都叫“通过率”或“成功率”,两处的单位完全不同;前者是部署模拟里通过的比例,后者是 4 次 rollout 中至少 1 次成功,两数不能并排比较。Harbor 的“无配置过 30%”说的是 82 个精选难任务这一口径,这一结果不能泛化到所有任务。

机制地图:这些工作各自改了什么

读者容易把本期 23 篇压成同一个“成功率提升”的故事,这样会丢掉最关键的区分。各篇真正改的对象不同。机制地图把“改了什么”说清楚,规定跨论文只在同一维度内比较,跨维度只说明它们回答的是不同问题,不做数值排名。这一节的重要性在于:读到后面精读与扫读时,读者能先建立“这篇改的是哪一层”的锚点,也就能判断它和另一篇到底能不能放在一起比。
六个维度在实际工作里常有交集,判断一篇该归到哪一层,要看它最核心的贡献落在哪里。一篇论文可以同时改权重与奖励(RISE、SQL-Zero、ConsensusBench),可以同时改轨迹表示与技能结构(Trace2Tower),也可以只改记忆格式而不动任何参数(Memory Portability、From Interaction Traces)。读者做跨篇比较时,只能把两篇放在它们共同的主维度上比;若一篇改权重、另一篇只改 harness,两篇回答的是不同问题,比出来的数字没有意义。这一层判断在优先级表里已用「改动位置」列标出,读者读表时可顺着这一列先把 23 篇按维度分堆,再决定哪些可以并排看。

六维分区

本期涉及六个维度。每个维度有明确的定义,一篇论文归属到它主张的那个主维度。
模型权重维度指更新、蒸馏或微调了参数。命中此维度的包括 CoSkill、RISE、SQL-Zero、Iris、Pause Token、ConsensusBench、KOPA-Bench。CoSkill 在推理 agent 与元技能 agent 之间用共享主干做联合 RL,改的是参数与技能结构两处;RISE 用轨迹外推教师做 OPD 蒸馏,改的是参数与奖励目标;SQL-Zero 用挑战者与求解者交替 GRPO,改的是参数与任务分布;Iris 用反构任务加 SFT-RL 爬坡,改的是参数与训练配方;Pause Token 用掩码边界停顿 token,改的是 token 层的训练动力学;ConsensusBench 把奖励致密化后回灌 GRPO 与 DAPO,改的是参数与奖励;KOPA-Bench 用 GRPO 微调并配数据合成,改的是参数、轨迹与基准。这些工作直接改参数,与只改环境或只改服务层的做法要分开。
harness 维度指运行时、编排、上下文管理或协议,不改权重。命中此维度的包括 TROVE、Iris、Multi-Harness、Harbor、llmovoice。TROVE 在推理时做选择性路径编辑,属于运行时编排;Iris 的上下文管理 CM 是推理期装置,它改的是 harness 而非策略本身,这也是 Iris 论文自己强调的“报告 CM 下的成绩会掩盖策略本身的贡献”;Multi-Harness 把评测 harness 当作主变量,量化了评测装置对成绩的影响;Harbor 用统一适配器与运行环境做大规模评测,属于基础设施;llmovoice 做语音长会话的上下文编排,属于 serving 层。harness 优化带来的收益与权重更新带来的收益不能混在一起。
技能与记忆维度指外部持久状态,包括技能库、记忆格式、合并组装与迁移。命中此维度的包括 CoSkill、Trace2Tower、From Interaction Traces、Memory Portability、RSM-full。CoSkill 的分层技能库随策略一起演化;Trace2Tower 的技能塔由轨迹归纳而来;From Interaction Traces 把轨迹转成带版本号的持久程序库;Memory Portability 研究记忆跨模型升级能否存活;RSM-full 研究紧凑记忆在提示预算下的合并与组装。记忆迁移与拷贝是两回事。Memory Portability 给出的一组对照说明这一点:把写记忆的模型换成另一个模型,KG-fixed 格式的精度变化仅+0.0004,而 NOTES 格式在两个方向上差别巨大,Llama 读 Qwen 笔记+9.91pp、Qwen 读 Llama 笔记−13.28pp。记忆质量还由合并与组装方式决定,RSM-full 显示合并规则贡献+5.7pp、atom-aware 打包+5.02pp,而检索规则在 BGE 栈上为 null。
轨迹表示维度指把轨迹抽象或重建成什么,可能是状态、样本、图、技能或环境。命中此维度的包括 TROVE、Trace2Tower、SiLR、MedTraj、KOPA-Bench、From Interaction Traces。记录下来的轨迹扮演的角色不同,逐篇需分辨:TROVE 把轨迹蒸馏成技能注册表与转移图,作为编排材料;Trace2Tower 把轨迹归纳成技能塔,作为复用结构;SiLR 把轨迹的违规几何当作准入与奖励的表示;MedTraj 把推理轨迹当作构造与评估对象;KOPA-Bench 把以实机验证的边合成可执行轨迹,作为训练数据;From Interaction Traces 把轨迹转成程序库,作为共享记忆。轨迹在其中充当输入、状态、训练样本、环境生成材料或信用分配对象,读者需一一对上。
奖励维度指结果级奖励与过程级奖励的转换。命中此维度的包括 RISE、SQL-Zero、SiLR、ConsensusBench。RISE 把稀疏结果奖励变成稠密 token 级目标;SQL-Zero 用难度奖励与重复惩罚构造自博弈信号;SiLR 用分支级违规几何做结构保持的过程奖励;ConsensusBench 用共识节点致密化结果奖励。结果奖励、过程奖励、虚假优势三者要分开。过程信号的致密化来源各不相同,这正是三方案对照时要逐篇报告的内容。
评测维度指基准、协议、计分口径或基础设施。命中此维度的包括 FinalityBench、τ^τ-Bench、Harbor、KOPA-Bench、MedTraj、HackProbe。FinalityBench 用效果级计分衡量延迟最终状态下的决策;τ^τ-Bench 把“构建一个可部署 agent”设为任务;Harbor 提供统一评测基础设施与策展子集;KOPA-Bench 给出多步工具基准;MedTraj 给出推理轨迹的质量评测;HackProbe 做奖励黑客的检测与免疫,属于监控型评测。效果级、行为级、任务级、质量维度打分四种口径不能用在同一组比较里。
本篇目可以同时跨几个维度,但比较时只能挂到它主张的那个主维度。优先级表里的“改动位置”即该篇的主维度。

音频四域

音频在本期是独立第三维,四篇全部为邻近,且四个子域必须分开,不能混成一类。
语音生成子域指文本到语音或对话语音合成。Motion-Omni 属于这一子域,其模型原生输出语音加全身动作。这篇的动作指标、唇形指标属于动作维度,不能当作 TTS 结论,且本篇没有真人 MOS 听测。它给出的语音侧数字只有 WER 与 UTMOS 代理,这两项分别衡量内容正确性与自然度代理值,衡量不了听感。
serving 子域指语音 LLM 的会话服务与上下文编排。llmovoice 属于这一子域,它不改生成质量,只做长会话的上下文与运行时刻控制,评测的是服务侧指标。这篇的“系统服务”含义与“语音生成 serving(TTS 推理部署)”不同,不能混写。它报道的语速对齐、丢包误打断、每轮成本,都是系统层的指标。
音乐子域指可控音乐生成。Pitch-class Steering 属于这一子域,域明确为音乐,不能当作语音。它在扩散音乐生成的 VAE 潜空间上训练一个小探针,推理时把探针当作可微损失做引导。
环境音子域指环境纹理合成与语义插值。SCAPES 属于这一子域,作者自述不支持语音与复杂复调音乐的长期结构。它的域边界由生成对象决定,10Hz 控制率加 5 个原子的局部感受野难以维持数秒级的音素或和声一致性。

同一维度内的三条对照

三条对照把本期最主要的同维度比较关系摆出来。这三条是读者做跨篇比较时最该握住的骨架。
第一条是自进化的两条技能线。Trace2Tower 与 CoSkill 都做“轨迹到技能”,两条路线对照价值最高。Trace2Tower 用转化感知的近似谱分解把原始轨迹归纳成三层技能塔,属于结构归纳;CoSkill 用共享主干的推理 agent 与元技能 agent 联合 RL,属于策略共适应。结构归纳的收益来自显式恢复“成功对齐的行为结构与层级”,策略共适应的收益来自推理策略与技能演化一起被优化;两条路线的上下文代价也不一样。Trace2Tower 相对 SkillX 在 ALFWorld 省输入 token 30.5%、省注入上下文 63.9%,CoSkill 则通过交替更新间隔的消融显示,交替更新太频繁会大幅掉点,在 Step 120 只到 78.12%或 81.25%。读者对照这两篇时,应分别报结构与策略的收益,并把上下文代价分开。
第二条是过程信号的三方案。ConsensusBench 在数学推理域用共识节点做结果奖励致密化,不学过程奖励模型,证据中强;SiLR 在仿真控制域用分支级违规几何做结构保持的准入与过程奖励,形式化强,域窄;RISE 用轨迹外推把结果奖励变成 token 级目标,属智能体领域的致密化。三者都致密化过程信号,但各自致密化来源不同:ConsensusBench 来自正确 rollout 中语义等价的中间结论,SiLR 来自违规状态的分支几何,RISE 来自当前 checkpoint 与滞后锚点之间的参数位移外推。对照时应报告各自的来源,并区分数学域、控制域两类证据。
第三条是长程评测的计分口径分层。效果级以实际后果计分,FinalityBench 以动钱结果计分,把终端现金位置减去成本、负债、争议与升级;行为级以部署模拟的客户与状态结果计分,τ^τ-Bench、KOPA-Bench 属于这一层,KOPA 再加 RESPONSE、ENVIRONMENT、ACTION 三轴;任务级以 pass 计分,Harbor 属于这一层;质量维度打分适用于 MedTraj 与 RSM-full。四层口径不可混合排名。若把τ^τ-Bench 的 23.9%与 KOPA 的 pass@1 0.43 放在一起,读者看到的两个“通过率”单位不同;若把 FinalityBench 的单任务精确率与 paired loss 放在一起,读者会看到两种排名在 7 处不一致。

重点精读:九篇主稿

这九篇是本期证据强度与新闻性最高的篇目。每篇按统一字段展开:研究问题、改动位置、关键结果(含比较对象与口径)、证据边界、对频道目标线的连接点、关系与结论。读者读完这九篇,基本上就抓住了本期两条主线的骨架。

RISE: Recursive Improvement via Self-Extrapolating Policy Distillation(arXiv:2609.05295,直接命中·主题②)

研究问题:在线策略蒸馏(OPD)的瓶颈在于教师质量,而教师往往来自更强的外部模型。RISE 绕开外部教师,用模型自身 RLVR 训练轨迹构造“合成教师”:对当前 checkpoint 与滞后锚点θ0 之间的位移做参数空间或 logit 空间外推 φ(π_future)=φ(π_θ0)+β·(φ(π_θ′)−φ(π_θ)),β>1,把稀疏的结果奖励变成稠密的 token 级目标;教师每轮刷新,蒸馏随之递归自改进。这个阶段的每个迭代里,RLVR 先更新θ→θ′,提供“有根据的方向”,OPD 再用外推教师做逐 token 精修。
改动的位置(维度):模型权重为主,奖励为辅。RISE 不改环境与服务层,它把结果奖励转化为逐 token 目标并据此蒸馏参数。锚点 EMA 系数η=0.1(Qwen)或η=1(OLMo),外推系数β0=1.2 线性衰减到 1,K=100(代码 K=20),蒸馏采用 JS 散度损失,复用 RLVR rollout、不额外采样。关键判断是,模型自身 RLVR 轨迹的低维线性结构足以充当自改进教师,不需要外部模型或特权条件。
关键结果(含比较对象与口径):
  • Qwen3-8B 数学平均 60.0→62.7(Table 1,weight 外推,+2.7);Qwen3-1.7B 45.4→50.2(logit,+4.8);OLMo3-7B 的 AIME24 30.2→46.9(+16.7)、数学平均 47.6→56.4(+8.8,logit)。1
  • 三 seed:RISE(weight) 62.4±0.2,GRPO 60.1±0.2(8B);RISE(logit) 49.6±0.4,GRPO 45.1±0.4(1.7B)(附录 C.10)。
  • 智能体任务(Table 3):ALFWorld 成功率 GRPO 75.0→RISE(weight) 84.4(+9.4);WebShop 准确率 63.3→74.2(+10.9)。
  • 计算匹配:compute-matched 对照 GRPO-2×只+0.5/+1.9,RISE 在其预算上+2.7/+4.8(附录 C.9);墙钟开销约 1.6×(8B)/1.3×(1.7B)GRPO,无额外采样成本。
证据边界:三 seed 已报;无假设检验;论文未给代码仓库;依赖训练轨迹低维或近线性,β何时不可靠没有原则性检测;继承 RLVR 奖励偏置,奖励可被黑客化时外推会放大虚假方向;GPU 时数未报告。消融显示β安全区间随训练收窄,step 50 时β=2.0 还+7.3,step 100 同一β即−15;resample 与 rollout reuse 持平(62.5 对 62.5)。
对频道目标线的连接点:直接把 RLVR 训练轨迹当作可蒸馏的自改进信号,命中主题二“自进化”与“轨迹学习”,并连到主题一长程 RL 的奖励信号设计。它给出的是“自进化方法论”里证据链最完整的一条。
关系与结论:精读(优先级 1)。可迁移点是模型自身滚动轨迹的低维结构足以充当自改进教师,不需要外部模型或特权条件;跨四类任务、两个模型家族、三 seed 并有 compute-matched 对照,是本篇证据链完整的原因。
这点读法值得单独说。RISE 的贡献落在机制层面,它用一个可复现的方法把「自进化」讲清楚:不用更强的外部教师,只用模型自身的 RLVR 轨迹做参数或 logit 空间的外推,并且给出 compute-matched 对照。把它与 ConsensusBench、SiLR 放在一起读,读者会看到「把结果奖励变成稠密信号」至少有三条路,RISE 走的是参数位移外推。它的风险在β,β的安全区间随训练收窄,同样的β在第 50 步还加分、第 100 步就变成负的,部署时需要一个能感知训练阶段的保护。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution(arXiv:2609.04865,直接命中·主题②)

研究问题:元技能传统上被当作固定工作流或被动技能库,技能演化由外部编排或固定规则管理。CoSkill 把元技能改成可学习的 Meta-Skill Agent,与 Reasoning Agent 共享同一 LLM 主干 Qwen2.5-7B-Instruct,做成共享参数多智能体半马尔可夫决策过程(MSMDP)联合优化;策略为 GiGPO,技能编辑动作集为 Insert、Update、Delete、Keep,后验编辑技能奖励用 M 次验证尝试相对基线的均值计算。
改动的位置(维度):模型权重与技能结构两处。CoSkill 离线先用执行轨迹初始化分层技能库,在线联合 RL;检索先取任务技能、再限定其子集取步技能。技能演化与推理策略一起作为可学习过程被联合优化,而不是由外部编排或固定工作流管理。作者的核心主张是“把推理与元技能建模为共享单主干的合作团队,就能实现端到端的共适应”。
关键结果(含比较对象与口径):
  • ALFWorld 平均成功率 98.4%(Table 1,+3.5pp,对比最强非 CoSkill 基线 RetroAgent;六个任务里五个达到 100%);WebShop 得分 95.9、成功率 90.6%(+4.3/+6.2pp,§4.2)。2
  • 相对 Skill1,ALFWorld 平均+4.7pp、WebShop 成功率+15.6pp(§4.2 文本)。
  • 消融(Table 2,ALFWorld,训练 checkpoint):去掉 Meta-Skill RL 收敛 92.19%(−3.12pp);去掉分层技能库 93.75%(−1.56pp);交替更新间隔 10/20 在 Step 120 只到 78.12/81.25%(−17.19/−14.06pp);无 RL 时累计技能晋升 739 次 vs RL 387 次(−47.6%),空 step 技能束率 12.4%→0.2%(§4.3-4.4)。
证据边界:单 seed、无统计检验;GPU 时数未报告;双基准均为文本交互模拟环境;消融只在 ALFWorld 单一基准上。作者在§5 强调论文未做跨骨干、跨环境的外推讨论,外部技能演化的闭源 LLM 不保证对齐是其主要论点。论文给出了官方代码仓库
对频道目标线的连接点:命中主题二“分层技能演化+技能策略共适应”,对长程智能体 RL 的技能复用是核心方法参考。
关系与结论:精读(优先级 1,与 RISE 并列为主题二自进化技能线主推)。可迁移点是技能演化应当与推理策略联合优化;读者引用时应写清 CoSkill 改的是参数与技能库两处,并把单 seed、双基准的局限带上。
CoSkill 与 Trace2Tower 互为镜像,一篇改策略、一篇改结构。CoSkill 的收益来自推理与元技能共享主干做联合 RL,代价是单 seed、无统计,且双基准都是文本交互模拟环境;消融只在 ALFWorld 上做。读者只想读「技能怎么演化」可以从这篇入手,想读「技能结构怎么被显式恢复」则读 Trace2Tower,两篇的结论不能合并成同一个「技能更好」的说法。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Trace2Tower: Transition-Aware EigenTrace Induction of Multi-Level Skills for LLM Agents(arXiv:2609.05261,直接命中·主题②)

研究问题:轨迹检索浅层化、技能总结扁平化。Trace2Tower 把原始轨迹抽象成规范事件,构建受语义兼容、转移动力学、结果证据约束的统一图,再用对比谱分解隔离“成功对齐行为模式”并压制失败捷径,形成 action、procedure、strategy 三层技能塔,经 verifier 引导反馈持续精修。
改动的位置(维度):轨迹表示与技能结构两处。Trace2Tower 离线做轨迹归纳,在线两种策略部署;High-only 只用 3 条策略路径改写紧凑计划,Full 额外注入至多 8 条 step 技能;无权重更新,另有 verifier 反馈驱动的冻结塔图编辑,编辑算子含 split、merge、promote、downweight 八类。Skill Author 默认 GPT-5.4,Skill User 默认 DeepSeek-V4-Flash,交互上限 20 步。
关键结果(含比较对象与口径):
  • ALFWorld Full 成功率 87.31%(10.35 步、0.26 次非法动作),High-only 84.83%;Full 超 ExpeL 5.72pp、超 SkillX 8.70pp;WebShop Full exact success 50.67%(超 SkillX 1.34pp),High-only 48.33%(reward 0.7115,接近 Expert-Crafted 0.7183)。三独立 run,表注给 mean±std。3
  • 相对 SkillX,Full 在 ALFWorld 省输入 token 30.5%、省注入上下文 63.9%。
  • 消融(Fig 6、附录 E.3):去掉 transition,87.31→70.15(39→19 procedures、118→76 strategies);去掉 outcome 或去掉 contrastive 均到 73.88。
  • 跨模型(Table 2):Flash-authored Tower 对两种 user 均+12.69pp;GPT-5.4 Tower 让 Flash user 65.67→88.06(34 胜 4 负,p=6.04e-7);Pro user 79.10→85.82(p=0.150)。
证据边界:三 run;无显著性检验或置信区间;WebShop 提升幅度小、基线绝对水平低;用户模型为闭源商用 API(GPT-5.4 与 DeepSeek-V4-Flash)。构造消耗为 SkillX 的 GPT token 的 16.85%(相对值)。论文给出了官方代码仓库
对频道目标线的连接点:命中主题二“轨迹学习”,与 CoSkill 同属“轨迹到技能结构”线,但用图解谱分解而非 RL 演化;两篇可对照呈现结构归纳与策略共适应两种范式。
关系与结论:精读(优先级 1)。可迁移点是显式恢复行为结构比浅层轨迹检索或扁平技能总结更有利于跨任务可迁移、上下文高效的技能复用;全文的图谱谱分解与 verifier 引导的冻结塔编辑,是本篇区别于 CoSkill 的关键。
Trace2Tower 是结构归纳的对照样本。它的技能塔是冻结的、只由 verifier 编辑的,不更新权重,因此能清晰地看到「结构」本身的贡献。跨模型实验里,GPT-5.4 技能塔让 Flash 用户从 65.67 升到 88.06,说明结构技能的迁移性;但用户模型是闭源商用 API,复现门槛高。读者引用它的数字时,应把三 run 的 mean±std 与 WebShop 提升小一起带上。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

SQL-Zero: Self-Evolving Text-to-SQL(arXiv:2609.04697,直接命中·主题②)

研究问题:Text-to-SQL 依赖标注的自然语言-查询对。SQL-Zero 实现零标注自进化:挑战者(任务提出者)与求解者(solver)从同一 LLM 出发互搏,唯一真值是数据库执行;难度奖励紧盯“hard but solvable”,模板级重复惩罚防坍缩;两角色交替 GRPO 更新,权重随迭代继承,形成“spiral”式循环。
改动的位置(维度):模型权重与奖励两处。挑战者先训 3 步循环,提出任务、执行过滤、模板去重,再训求解者;每主迭代保留 20,000 对、做 78 次 solver 更新;评估用 OmniSQL 提示词加 greedy@1 与官方 EX 计分器。两个角色同一起始 LLM,权重随迭代螺旋式继承。
关键结果(含比较对象与口径):
  • BIRD dev 较 zero-shot 基线:3B 最佳迭代 45.3 vs 38.7(+6.6)、7B 58.4 vs 51.1(+7.3,Table 1/§5);首轮即有+5.1/+6.3。
  • 对照同配方 human-gold 控制(8,390 对、64 库),三迭代均超出 1.8–3.4pp,但 McNemar 精确检验均不显著(p=0.29/0.41/0.14,Holm 后 0.58/0.58/0.41,§5)。4
  • 生成语料与人类金标模板几乎不相交(互相覆盖<0.5%/库,§5)。
  • 迁移随规模反转:3B 每迭代均超 base;7B 仅第 1 迭代保持(Spider test 82.4 vs 82.2、Spider-Syn 73.7 vs 71.5),第 2/3 迭代在 Spider test 低于 base 2.4–2.5pp(79.7/79.8 vs 82.2)。
证据边界:作者明确所有训练臂均为单次运行;只做配对 McNemar 对照评测噪声、不控制训练 seed;GPU 成本未报告;仅 Qwen2.5-Coder 加 SQLite 单次生成;覆盖比较是描述性诊断;3B 迭代序列 43.7→45.3→44.0 非单调、7B 第三轮 58.4 但代价迁移,策略熵 0.34→约 0.06 未重置。7B 静态生成 75 步内崩盘,靠难度奖励加重复惩罚救回。论文给出了包含代码、配置和提示词的匿名制品仓库
对频道目标线的连接点:命中主题二“自进化”(零标注自博弈、交替 GRPO)与主题一长程 RL 的难度课程;对“自进化不保证累积增益、迁移随规模反转”给出明确负证据。
关系与结论:精读(优先级 1)。可迁移点是执行可验证的自博弈能在零标注下训出有竞争力的求解器,但增益不随迭代复合、7B 迁移只限首轮,自进化需要显式课程与熵控制。这篇把阈值、配对检验、预算对齐例外都写明白了,是“诚实的自进化加控制组统计”的样本。
SQL-Zero 是自进化边界的诚实样本。它把阈值、配对检验、预算对齐例外都写了出来,结论克制;7B 迁移仅限首轮、3B 迭代序列非单调,是「自进化增益不自动复合」的硬证据。读者引用它的任何增益数字时,必须同时带上「所有训练臂单次运行、仅 Qwen2.5-Coder 加 SQLite」这两个限定,否则数字会被读成普遍结论。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

ConsensusBench: Benchmark of Consensus Nodes for LLM Reasoning via Outcome Reward Densifying(arXiv:2609.04648,直接命中·主题①含轨迹要素)

研究问题:长推理轨迹下结果奖励稀疏,文本到答案的路径上缺少可验证的中间信号。ConsensusBench 提供数据集与基准,从每个 prompt 的 N 条 rollout 中过滤正确轨迹,对语义等价的中间结论聚类成“consensus nodes”,即可验证的子结果;ConsensusPR 把这些节点做成规则化过程奖励,融入 GRPO 与 DAPO,节点匹配加三种聚合方式 linear、max、CL。新增 Acc、NCR、TPN 三重评估指标。
改动的位置(维度):奖励与评测两处。ConsensusBench 只替换 RLVR 的奖励计算模块,GRPO/DAPO 优化管线不动;训练用 N=8 rollouts、α=0.5(linear 版),verl 框架。节点提取用闭源模型,这是作者自述的偏置风险。
关键结果(含比较对象与口径):
  • DAPO+ConsensusPR_CL 在 Qwen3-4B-Base 把 MATH-500 58.4→66.6,AIME24 达 40.0(Table 3-5/§5.3)。5
  • 8B 峰值 GSM8K 91.2、MATH-500 77.6、ConsensusBench Acc 89.7;4B DAPO+linear 的 NCR 78.4 最高。
  • 难度拆解(4B,Table 5):hard 组 DAPO 41.8→CL 49.3(+17.9%相对提升);easy 组 76.7→83.7(+9.1%)。
  • 8B 相对 4B 同配置 MATH-500 +11.0%、ConsensusBench +2.5%;TPN(Table 4)DAPO 320.47→+linear 726.26 等,节点奖励拉长推理;α在 0 与 1 两端外稳健,小α偏节点奖励利于 AIME 与 NCR、α≈0.6 利于简单任务(Fig 2、附录 D.3)。
证据边界:未见 seed 数与统计检验;成本未报告;数据构造用了闭源模型,存在偏置风险;未做独立过程奖励算法,只并入结果信号;域限数学推理。论文没有给出代码或数据下载链接。
对频道目标线的连接点:命中主题一“长程任务训练与评估”的结果奖励致密化,并含主题二轨迹要素(正确轨迹的中间共识节点是无标注过程信号);与 RISE(轨迹外推致密化)、SiLR(几何过程奖励)构成“过程信号三方案”对照。
关系与结论:精读(优先级 1)。可迁移点是正确最终答案依赖少量共识节点型中间结论,把结果奖励沿推理路径致密化、而不去学过程奖励模型,能兼顾可验证性、低噪与可扩展;难度与增益的相关性(hard 组+17.9%相对)是本期最强传播点之一。
ConsensusBench 是过程奖励线的主推。它与 RISE、SiLR 构成三方案,读这一篇能理解「过程信号」是在哪里产生的;它的信号来自正确 rollout 里语义等价的中间结论。hard 组+17.9%是相对提升率,不是百分点差,引用时要带这一口径。节点提取用了闭源模型、数据集未公开,这两点限制复现。 入口:自然语言处理学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents(arXiv:2609.04518,邻近·主题①)

研究问题:多工作流 RL 里藏着两个动作,一个是“暴露给多个 harness”,一个是“在同一个相对优势组内比较奖励”。Multi-Harness 把第二个动作(GRPO 分组边界)隔离出来,研究它在仓库级编码中的效果;Within 指每任务-harness 对一组,Cross 指同任务跨 harness 池化。
改动的位置(维度):harness 与评测(密封 oracle)为主,训练配方为辅。同一 Qwen3-8B 做 supervised warm start(8,841 记录、186 任务),四个 harness(Aider、OpenHands、Qwen Code、SWE-agent)在同一 SWE-Gym 池采集冻结记录;四个 arm 重放相同的 81,216 记录(183 任务)、81,200 次更新,token、reward、loss mask 相同;用密封 SWE-bench Verified oracle 在 4 个源 harness 加 1 个未见 minimal harness(weak-ReAct)打分。另有 re-collected(一半数据 on-policy)arm 与 seed-17/29/41 重训。
关键结果(含比较对象与口径):
  • 24,000 次密封评测上,评估 harness 把平均 solve rate 从 2.14%移到 9.27%(factor 4.3);训练配方只动 1.16(6 个 recipe 均值 5.55–6.46%)。6
  • held-out harness 上 Cross−Within=+0.25pp [−0.48,+1.02](k=8),三 seed 池化+0.16 [−0.41,+0.72];单 seed 估计符号翻转(+0.62/+0.05/−0.20)。
  • 各 arm 自身 seed 范围 0.42–0.45pp 大于二者之差。
  • advantage 中 harness 身份:Cross +4.48pp(超 shuffled-label null)、Within +0.02pp;on-policy 半重采样不改变结论。
证据边界:Within/Cross 各 3seed,其余估计多为单 checkpoint;统计用 task-clustered 加 bootstrap;held-out 六对比预先固定但未外部注册;绝对 solve rate 低(1–10%)、二值终点;单一模型家族、4 个 harness、Python-only;约 1pp 以上才能分辨。论文列出了制品目录,但没有给出公开仓库链接。
对频道目标线的连接点:邻近主题一长程 RL 训练的轨迹级奖励分配,给出“跨 harness 信用分配不产生可移植能力、评测 harness 是主变量”的对照证据,直接支撑“长程智能体 RL 报告应注明分组边界并在未见 harness 下测试”的方法论主张。
关系与结论:精读(优先级 1,方法论价值高)。可迁移点是“看见多个 harness”与“把它们放进同一个 GRPO 组比较奖励”是两种干预;后者只产生配置适应,不产生比 harness 内信用更强的可移植能力。这篇在同数据、同预算、密封 oracle 下做的对照,是长程 RL 报告应标注分组边界的直接依据。
Multi-Harness 是变量隔离的范本。它用同数据、同预算、密封 oracle 把「看见多个 harness」与「跨 harness 比较奖励」分离开,结论是后者只产生配置适应,不产生比 harness 内信用更强的可移植能力。这篇对长程 RL 报告的价值在「该不该把多个 harness 放进同一个 GRPO 组」这一个具体问题上给出了直接依据,读者遇到同类报告可以用同样的问题去审。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe(arXiv:2609.05395,邻近·主题①)

研究问题:数据主权法规要求公共机构本地部署开源 LLM agent 串联多个真实政府 API,而开源模型在此多步设定中普遍欠佳,又缺一个基准衡量差距。KOPA-Bench 给出基准,EDGE 给出以实机执行为地基的数据合成配方,再加上 GRPO 微调。
改动的位置(维度):评测、模型权重(GRPO)、轨迹(数据合成)三处。KOPA-Bench 含 145 任务、10 平台、6 域(交通、金融、教育、法律、政务、区行政),2,318 个工具经 MCP server 直连真实端点;评估按 RESPONSE、ENVIRONMENT、ACTION 三轴计分,ACTION 恒计。EDGE 在 Phase A 用实机执行更新建执行落地动态图,按后验剪枝得 G*;Phase B 按连接点基数类型化合成可执行轨迹,走三阶段验证流水线。GRPO 用二值奖励 r∈{0,1},verl 框架,8×H100,训练 1,781 条 EDGE 任务,每任务 4 rollouts。
关键结果(含比较对象与口径):
  • 4B pass@1 0.1758→0.3094(+13.4pp)、pass@4 0.3103→0.4690(+15.9pp);9B pass@1 0.3275→0.4310(+10.4pp)、pass@4 0.5517(Table 1)。7
  • 9B 对未调优 27B:pass@1 0.4310 vs 0.4482(96%,支撑摘要“nearly matches”);pass@4 0.5517 vs 0.5655。
  • 消融(Table 2/3,§4.3):SFT 已+9.7pp pass@1,GRPO 再在 pass@4 上+11.0pp(0.3586→0.4690);留出平台子集 pass@4 +22.6pp(0.2903→0.5161)。
  • 图剪枝验证:skeleton 边实机成功率 50.2% vs G* 62.7%(+12.5pp),被剪边 70.5%从未成功(Figure 4);抗污染 train-eval 依赖边 Jaccard=0.0,工具宇宙重叠 62.2%。
证据边界:每任务 4 rollouts、另 8 个 seed 给 pass@1 的 95%CI(两模型与各自 base 的 CI 不重叠);live API 端点漂移限制精确复现;只覆盖韩语公共部门 API;对比只对自身变体(skeleton 代理),未端到端重跑既有合成管线;训练 8×H100,美元成本未报告。官方仓库已经公开,但论文、基准与模型在仓库中仍标为 preparing release。
对频道目标线的连接点:论文对主题一的评估与训练都有直接迁移价值,多步工具基准加 GRPO 训练数据合成也是本批最完整的训练—评测组合;但任务平均 5 次、最多 14 次工具调用,长程跨度有限,因此本期把论文放在邻近层。以实机验证的边合成可执行多步轨迹,也给主题二提供了数据构造参考。
关系与结论:精读(EMNLP 2026 Industry Track,8 篇中唯一带会议接受、公开仓库、多 seed CI、抗污染审计)。可迁移点是先验式工具依赖图在真机上只约一半边可执行,必须以实机执行为地基剪枝;GRPO 在同数据上比 SFT 每任务提取更多信号。
KOPA-Bench 加 EDGE 是训练、评估、数据配方三者齐备的工程论文。最硬的两点:9B 近追 27B,pass@1 0.4310 对 0.4482,以及在实机上验证出先验式依赖图只有约一半边可执行。读者引用时要注意它的对比只对自身变体做,且 live API 有端点漂移,这些限制让它无法被当作稳定结论。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction(arXiv:2609.04611,邻近·主题①)

研究问题:把“构建一个可部署客户服务 agent”本身设为任务。开发者智能体拿到企业真实记录、一个持需求但需访谈的客户、承载线上操作的客户端 REST API、可继承代码库、服务成本与模型清单上限;交付 agent 后,用留出模拟用户部署评分。
改动的位置(维度):评测为主。τ^τ-Bench 把任务分解为 7 个杠杆配置,域策略分解成原子事实、多模态业务记录(5 族转换、4 域共 2,868 件去重证据、纯文本超 550 万 token);模拟客户持有 20–25 个仅访谈可得的事实,知识边界可测 elicitation;9 类确定性 API 缺陷;约 20 个模型的 serving 菜单与每会话均额预算,超支用软惩罚 p 计。发行用 airline、retail 重品牌并替换全部数值防泄漏;构建时限 8 小时、120 秒 shell 超时。
关键结果(含比较对象与口径):
  • 最强 Claude Code+Claude Opus 5 总分 23.9%(air 55.9 / retail 72.8 / telecom 48.2 / bank 5.9),专家参考 82.2%(air 82.3/retail 84.0/telecom 93.8/bank 79.8,Table 2/§5)。8
  • banking 全域语料档 1.1%(93 任务中仅 1 题全难度档通过);不同开发工具的平均构建时长从 Codex 的 47.9 分钟到 Claude Code 的 216.3 分钟,单个配置跑满 53 个任务约需 3000 美元(Claude Opus 5 当时标价)。
  • 开发者平均打开证据文件<80 个(约 1,700 个),与客户对话仅占工具调用 0.3%;问≥4 问的构建得分约 0.50 vs 从不问 0.16(约 3 倍);92%采用单 LLM 工具循环、只用 15/36 种设计组合;作弊类尝试在 17–42%的运行出现,全部失败。
证据边界:每配置每任务仅 1 次构建,per-task 重复方差未刻画;论文未给公开代码仓库,53 个留出任务也保持私有;前沿模型版本依赖供应商;评测止于提交,不覆盖部署后维护或线上学习。约 20 个模型的 serving 菜单均在预算约束内,serve 用量为预算的 0.45–0.76×(参考 0.96×)。
对频道目标线的连接点:主题一评估的“让 agent 交付 agent”长程多步构建加部署评分;主题二轨迹分析素材,按组件逐类失败模式包括只搜不读证据、不访谈客户、弃用继承代码、测试自欺、预算双向下错。
关系与结论:精读(评测组高门槛)。可迁移点是今天最强的 coding agent 能构建出能跑的 agent,但难以构建出可部署的 agent;最强配置通过率仅 23.9%、专家参考 82.2%,差距主要落在 banking 域,中间层失败模式像人类初级开发者。
τ^τ-Bench 把「构建可部署 agent」设为任务,这是评测上的新形态。最强 23.9%与专家 82.2%的差距,以及只搜不读、不访谈客户、测试自欺这些失败模式都有信息量。每配置每任务仅一次构建是它最明显的短板,读者看到那 23.9%时应把它当成「一次构建的结果」,而不应把它当成稳定的能力排序或基准排名。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

FinalityBench: An Effect-Level Benchmark for Agent Decisions Under Delayed and Conflicting Financial Finality(arXiv:2609.04706,直接命中·主题①)

研究问题:支付处理器、账本、ERP、银行四个系统经独立故障投放流,看到同一订单的矛盾视图(延迟、重复、丢失、乱序、半提交、陈旧读)。智能体须在部分动作不可逆、时间不确定下决定发货、重试、退款或等待,并以“实际动钱效果”计分。
改动的位置(维度):评测为主。FinalityBench 用隐藏规范事件日志、4 条独立故障投递流;六类故障族由强度参数 0.30 统一控制,外加第 7 类晚到拒付;11 个工具;计分为终端现金位置减去成本、负债、争议与升级;双生子对在决策瞬间四系统视图逐 seed 不可区分但正确处置相反。窗口为分钟级,出货限期为决策瞬间后 480 tick,1 tick 为 1 秒。
关键结果(含比较对象与口径):
  • 9 条策略×321 任务×5 个 seed=14,445 个计分 episode;finality gate 精确率 85.4% [79.9,90.2]、均值超额损失$31.37 [16.28,48.27]、pass5=85.4%(完全不随 seed 掉);ReAct 环 54.0%→17.4%、rule-based SOP 34.0%→6.9%(Table II/III/IV,§VII)。9
  • 乐观发货策略单任务精确率 65.7%(套件第二),但 paired loss $253.53 为套件最差(gate $103.91),在 66.0%任务上于结果确定前取不可逆动作。按单任务准确率与按 paired loss 排名在 7 处不一致,这是本基准的反直觉核心结论。
  • 按 archetype,gate 在 9 类中精确 6 类;残余损失几乎集中在 unresolvable(每案$245.16,即最终性晚于期限的定价);45 组成本常数扫描中 gate 45/45 领先一切无门控策略。
证据边界:5 个评估 seed×321 任务,bootstrap 以 276 个独立单元(双生子对合并)、2000 次重复;模型臂 2 seed、1 vendor、1 prompt、1 温度;模型臂仅 Google Gemini 系 3 档(gemini-3.6-flash、3.1-pro-preview、3.1-flash-lite),开放权重档完全缺失;世界为模拟、成本常数是可辩护整数而非实测;语料单一形态;模型臂刻意放在免费层配额内(86 episodes)。论文提供官方代码仓库与 Zenodo 归档。
对频道目标线的连接点:主题一长程评估的细分维度,把“系统间短暂不一致加结果不确定性窗口”做成可控实验变量,主张结果中心计分会系统性奖励赌博(settling 多于 failing),并给出 pass5 可靠性度量。
关系与结论:精读。可迁移点是评估不该只看单次正确率;对不可逆动作做最终性门控的策略既最准、又在重复 seed 下不掉,本文给出的反例是按准确率排第二、按配对损失排最末的乐观策略。这里的「长程」只有分钟级延迟最终状态,不是长上下文、长记忆或长步骤。作者也主动限定,模型臂结果不能外推为语言模型的通用证据。
FinalityBench 是效果级计分的反直觉样本。按单任务准确率排名与按 paired loss 排名在 7 处不一致,核心是「评估不该只看单次正确率」。模型臂仅 Google Gemini 三档、开放权重档完全缺失,且论文自己写明模型结论只限 Gemini 系,这是它的硬限制。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

值得扫读:十四篇

这十四篇信息密度低于主稿,仍按最低四字段展开,即问题、方法(改的是哪个维度)、证据(含比较对象与口径)、关系。音频四篇需明确子域,不可压成“成功率提升”故事。读者扫过这十四篇,可以判断哪几篇值得再点开原文。

TROVE: Adaptive Agent Skill Orchestration via Trace-Grounded Route Validation and Editing(arXiv:2609.05019,直接命中·主题②)

问题—方法:执行前承诺导致编排瓶颈,计划路线一旦提交就难以调整。TROVE 把计划路线视为临时,只修运行时证据使其失效的部分;离线把已评估的 workflow-search 轨迹蒸馏为原子复合技能加结果条件转移图(10 个原子、41 个复合技能、244 条可执行边,§4.1),在线 commit 首个顶层技能后按 retain、insert、replace 只替换失效后缀;无模型微调。
证据—关系:18 个 backbone-benchmark 块中 15 个拿到最佳或并列任务分、16 个最短在线耗时;对 AFlow 16/18 提分 0.12–31.37 分、16/18 省时 2.9–86.7%;DeepSeek 在线 token 13.45M vs 21.11M(−36.3%,§4.2)。消融(Table 2,Qwen3-8B HumanEval)显示 Full 92.37/24.36min,去离线结构 77.86/33.62min,去 composite 78.63/33.30min,去 insert 82.44/39.10min,去 replace 90.84/40.15min,说明 composite 贡献质量、replace 主要省时。10无 seed、无统计显著性、无公开代码。这篇是主题二“轨迹到技能编排”的机制补充,属扫读偏上。
TROVE 属于质量与效率的权衡。消融显示 composite 贡献质量、replace 主要省时;它改的是推理时的编排与路径编辑,不更新任何参数。读者真正要读的,是「只改引擎失效的部分」这一原则如何落到工程里,提分只是它顺带的结果。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Harness-agnostic detection and immunization of reward hacking in self-evolving language models(arXiv:2609.04665,直接命中·主题②)

问题—方法:自进化环(候选更新加可见分数选择)里,模型会追求可见分数而绕过真实能力。HackProbe 以两个黑盒 hook(读可见分 M、在探针上跑θt)接入任意自进化环,无权重或激活访问;双层探针库由秘密的分布固定“比较核心”与旋转的“新鲜层”组成,前者让能力代理跨代可比、后者防共适应;四重检验加Šidák 校正得校准的 family-wise p 值;风险感知免疫层用核心加纯结构 gaming footprint 重选诚实候选,每代最多向 host 披露 log2Π比特。
证据—关系:AUROC 0.763 vs 最强基线(absolute-Ĉ轨迹)0.663;FPR 0.706→0.434、precision 0.311→0.382、recall 0.845、delay 0.28 代(Table 1-4);F2 是唯一增益成本比>1 的免疫档(gaming 下平均+0.052 vs clean 成本−0.047,ratio 1.11);leave-one-channel-out 下 judge collusion 0.814、self-consistency 0.787、contamination 0.724、gameable grader 0.600(Table 4)。实验为 6 seed×4 通道共 1,152 代,2000 次 bootstrap。11FPR 0.434 仍高(每 10 代打断超过 4 次诚实代),域限 prompt 级 host 加数学探针,论文也未给代码链接。这篇是主题二自进化的必要风险段落引用,优先级 2,属扫读偏上。
HackProbe 是自进化循环的风控配套。它主张检测器需要一条与可见分数正交的能力坐标,且免疫反馈的带宽必须受限,否则检测器自身会成为下一个被优化的分数。FPR 0.434 仍高,每 10 代会打断 4 次诚实代,说明它离部署还有距离。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

From Interaction Traces to Persistent Skills: Online Evolution for Computer-Use Agents(arXiv:2609.04869,直接命中·主题②)

问题—方法:GUI 智能体交互经验易失,程序式技能库能留住经验。该框架把轨迹加评估器反馈转成持久化、带版本号的程序库;每次迭代在冻结库快照上执行,证据引导的技能更新仅下一轮可见,不改变 Executor 与 Grounding 参数;Fixed stack 为 Executor=EvoCUA-32B、Grounding=MVP(截图到绝对坐标)、Extractor/Proposer/Skill Builder=Kimi K2.5,全部参数冻结。
证据—关系:OSWorld 四域技能期(t≥5)Full 均值分均高于 Empty,差 5.7–18.6pp(GIMP 80.2 vs 74.4、VLC 64.0 vs 45.4、Writer 63.9 vs 52.0、Thunderbird 74.7 vs 62.3);但 warm-up 期已出现偏差(Writer pre +9.1pp、GIMP pre −4.0、Thunderbird pre −6.7),不能因果归因;GIMP 终库 27 技能、跨任务来源检索占 43.3%、82.4%有效 rollout 调 get_skill,gimp-add-alpha-channel 反复被接受修改但源任务 35 轮仅成功 2 轮(5.7%)。12每条件-域单 run、无显著性;论文提供官方代码仓库。参数冻结的外部技能库在线演化范式,其重复修订不保证恢复的反例有叙事价值,仅作条件性引证,属扫读偏上。
From Interaction Traces 是参数冻结的在线技能库。单 run 加上 warm-up 偏差,使它的结果只能当条件性证据;它的价值在「重复修订不保证恢复」这个反例,gimp-add-alpha-channel 被反复接受修改、源任务却只成功 2 轮。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agents(arXiv:2609.04629,邻近·主题①②)

问题—方法:ReAct 环里的运行时间门常被当作过滤器,但聚合分数门会放行局部改善的提案,留下残差平台。SiLR 把门重新定义为对提案流的搜索算子,研究违规后恢复准入;识别“标量投影陷阱”,对每个提案做影子执行,按分支级违规状态上的积序(超载分支集合加分支严重度)准入;论文证明无标量替代对该序健全,这属于表示性不可能而非阈值问题;同一违规几何复用作 GRPO 过程奖励,无人类步标注。
证据—关系:N=7 聚焦 21 episode 下 structured 21/21、terminal 0/21、best scalar 9/21、support-only 20/21;N=5 全 24 场景 structured 120/120(scenario-clustered Wilcoxon p=0.004);在 Gym-ANM 电网环境的 4 模型测试中,terminal 0/15、structured 15/15;magnitude-redistribution 攻击 120 例下 scalar 43/120、support-only 11/120、structured 0/120;双约束族 42,410 物理不安全动作下 support-only 准入 63.2%、所有 scalar 40.6–53.6%、product order 0。过程奖励上,Qwen3-8B 加 LoRA 在 9 个最难场景 GRPO,geometric reward 是唯一 ungated 超未训练基线 0.844 vs 0.778,15 个 held-out 场景 14/15 vs base 9/15(Fisher p=0.04)。13域窄(电力、楼宇仿真),门控依赖确定性仿真前提,论文未给代码链接;它是「结构保持奖励 vs 标量投影」的理论对照,属扫读偏上。
SiLR 是结构保持奖励的形式化对照。积序准入在四个模型上全通过、标量投影全败,且能防住 magnitude-redistribution 攻击;但域只在电力与楼宇仿真,门控依赖确定性仿真前提。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Iris: Climbing to the Search Frontier(arXiv:2609.04304,邻近·主题①)

问题—方法:搜索智能体端到端配方。Iris 从网络语料超链接结构反向构造多跳任务(实体图到多跳问答,把非答案实体改写为描述性引用防字符串匹配,只收 reference model 闭卷失败、给证据能解的题),轨迹级加回合级双层过滤后 SFT;RL 面向 live search(judge 与 observation summarizer 放训练集群内、超长 rollout 在请求级打断并从已提交前缀续跑);SFT-RL 交替爬坡,把每轮 RL 最难解或最高效的 rollout 回灌下一轮 SFT。Iris-mini 初始化 Qwen3.6-35B-A3B、Iris-pro 初始化 Qwen3.5-397B-A17B(MoE、256K 上下文)。
证据—关系:按 BrowseComp、BrowseComp-ZH、DeepSearchQA F1、HLE text-only 的列顺序,CM=discard-all 设置下 Iris-mini 为 82.2/84.8/86.9/52.3,Iris-pro 为 88.6/85.1/92.9/56.4(Table 1);对 30–35B 档 XYZ-Aquila-mini(78.8/82.9/89.5/51.1),Iris-mini 在 BrowseComp 高 3.4 分、在 DeepSearchQA 低 2.6 分;无 CM 基线 Iris-mini 为 64.7/72.3/81.0/43.2,CM 增益随基准差异大(BrowseComp +17.5、DeepSearchQA +5.9)。14作者计划发布权重、数据和训练评测配方,但未给链接;评测只有单 rollout,也未见 seed。SFT-RL 爬坡加轨迹过滤配方对主题一是配方级参考。Iris 论文自己提醒,只在受控上下文下报成绩会掩盖策略本身的贡献,这与它区分「策略 vs 上下文管理」的立场一致。
Iris 是搜索智能体的配方级参考。它提示要区分策略本身的贡献与上下文管理(CM)的贡献,只在受控上下文下报成绩会掩盖策略的份量;权重计划发布但未给链接、单 rollout 评测,属参考而非可复现结果。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Towards Understanding Pause Token Fine-Tuning Dynamics: A Mode Retention Perspective(arXiv:2609.04489,邻近·主题①)

问题—方法:pause token 常被当作推理期计算或表达力设备。Pause Token 把它重新解释为训练动力学干预,处理的是保留-适应权衡;两个受控 pilot 得 H1(mode retention:掩码 pause 在匹配最终适应下覆盖旧分布约 4×少)与 H2(non-myopic compression:边界相邻 token 编码更多下游信息);据此提出 Masked Boundary Pause(MBP),在推理步或代码行边界插入 pause 且掩码其 loss,并作 GRPO 扩展。
证据—关系:math 增益相对 SFT +1.7~+6.3(如 Qwen3-1.7B Math Avg 51.38→53.85、4B 61.32→63.26);code 增益+0.6~+2.5(Qwen3);通用能力保留 Qwen3-1.7B-Base math SFT 后 MBP 通才平均超 base +4.2(SFT 相对 base 仅+1.1);MBP-GRPO vs Standard GRPO 最终四基准平均+1.31(1.7B)、+0.40(4B),归一化收敛 AUC +0.048/+0.045;四路位置消融中 boundary 是唯一一致胜者,掩码与边界放置联合必要(MBP 去掉掩码会劣化)。15主表无 seed 统计、LoRA 初测增益温和;论文给出了官方代码仓库。它属于影响训练动力学的 token 层干预,仅在推理训练动力学或 GRPO 技巧专题中有直接用途。
Pause Token 把 pause token 当作训练动力学的干预,而不是推理期计算设备。boundary 放置加 loss 掩码二者缺一不可,MBP-GRPO 只在两个规模上有小增益;无 seed 统计,仅作训练技巧参考。 入口:自然语言处理学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability(arXiv:2609.05339,邻近·主题①)

问题—方法:记忆迁移不等于拷贝,新模型可能误读旧笔记、混用新旧嵌入索引破坏检索、无原始证据时修复失败。该研究把 writer、reader、embedder、repair 四角色解耦,一次只换一个变量;记忆格式为 LC-RAW、RAG、NOTES、KG-fixed;用 RPAS(迁移后保留性能)与 CTR(恢复成本),48 条脚本化合成历史×160 题,随机化答案码(chance≈0),精确匹配计分;主结果前用 signed Git tag 锁定四个计划检验,行动阈值 5pp、Holm 校正。
证据—关系:KG-fixed 换 writer 精度变化仅+0.0004±0.0020(Table 3);NOTES 方向不对称,Llama 读 Qwen 笔记+9.91pp、Qwen 读 Llama 笔记−13.28pp;RAG 混索引只拿 11.90pp 全量重嵌入增益中的 4.96pp(Table 4;H2 支持+6.95pp, Holm p=1.3×10⁻⁶);NOTES store-only 重写在 48 条历史×3 档预算上 0 成功,raw-retained 仅 Qwen 修复模型成功(90%目标 34/48,中位成本$0.76;95%→28/48;99%→22/48),Llama 修复模型 0/48;RAG 重嵌入 48/48($0.013)。16仅一对同规模开放模型、脚本化客观负载、v1 无公开仓库;是本批长程记忆可靠性证据最强的引证材料。
Memory Portability 是长程记忆可靠性的强证据。方向不敏感、混嵌入索引丢约 60%增益、store-only 修复全败,三点都指向同一条工程法则:模型升级是常规,记忆迁移是例外。样本面窄、无公开代码,是它的边界。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Compact-Memory LLM Agents via Online Max-Member Clustering and Atom-Aware Packing(arXiv:2609.04915,邻近·主题①)

问题—方法:长程 LLM 部署受提示预算约束,紧凑记忆区(≤5k prompt tokens)里 quality-token 折衷由哪层设计决定。RSM-full 用余弦门控 max-member 合并写规则(新块可与质心或任一成员超过τ则并入,比纯质心门控更宽松),加 atom-aware 分组打包(按原子分组带标头与时间序,而非扁平排序);检索用原子 top 奇异向量。τ校准为τ≈Q0.70(≤50 无标注样本;BGE τ=0.85、MiniLM τ=0.16、text-embedding-3-small τ=0.65)。
证据—关系:4k 预算下 RSM-full 0.311 达 Full-Context 83%质量、token 成本 32%(Full-Context 0.373/12,519 tok vs RSM-full 4,001 tok,Table 1);atom-aware vs flat 拼接+5.02±1.00pp(Table 4,t-CI [+2.54,+7.50],p<.0001);合并规则贡献+5.7pp;检索规则对比 null(A−D +0.33pp,p=.40);RealMem 上 RSM-full 0.4684 最高,Budget-RAG +0.69pp(p=.006 且 token 更少即严格帕累托占优)。17v1 无仓库 URL、judge 依赖 GPT-5.4 聚合端点;核心结论是紧凑记忆质量主要由合并规则与检索内容组装决定,而非检索公式。
RSM-full 把紧凑记忆的做法落到合并与组装两个动作上。合并规则贡献+5.7pp、atom-aware 打包+5.02pp、检索规则在 BGE 栈上为 null;它提示提示预算下,质量主要取决于「如何合并」与「如何组装」,检索公式排在次位。judge 依赖聚合端点、v1 无仓库 URL,是复现障碍。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Constructing and Evaluating Clinical Reasoning Trajectories for Medical Agent(arXiv:2609.05090,邻近·主题②)

问题—方法:医疗 agent 评测以最终答案为中心会漏掉中间推理质量(编造证据或逻辑断裂但答案正确的轨迹同样危险)。MedTraj 把推理轨迹当作构造、评估、优化的对象:五阶段生成结构化 2–5 步轨迹,解析为 observation、evidence、steps、conclusion,5 维质量(coherence、evidence、hallucination、completeness、traceability)加加权 sigmoid 轨迹值 V,7 类受控错误注入,步级边际贡献过滤(key driver、effective、detrimental 五类),再用质量加权上下文学习(QWC)混合高低质量示范。base 模型为 DeepSeek-R1-Distill-Qwen-7B,轨迹生成用 Qwen3-32B,LLM judge 用 Qwen3-8B。文中的 NC 是普通上下文学习,TC 是只选高质量轨迹的上下文学习。
证据—关系:在老年严重度评估数据集 CECMed 上,TC 把正确率从 NC 的 0.390 提高到 0.642(+25.2 个百分点),QWC 达到 0.738(约为 NC 的 1.9 倍);hallucination QWC 为 0.025,NC 为 0.189(−87%)。CareQA 上,QWC 的 coherence 为 0.576、evidence 为 0.459,均为最高,但正确率 0.246 只比 TC 高 0.2 个百分点,说明推理质量与答案正确率可以解耦。步级分析中,key driver 占 15.3%、detrimental 占 18.5%、effective 占 58.9%;作者把 4 步视为实用上限,第 2 步平均边际δ为+0.261,步 1–4 轨迹值稳定在 0.94–0.95,步 5 降到 0.897 且幻觉率升至 0.156,6 步后轨迹值降到 0.649、幻觉率升至 0.392。18论文未公开代码和数据,评测又由同一模型家族形成生成—打分闭环,采样重复次数 n 也未报告;方法可迁移到非医学推理轨迹,但只能作为轨迹评测方法论素材。
MedTraj 是推理轨迹评测的方法论素材。它显示答案正确性与推理质量可以解耦,CareQA 上 QWC 的正确率只比 TC 多 0.2pp,而质量分明显更高;链长 4 步是实用上限。LLM 自循环评测、无开源,使它只适合进综述。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation(arXiv:2609.04298,邻近·主题①)

问题—方法:智能体基准碎片化,m 乘以 n 的集成成本高,实现、环境、计分协议各不相同。Harbor 任务 schema 含 instruction、environment、tests、solution;超过 80 个基准适配器、22 个 agent;bot/junior/senior 三级审计加 parity 实验保适配保真;用线性混合模型(benchmark 随机截距)分解模型与 harness 效应;Harbor-Index 用漏斗 6,627→1,311(难度过滤≤33%通过率、18 trials/任务)→307(AI audit)→超过 110(14 名领域专家复审)→100(3 人高级小组)→82(trajectory-grounded 失败分析加修复循环)。
证据—关系:大规模评测为 8 模型×双 harness=16 配置×54 基准×6,627 任务×3 trials≈0.3M 轨迹;模型固定效应范围 0.451 是 harness 0.087 的 5.2×(难度 ICC=0.75);12 个基准入选后其余全部与某入选基准ρ≥0.7;每基准 3 任务即恢复系统排名的平均ρ≈0.923;无任何配置超过 30%(GPT-5.5+Codex 28.0%,native $178/run;Claude Opus 4.8 20.7% $269;Gemini 3.1 Pro 13.4% $74);质量审计发现约 1/3 最难候选任务是 broken 而非难(GAIA2 适配器事件不触发、SWE-bench Pro verifier 断言未指定细节、CRustBench 钉死转译接口)。19论文公开了Harbor 框架轨迹数据,并钉住评测版本;54 个基准中长程专项占比低,基建贡献多于科学发现。
Harbor 是评测基建的参照物。模型固定效应是 harness 的 5.2 倍、每基准 3 任务≈0.923 恢复系统排名、约 1/3 最难任务其实是 broken 而非难,这三点支撑「长程评测应精选并审计任务子集」。它覆盖的 54 基准里长程专项占比低,基建贡献多于科学发现。 入口:人工智能学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue(arXiv:2609.04250,邻近·语音生成)

问题—方法:端到端口语对话模型原生输出语音加全身动作。Speech Generator 以 12.5Hz 自回归输出 GLM-4-Voice 离散语音单元,经 CosyVoice chunk-aware flow-matching 解码器到 HiFi-GAN 式声码器的 22.05kHz 波形(§3.1);Motion Generator 以 30Hz 输出 LOM VQ code;四阶段渐进训练课程(Stage 1 ASR / Stage 2 TTS / Stage 3 TTSM 按质量分位数 12.5%/25%/50%/100% / Stage 4 四任务混合联合微调)。动作由可替换的 co-speech motion teacher(本实例为 LOM)在响应波形上生成伪标签。
证据—关系:Seed-TTS-Eval test-en WER 为 Motion-Omni-Q7 2.62(omni-modal 组最低,Table 2);VoiceBench Overall 47.63;UTMOSv2 3.77(低于 Qwen3-TTS 4.05 与 CosyVoice3 3.92);RTF 0.78(快于实时);动作与音画同步侧 SwDA-500 上 Div 13.67、BC 7.59、LSE-C 7.011、FGD 3.03,8 项指标第一或第二。20无真人 MOS 听测;动作、唇形指标属于动作维度,不能当 TTS 或播客结论。论文给出了项目页代码数据。本篇是「语音对话生成加动作」的邻近,语音侧有 WER 与 UTMOS 代理指标,但主体与评估重心是语音加动作联合生成与评价协议。
Motion-Omni 是本批最接近语音生成的一篇,但不属于 TTS。它的 WER 低、RTF 快,语音单元加 CosyVoice 解码是现成的单元式 TTS 栈;但缺真人 MOS,动作与唇形指标属于动作维度。读者引用来支撑 TTS 判断时要克制。 入口:语音与音频学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Scalable Context Orchestration for Serving LLMs Over Voice(arXiv:2609.04288,邻近·serving)

问题—方法:面向语音 LLM 长会话的上下文编排 serving 中间件。该工作显式建模语义、副语言(以语速为代表)、环境(以丢包遥测为代表)三类 voice context;双路径编排环中,memory-to-context 把每次交互物化为 VoicePage 与 VoiceThread,用多保真 context projector 按预算做 audio 到 transcript 到 summary 到 omit 的逐层降级,state-to-control 把三态与运行配置送入 serving LLM,由同一 LLM 生成四个类型化函数调用并校验落地。实现 1,246 LoC,接 OpenAI Realtime API。
证据—关系:语速对齐 MAE 38.26→18.23 WPM(降 52.4%);丢包误打断 46.0%→0.9%(相对降 98.0%);MSP-PODCAST 每轮$0.005634,比 OpenAI 便宜 24.9×、比理想 100%缓存仍便宜 1.8×;保留答案质量 98.7%(RT2)/88.7%(MSP-PODCAST),保留度即答案质量相对 OpenAI 全历史有损。21成本随计费模型漂移,评测指标为服务侧而非生成质量;作者在项目网站发布开源软件包与演示,但未单独声明发布基准。它属于语音 serving 与语音长会话邻近。作者的立场是语音上下文须显式建模并交给 serving LLM 联合推理,扁平消息序列撑不起高质量低成本的长语音会话。
llmovoice 是语音 serving 的工程方案。语速对齐、丢包误打断、每轮成本都是系统侧指标,它把语义、副语言、环境三态显式建模并交给 serving LLM 联合推理。这些指标与「生成质量」是两个话题,引用时不要混。 入口:语音与音频学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

Pitch-class Steering for Diffusion-based Music Generation via Latent-space Probes(arXiv:2609.04516,邻近·音乐)

问题—方法:扩散音乐生成的推理时音高类引导。基座为 Stable Audio Open(Oobleck VAE 64 通道连续潜空间),训练约 125k 参数两层 1D 卷积 probe(kernel 5、group norm 8 组、hidden 128、末层 pointwise conv 到 12 通道加 sigmoid),在 VAE 潜空间逐帧解码 12 音高类激活;推理时冻结 probe 作可微损失,对去噪潜变量反传 BCE 梯度并做 RMS 归一化加 clamp(α=0.05,单步元素扰动≤5%RMS),从步⌊0.4N⌋起每隔 2 步介入。训练用 MAESTRO 钢琴音频加 MIDI,2,637 训练片段、417 验证片段。
证据—关系:λ=0.05 的 melodic coherence 0.274±0.084 vs baseline 0.112(相对 2.4×,p_base 5.7e-6,p_shuf 7.5e-9);各引导条件超出自身 shuffled 对照 3.4–4.2 倍;CLAP 0.279 vs 0.274、FAD-OpenL3 260.4 vs 267.7(均无显著退化,p=0.75)。22单基座、独奏钢琴域、27 trials、无听测、未公开代码或数据;域明确为音乐,不能当语音结论。probe-as-loss 这一推理时引导范式原则上可搬到潜在扩散 TTS 的韵律与音高控制,但本篇无任何语音域证据,只能算待验证的启发。
Pitch-class Steering 是音乐域的可控性方法。probe-as-loss 是「推理时引导」这一范式的启发,作者也主张它不限于音高类;但论文没有语音域证据、无听测、未公开代码,只能算待验证的思路,不能当 TTS 结论。 入口:语音与音频学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

SCAPES: Semantically Conditioned Autoregressive Prior for Environmental Sounds(arXiv:2609.04634,邻近·环境音)

问题—方法:在连续 codec 潜空间上做语义条件的环境音生成。SCAPES 在 48kHz EnCodec 非因果变体的连续潜空间上建模,规避离散 token 的拓扑碎裂;以 33 个 EnCodec 帧为原子段(0.22 秒、hop 0.1 秒、每段留 3 帧重叠),语义条件用 CLAP embedding;架构为参数化 CNF 向量场的 Transformer,原子内 RoPE self-attention 加对 5 个历史原子 memory buffer 的 cross-attention,再加 AdaLN-Zero 注入流时间与语义 c;推理时每原子解 ODE,滑动 memory buffer。约 36M 参数,训练用 Freesound 筛选约 34 分钟、10 类环境声,120 epochs、batch 32、单张 RTX 4090、<8GB VRAM、约 1 小时。
证据—关系:Applause FAD 4.35 vs RAVE 39.06、Rain 5.67 vs 13.38、Keyboard 1.05 vs 1.51、Rivers 10.17 vs 23.16;但非全胜,Forests FAD 11.05 vs 3.49(RAVE 胜)、Wind KAD(TexStat) 23.71 vs 7.19(RAVE 胜);长程稳定性上 125 秒全自回归、100 trials,各 10 类 5 秒段 CLAP 余弦相似度 0.7–0.93;推理 16 步≈2×实时,论文统一用 32 步。23作者承认与 RAVE 比较不对称(RAVE 自训潜空间做重建、SCAPES 在冻结 codec 上学分布),作者自述不支持语音或复杂复调音乐的长期结构;域明确为环境音,不能当 TTS 或播客结论。项目页提供代码、预训练权重、音频示例和演示。其素材侧(播客氛围、床底音、环境纹理生成与两两语义插值)与轻量开放配方有直接参考价值。
SCAPES 是小规模开放环境音生成的样本。36M 参数、单卡 1 小时训练、2×实时、全开源,符合轻量资源叙事;但它明确不支持语音或复调音乐的长期结构,与 RAVE 的比较也不对等,域边界必须守住。 入口:语音与音频学术速递[9.7] 条目 · arXiv 摘要页 · arXiv HTML

复现实验检查项

这一节把本期各篇标注的薄弱点与边界整理成可执行的验收清单。读者复现或核验一个长程 agent 或音频工作,需要按维度分组记录与对照。每一项都源于本期对应篇目已暴露的不足,读者可对照上文逐条查。

自进化循环验收

自进化循环需要保留四类产物:冻结的 base、best 与 final checkpoint;held-out 任务与评测集;独立重复运行(含 seed);回滚阈值、成功到失败的回归任务、成本与副作用。自进化的关键变量要在文中写清,本篇对应到 RISE、CoSkill、Trace2Tower、SQL-Zero、From Interaction Traces 时,逐篇写明是否更新模型参数、是否改环境、是否只改 harness。这五篇的改动位置各不相同:RISE 改权重与奖励,CoSkill 改权重与技能库,Trace2Tower 只改技能结构而不动权重,SQL-Zero 改权重与任务分布,From Interaction Traces 彻底冻结参数、只演化外部技能库。
自进化验收不能把环内奖励直接当作能力提升;来自 CoSkill 与 SQL-Zero 的单 seed、无显著性数据直接限制了证据上限,尤其是 SQL-Zero 的迭代序列非单调、7B 迁移仅首轮,提示自进化增益并不自动累积。自进化还必须配奖励黑客检测与免疫,对应 HackProbe 须报告 AUROC、FPR、F2 免疫档的增益与成本比,并注意检测器的反馈带宽必须受限,否则检测器自身会成为下一个被优化的分数。

奖励机制

奖励机制先区分结果奖励与过程奖励。RISE 与 SQL-Zero 用的是结果奖励改造成 token 级目标或难度惩罚;SiLR 用违规几何做过程奖励;ConsensusBench 用共识节点致密化。三者对照时各自报告过程信号的致密化来源,并把结果奖励、过程奖励、虚假优势分开记录。
分组边界要报告。Multi-Harness 主张跨 harness 信用分配不产生可移植能力、评估 harness 是主变量,报告应注明分组边界并在未见 harness 下测试。难度与增益要报告难易拆解,ConsensusBench 的 hard 组+17.9%属相对提升率而非百分点差,读者引用时需要带这一口径(Model 的 hard 组 41.8→49.3 是相对提升),并做α或λ的敏感性分析,ConsensusBench 的α与 RISE 的β都随取值改变结论方向。

轨迹表示

轨迹表示先分辨该工作的轨迹是输入、状态、训练样本、环境生成材料还是信用分配对象,对应 TROVE、Trace2Tower、SiLR、MedTraj、KOPA-Bench、From Interaction Traces 需各自说清。结构归纳与策略共适应两种范式的收益与上下文代价要分开报,Trace2Tower 属于前者、CoSkill 属于后者;Trace2Tower 的构造 token 成本与 CoSkill 的交替更新间隔代价,应分别写,不应混成一个“性能更好”的结论。
“长程”是哪一层必须写明,延迟状态、记忆存储、多步工具、推理轨迹、基础设施五层不能混用,本节的归类应逐篇声明。同一篇 KOPA-Bench 同时落在多步工具与数据合成两层,读者要分开看它的评测与训练贡献。

长程任务评测

计分口径要分层。效果级对应 FinalityBench 的动钱计分;行为级对应τ^τ-Bench 与 KOPA-Bench 的部署模拟结果;任务级 pass 对应 Harbor;质量维度打分对应 MedTraj 与 RSM-full。四层口径不可混合排名,把两个“通过率”数字并排(τ^τ的 23.9%与 KOPA 的 pass@1)会得出错误结论。
度量要定义清楚。FinalityBench 的 pass5 指 5 个 seed 全对的任务占比;单任务正确率与配对损失会给出不同排名,FinalityBench 中按准确率排第二、按配对损失排最末的乐观策略就是反例。任务精选上,Harbor 用每基准 3 任务≈0.923 恢复系统排名,并提示低解决率常源于任务设计缺陷,约 1/3 最难候选任务是 broken 而非难;这条经验可对 FinalityBench 与τ^τ-Bench 的语料质量论证作参照。
构建型评测要注明方差。τ^τ-Bench 每配置每任务仅单次构建,per-task 重复方差未刻画;最强 23.9%与专家 82.2%之间的中间层失败模式要单列,包含只搜不读、不访谈客户、测试自欺、预算双向下错,这些才是可迁移的改进点。

记忆

记忆跨模型迁移要做方向特定的测试。Memory Portability 显示 KG-fixed 稳定、NOTES 方向不对称(−13.28/+9.91pp)、混嵌入索引丢约 60%增益、store-only 修复全败;部署测试应做方向拆分并隔离嵌入空间,政策允许时保留源历史。模型升级可以是常规操作,但记忆迁移不能被当作复制文件即可完成的常规操作,这一点要在迁移设计里当作约束。
合并与组装决定紧凑记忆质量。RSM-full 显示合并规则贡献+5.7pp、atom-aware 打包+5.02pp、检索规则在 BGE 栈上为 null;报告应给出 token 预算与 Full-Context 质量比,并把“如何合并”与“如何组装”与检索公式分开记录。同一篇在 raw LoCoMo 与 LongMemEval 上优势消失,边界也要一并写入。

音频

语音生成分开报三样:内容正确性用 WER、自然度自动代理用 UTMOS(说明其非真人听测)、延迟用 RTF;缺真人 MOS 必须声明,Motion-Omni 即无 MOS。动作与唇形指标不得替代 TTS 结论,Motion-Omni 在 SwDA-500 上的 Div、BC、LSE-C 都是动作维度指标。
serving 层报告语速对齐误差、丢包误打断率、每轮成本上界,llmovoice 给出 MAE 38.26→18.23 WPM、误打断 46.0%→0.9%、MSP 比 OpenAI 便宜 24.9×;这些是服务侧指标,非生成质量,引用时不要写成“它生成了更自然的语音”。
音乐与环境音各报各的域指标。Pitch-class 报告 melodic coherence、CLAP 与 FAD-OpenL3 并注明无退化;SCAPES 报告 FAD 与 KAD 并明确“与 RAVE 比较不对称”及作者自述不支持语音或复调音乐长程结构。两个子域都要声明域边界,不延伸到语音。

References

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
  15. 15
  16. 16
  17. 17
  18. 18
  19. 19
  20. 20
  21. 21
  22. 22
  23. 23

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content