9月15日论文雷达:评测口径失真、自进化模块分解与无参考语音指标失效:长程智能体与生成式音频的 45 篇分层雷达

9月15日论文雷达:评测口径失真、自进化模块分解与无参考语音指标失效:长程智能体与生成式音频的 45 篇分层雷达

本期从 9 月 15 日三个指定栏目 309 篇论文中分层收录 45 篇,重点解析长程评测的三类口径失真、自进化的模块化分解与低成本回放,以及无参考语音质量指标在干净音频上的失效与奖励反噬。

微信公众号「arXiv 每日学术速递」在 2026 年 9 月 15 日发布了人工智能学术速递自然语言处理学术速递语音与音频学术速递三个允许栏目(批次 mid=2247744736,发布时间 2026-09-15 14:42:51 GMT+8)。三个栏目合计发布 309 篇论文,其中人工智能栏目 147 篇、自然语言处理栏目 132 篇、语音与音频栏目 30 篇。经对本频道已发篇目逐条检索与查重核验,本期分层收录 45 篇:直接命中 30 篇,邻近跟踪 15 篇,与既有内容零重复。
本频道持续关注四条线:大模型长程任务的训练与评估、轨迹学习与自进化、TTS 生成与评估、播客生成与评估。本期直接命中的 30 篇按线分布为:长程任务训练与评估 13 篇、轨迹学习与自进化 10 篇、TTS 生成与评估 7 篇、播客生成与评估 0 篇;15 篇邻近跟踪里,有 5 篇是语音交互与全双工方向、能迁移到播客链路的组件级工作。播客方向连续多期为零直接命中,本期专设一节说明缺口落在哪一层。
本期候选池是本频道近期少见的单日三百篇量级:三个栏目合计 309 篇(此前几期多为 120 到 180 篇,9 月 9 日那一批为 380 篇)。数量虽大,但四条目标线上的收口很集中,下面四个转向值得先看。
评测门禁正在被自己的口径反噬。 自然语言写成的任务策略一旦含糊,智能体就会把「规则没写清」执行成「能力不够」。一项在 τ²-bench 航空与零售任务上跑的 1,968 次实验发现,17 处策略漏洞里有 7 处落在航空任务的 50 道题上,受漏洞影响的题目平均得分 37%,明显低于无漏洞题目的 51%;每个模型被扣的幅度不同,其中 GPT-5 相对自己在无漏洞题上的表现低 32.4 个百分点,而漏洞题的跨次运行方差是无漏洞题的 1.62 倍。同一批工作里,一项在 MedAgentBench 上做 1,000 次重复运行的临床智能体实验显示:有一个配置下,43 组题的医嘱集合每一次运行都重新生成、组组不同,而最终判定在 22 组里完全没变——单次评测报告的分数掩盖了动作层的不稳定。多轮任务上还有第三种衰减:多轮指令遵循基准里,模型的约束满足率有 60.6%–80.4%,但只看本轮新增约束的增量满足率只有 1.1%–12.7%,多数模型第 6 轮后归零。
自进化不再重写整条流水线,而是只改一个模块。 本批四篇自进化工作把「改哪里」缩到最小范围,收益也各自换成可核对的成本:只改 harness 的五个模块,终端基准平均成功率 47.57%→52.43%,而且在终端任务上演化出的 harness 冻结后拿到软件工程基准上仍有 73.40%→75.80%;只改探索策略的代码(零梯度步、靠历史发现树做离线回放),Lasso 任务的发现调用从 550 次降到 317 次、平均运行时间从 3587.1 毫秒降到 2931.0 毫秒;只改记忆(模型参数全程冻结),OSWorld 2.0 的 82 个任务平均得分 71.97%→78.98%;只改搜索循环的控制权与经验组织,TSP 用 39 次评估达到对比方法吃满 500 次预算仍未到的水平。与这些结果形成对照的是,把五个模块一次性联合重写的版本(44.19%)低于不做任何演化的基线(47.57%)。
TTS 评估退回到一个更朴素的问题:干净音频上,自动分数还算不算数。 一项覆盖 6 个人评语料、64 个特征的审计显示,在伪影与录音缺陷密集的语料上,无参考预测器给出的成对偏好准确率已接近人类上限(0.909 对 0.887);换到 4 个商业系统构成的干净语料,最好的单指标只剩 0.528,而该语料的人类上限是 0.764,连「永远选更长的那段」都有 0.524。把它直接当强化学习奖励的后果更直接:被优化的那个分数接近满分,而作为独立裁判、不在奖励里的 UTMOS-v1(满分 5)从 4.51 掉到 1.26,人评 Elo 从 2098 掉到 1675。同一方向上,对有声调的语言,字错率在声调被逐级压平到随机时几乎不动(0.084→0.110),必须另设一条声调轴。
实时语音系统的失效模式开始被量化。 全双工语音模型在长达 5 分钟的纯静音输入下会自发开口:两个模型分别出现 12/40 与 11/40 次,累积发生率 30.0% 与 27.5%(95% 置信区间 16.6%–46.5%)。更有用的是机制层面的结论——开口概率在一帧之内跃升超过 9 个数量级(一帧约 80 毫秒),说明它不是「极小概率事件的累积」,而是可以定位、也能在帧预算内抑制的决策突变。
需要明确披露的缺口:本批三个栏目的 309 篇论文中,「端到端自动化播客节目生成与评估」依然没有直接命中。 没有任何一篇把「自动做出一期完整播客节目」或「评估一期节目的整体质量」当作核心研究问题,也没有出现以播客为对象的长音频基准、多说话人轮换协议或话题编排评测。
本期能提供的仍然只是组件级接口,每一处都在正文中限定了证据层级:全双工对话在静音段自发开口的抑制与轮次接管指标、语音到语音模型里并行挂载的流式转写头、语音与文本联合建模时语义连贯性与音色的取舍、TTS 评估里从「单一预测器」转向「域内校准的复合打分」的方法。这些工作合起来说明,节目级系统缺的已经不是单点生成能力,而是一条能把分钟级编排、多说话人一致性与节目级评测串起来的公开基准。

先看哪几篇:45 行阅读优先级全景表

本表坚持一行一篇论文。层级说明:直接命中指研究问题本身落在本频道的四条目标线上(大模型长程任务训练与评估、轨迹学习与自进化、TTS 生成与评估、播客生成与评估);邻近跟踪指研究问题在相邻方向,但对目标线有明确可迁移接口的,连接点写在正文章节里。优先级判定依据三条:与四条目标线的贴合度、方法或评测设计能否被直接搬走、以及证据本身的可核对程度(有没有写明比较对象与口径、有没有重复与统计、代码与数据是否可得)。1 建议精读原文,2 值得扫读原文,3 只按连接点取用、不必通读原文。表中数字均注明比较对象与口径;正文未核到原文、只依据栏目条目转述的,在表内明确标注「栏目条目报告」。
优先级层级论文(英文原题 · arXiv ID)改动位置(维度)核心可比结果(含比较对象与口径)阅读风险与证据局限入口
1直接命中DynSTEER: Dynamic Stage-wise Trajectory Evaluation and Execution-time Review for Agents · 2609.14637评测协议;阶段化里程碑图与执行时早停ToolSandbox 509 场景 × 4 模型:区分度(可被稳定区分开的模型对占比,ε=0.01)0.0270→0.0500,可分模型对 5/6→6/6(配对 Wilcoxon p<0.01);蓝图微 F1 86.0%、雷区 F1 86.7%;早停节省 34.51% 的执行进度;净收益按失败类型分开:死锁类每次运行净省 63.05 秒,低分策略类每次运行净亏 3.81 秒单一基准;评测基于同批轨迹重放而非新 rollout;三个组件无逐项消融;未报告运行次数与种子AI 栏 · arXiv
1直接命中Policy Loopholes in Agent Evaluation: When Policy Ambiguity Masquerades as Agent Error · 2609.14400评测效度;自然语言策略的漏洞分类与审计τ²-bench 航空 50 题、零售 114 题 × 3 模型 × 4 次共 1,968 次运行:17 处漏洞,7/50 航空题受影响,受害题平均 37% 对无漏洞题 51%;GPT-5 被扣 32.4 个百分点;跨次方差 1.62 倍;后续基准改动集包含全部 7 题(超几何 p=1.6%)采样温度与模型精确版本未报告;漏洞清单由作者人工审计得出NLP 栏 · arXiv
1直接命中MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding · 2609.14992评测基准;多轮渐进式约束遵循100 个实例、9,133 条约束、平均 7.04 轮:11 个模型约束满足率 60.6%–80.4%,增量约束满足率只有 1.1%–12.7%(均为百分数口径),多数模型第 6 轮后归零;判官一致性 0.855–0.924无种子与显著性检验;评测绑定单一智能体框架版本NLP 栏 · arXiv
1直接命中Same Patient, Different Order: Action-Level Reliability of Clinical LLM Agents Under Repeated Runs · 2609.13582评测协议;重复运行下的动作级稳定性MedAgentBench 1,000 次运行(4 组 × 250,每组重跑 5 次):Llama@0.7 的 43/43 组医嘱集合逐次不同,而 22/43 组判定完全不变;首轮即分歧 12/28、40/49、27/35、50/50;报告 Wilson 区间、McNemar+Holm 与簇 bootstrap作者明确「协议可迁移、比率不可」;论文声明的代码仓库在核验时返回 404NLP 栏 · arXiv
1直接命中Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures · 2609.13463失败归因;把根因定位重构为跨轮搜索自建 50 条长轨迹(中位 286K token,中位记录 1.05 MiB):F1 0.349→0.498;TRAIL 加权 F1 0.426→0.500;同一判官改用自一致性每次多花 6.52 美元/轨迹,却把联合准确率从 0.153 压到 0.138;工件覆盖率 70.8%→97.4%(对照组停在 77.0%)除 TRAIL 的 4 次重复外均为单次运行;新建数据集未公开;短轨迹上明确退化AI 栏 · arXiv
1直接命中Do Not Restart: Residual Completion for Stateful Agent Handoffs · 2609.13800有状态交接;承诺约束下的残差补全5 个有状态评测面、每面 5 次完整运行:宏平均质量 +1.2 点、成本 34.6%(另一模型组合 +0.9 点、22.0%);四段消融 58.9%→62.0%→65.4%→70.8%,成本 68.82→38.80 美元;124 次干预 100% 发生在首次真实写操作之前未报告每个评测面的任务数;成本为供应商侧支出、不含延迟;代码仅承诺开源AI 栏 · arXiv
1直接命中When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis · 2609.15309测试时算力评估;Elo-per-token 与预算分配14 个任务 × 4 个智能体系统 × 每单元 5 个 session、目标预算 1 亿 token:各系统局部斜率初期超过 400 Elo/decade 后跌破;拐点分配在 1 亿预算下比单次长 session 高 +264、比十次短 session 高 +355 Elo(90% 自举区间 [+135,+412] 与 [+226,+618])每任务仅 5 个 session,增益区间很宽;含缓存与不含缓存两个 token 口径不可混比;原始 trial 数据尚未发布NLP 栏 · arXiv
1直接命中Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents · 2609.13543长程临床智能体;自演化 harness 与技能库10 个批次、120 位患者、72 轮:关键动作 +0.73(+25%,p<0.001)、留出集 +0.625(+22%,p=0.024)、时效性 +0.45(+13%),诊断准确率不变(−0.02,不显著)单次 rollout、无种子;论文声明的代码仓库在核验时返回 404AI 栏 · arXiv
1直接命中ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement · 2609.14857自进化;五模块分解与基准解耦的 harness 演化2,000 条自建演化任务(实取 120+120)、3 轮:终端基准平均成功率 47.57%→52.43%、Pass³ 30.34%→35.96%;软件工程基准 73.40%→76.45%;终端任务上演化出的 harness 冻结后跨域仍 73.40%→75.80%;非模块化 46.44%、五模块联合 44.19% 都低于基线 47.57%无种子、方差与显著性检验;受算力限制只用了演化集的 12%;对照方法为作者在自家框架下的复现版本NLP 栏 · arXiv
1直接命中Dream-RSI: Recursive Self-Improvement through Evolving Worlds · 2609.14858自进化;把发现树当回放模拟器做离线改进零梯度步、只改探索策略代码:Lasso 六数据集平均运行时间 3587.1→2931.0 ms、调用 550→317;小模型 2516.7→2350.6 ms、3200→1879;kernel 四项 2.43×/1.79× 更少 generation、2.09×/1.44× 性能无重复与方差;数学对照表数字取自各系统原报告,模型与预算都不同故不可比;回放只覆盖历史到达过的分支;完整代码仍在准备中NLP 栏 · arXiv
1直接命中RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments · 2609.15364自进化;只改记忆的探索与固化解耦模型参数全程冻结:OSWorld 2.0 的 82 个任务平均 71.97→78.98、满分比例 37.80→42.68;ALE 的 67 个任务 83.75→84.82、49.25→50.75;四任务消融完整版 74.54% > 只保留先广 65.52% > 只保留后深 56.50%跨系统对比不是同协议;聚合只替换 41/82 与 19/67 个分数;满分比例仍低于对比系统 52.24;消融只覆盖 4 个任务AI 栏 · arXiv
1直接命中The Limits of Reference-Free Speech Quality Metrics as Evaluators and Rewards on Modern Text-to-Speech · 2609.13150TTS 评估与奖励;无参考指标效度审计6 个人评语料、64 维信号:伪影与录音缺陷密集语料上 SCOREQ 成对偏好准确率 0.909(该语料人类上限 0.887),干净商业语料上最佳单指标 0.528(上限 0.764),而「选更长的那段」有 0.524;域内校准组合相对最佳单指标 +1.5%~+6.6%;用 SCOREQ 当奖励把独立 UTMOS-v1 从 4.51 压到 1.26、人评 Elo 2098±101→1675±115奖励实验每种奖励只跑一次、无种子与检验;语料自述偏英语;干净语料只含 4 个商业系统、18 个声音音频栏 · arXiv
1直接命中Tone on a Budget: A Reference-Free Metric for Lexical Tone in Massively Multilingual Text-to-Speech · 2609.14817TTS 评估;声调轴的无参考度量与数据预算核算声调准确率:阈值冻结后在不重合划分上 0.580(置换控制 0.334)、原生录音锚点 0.596(满分 1);声调逐级压平时度量 0.543→0.333(随机水平 0.333) 而字错率 0.084→0.110 几乎不动;盲听 67 次 89.6%(95% CI 80.0–94.8);度量与听者逐次对应 AUROC 0.612(区间含 0.5)只有 3 名听者、27 条探针(作者自算条目半宽约 ±0.063);声称发布度量与协议但全文无可点击链接;逐次对应是未解决的负结果NLP 栏 · arXiv
1直接命中Cross-Lingual F5-TTS 2: A Simplified Framework for Language-Agnostic Voice Cloning · 2609.15184TTS 生成;去强制对齐与去提示转写说话人相似度在三个语内测试集上都是最高 0.687 / 0.683 / 0.768;字错率只在 LibriSpeech-PC 最低 2.014,Seed-TTS 中英为 1.629 / 1.594,高于基线 1.545 / 1.475;带静音提示下的时长相对误差 70.211%/70.984%/85.491% 降到 13.154%/15.364%/18.933%单次运行、无方差与检验;主观评测只抽 15 条/测试集且未报听者数音频栏 · arXiv
2直接命中MemRiskBench: Trace-Aware Risk-Preserving Evaluation for Long-Horizon LLM Agents · 2609.14976评测基准;轨迹级风险检查与子集选择120 个脚本化 episode(5 类风险各 24)配确定性轨迹检查、主判定不用大模型裁判:5 个 1.5B–7B 模型共 600 条轨迹的平均任务成功率为 0.775–0.885(满分 1),而最差的跨域泄漏只有 1/24(4%);20% 子集相对全量评测保持排序 Spearman 0.975、风险覆盖 1.0,计算量降 5 倍每个模型只跑一次;只覆盖脚本化环境AI 栏 · arXiv
2直接命中When Tool Calls Succeed but Workflows Fail: Anomalies at the Agent-Tool Boundary · 2609.15397工具边界;外部效果异常分类与接口能力普查纯分析性工作(原文自述未调用任何工具):给出 8 类外部效果异常,普查工具注册表快照的 98,291 个工具,74.0% 至少写了一类注释字段、61.7% 写全四个,而八类异常所需的边界能力「无一可被完整表达」无实验、无种子、无消融;普查快照时点固定AI 栏 · arXiv
2直接命中Salesforce Koa: An Enterprise Language Model for Agentic Tool Use · 2609.15066长程任务训练;规格驱动的强化学习后训练120B 级基座上做规格驱动 GRPO:τ²-Bench 加权 69.41,高于 GPT-4.1 14.9 分,仍低于 Opus-4.8 的 74.00 与 GPT-5.5 的 83.99;多轮工具调用 54.12→59.50,而监督微调后反而下降;CRM 场景 0.86训练数据规模、rollout 预算、种子与统计检验均未报告;无权重或模型卡链接NLP 栏 · arXiv
2直接命中HISPO: Hierarchical Importance-Sampling Policy Optimization with Entropy-Derived Segments · 2609.15471长推理强化学习;熵导出分段的重要性采样1.7B 基座 + LoRA、7,500 道数学题、单卡约 570–645 GPU 小时:AIME25 Acc@8 为 8.33 对 GSPO 的 5.83,Pass@8 为 17.46 对 16.19;MATH500 68.00 / 81.25配对自举区间多跨零(宏 Pass@8 增益 +1.31,区间 [−1.41,+4.15]);无多训练种子;无公开代码AI 栏 · arXiv
2直接命中Atria Dawn: The Dawn of Agentic Superintelligence · 2609.15818长程任务训练;可验证经验管道744B 混合专家模型:16 个基准中 5 项最高(自动化 53.8、工具调用 77.0、深度检索 96.0、浏览检索 92.5、网络攻防 86.5)、3 项第二,其余 8 项明显落后;769 条人机协作记录中 33.2% 的已完成任务被认为「无 AI 不可行」训练数据、算力与超参均未报告,性能取自官方发布页;栏目摘要「在 16 个基准中表现领先」属过度概括AI 栏 · arXiv
2直接命中AlgoEvo: Self-Evolving Agentic Search for Automated Algorithm Discovery · 2609.15820自进化;搜索控制权与分层经验、技能库统一协议、6 个任务、3 个种子、每种子 500 次评估上限:TSP 用 39 次评估、2.9M token 达到 5.986 / 7.007,四个对比方法都吃满 500 次;多组件任务用掉 271–275 次;组件消融经验库 +0.66%、技能库 +0.58%、情境触发注入 +0.21%无显著性检验;多组件任务并不提前收敛;FJSP 训练值略劣于对比方法;无公开代码链接AI 栏 · arXiv
2直接命中SkillLift: Learning Dense Rubrics from Sparse Oracles for Efficient Skill Evolution · 2609.15396自进化;用排序监督替代绝对分数以压低预言成本两个基准 × 3 个骨干全部第一:WildClaw 50.3→68.4、SkillsBench 29.9→62.5;token 成本为对比方法的 1/2.68–1/2.62仅 3 个 rollout 种子;无置信区间与显著性检验AI 栏 · arXiv
2直接命中MOSCOPT: Mixture-of-Skills Collective Optimization for LLM Agents · 2609.14399自进化;技能池与门控的联合无参数优化Qwen3.6-Plus 上五个基准均值 74.1,高于最强单技能基线 71.5;关掉三阶段交错更新降到 67.3,是最大降幅无方差与显著性检验;原文已收录 PRICAI 2026(栏目摘要未提)AI 栏 · arXiv
2直接命中GeoSkill: Experience-Driven Hierarchical Skill Learning with Collaborative Revision for Geospatial Agents · 2609.13667轨迹到技能;分层技能库与协同修订强骨干上 EarthBench 79.03 对 ReAct 的 58.06,小骨干 41.13 对 11.29;消融 65.32→72.58→79.03无种子与方差;未提供代码AI 栏 · arXiv
2直接命中EMR: Self-Evolving Medical Multi-Agent System via Experience Mining and Reuse · 2609.15161自进化;三级经验库的双向挖掘小骨干均值 77.8→81.1、强骨干达 93.9;去掉经验库 −6.7%、去掉原则级 −4.6%;3 次独立运行取平均无置信区间与显著性检验;未提供代码NLP 栏 · arXiv
2直接命中Learning to Coach for Experiential Learning · 2609.15851轨迹学习;训练教练、冻结执行者用「执行者作答正确性」作 GRPO 奖励:FrozenLake 7.4→65.4、Sokoban 3.8→23.6;迭代教练优于把解码预算翻倍(82.6 对 77.0)环境为小型规划类;未报方差与显著性NLP 栏 · arXiv
2直接命中DiTAR+: Dual Optimization for Robust Autoregressive Diffusion Speech Synthesis · 2609.13909TTS 生成;膨胀上下文采样与分层声学掩蔽中文困难集词错率 12.478%→9.893%;25–35 秒长句相似度 0.741→0.759、词错率 2.778%→2.173%;10 名评测员的主观评测有对照,但自报质量分 3.82 略低于自身基线 3.88未报告参数量;无方差与显著性;无代码链接音频栏 · arXiv
2直接命中CAL-MOS: Bridging Layers with Adapters for Robust MOS Prediction Across Speech Foundation Models · 2609.14956TTS 评估;跨骨干的逐层适配器聚合10 个语音基础模型 × 4 个 MOS 数据集:最佳层强依赖骨干与数据集,朴素层加权不稳定;逐层适配器加平均池化在 utterance 层平均 0.388 / 0.749、system 层 0.052 / 0.932数据集规模与语言、重复次数、方差全部未报告音频栏 · arXiv
2直接命中StepAudio 3 Realtime Technical Report · 2609.14005实时语音生成与交互系统约 196B 总参数、11B 激活;识别端 LibriSpeech test-clean 词错率 1.18;全双工子集总体 98.9(轮次接管 100.0);多 token 预测 1.76×–2.05× 加速;任务型 56.0%,低于对比系统 56.5%无人工听测;无重复与显著性;训练数据规模与语种未报告;自建基准由同一团队造题与判分音频栏 · arXiv
2直接命中The VoiceMOS Challenge 2026: Evaluating Speech Enhancement, Emotional TTS and Accented TTS Systems · 2609.13792TTS 评估;公开赛道体系与自动 MOS 预测18 支队伍、19 份提交(三个赛道 4 / 8 / 7 份,其中一支队同时参加两个赛道):语音增强赛道全部超过基线,最佳单样本 0.779、最佳成对只有 0.487;情感 TTS 最佳自然度 0.785、最佳情感 0.758;口音赛道最佳队伍正文未给数值每队一次提交、无方差与检验;口音赛道分数只在图中;原文把长音频评测列为未覆盖方向音频栏 · arXiv
2邻近跟踪Grounded in Sound: Reinforcement Learning with a Frozen Acoustic Judge to Curb ASR Insertion Hallucinations · 2609.14455语音识别后训练;冻结声学评判器作奖励(连接点:把声学证据锚进奖励)0.3B 冻结字符级 CTC 判分器增强 7B 模型的 GRPO 奖励:AMI-IHM 插入错误 −28.3%、AMI-SDM −22.3%;只有 AMI-SDM 的词错率显著下降(35.89%→34.71%,另一子集 −0.42 的区间含 0);三种子与会议级簇 bootstrap栏目摘要把 28.3% 与「降低词错率」并成一句,实际只在部分子集显著;判分器替换与人工标注未做音频栏 · arXiv
2邻近跟踪Causal Analysis and Mitigation of Spurious Onsets in Full-Duplex Speech LLMs · 2609.13445全双工语音;静音下自发开口的因果分析与抑制5 分钟数字静音下两个模型分别出现 12/40 与 11/40 次自发开口,累积发生率 30.0% / 27.5%(95% CI 16.6–46.5%);单帧概率跃升超过 9 个数量级;用因果反事实散度阈值在留出种子上抑制 13/13 与 9/9 且保留全部 40/40,95 分位决策耗时 45.60 / 60.61 ms,落在 80 ms 帧预算内只覆盖两个全双工模型;抑制为推理期干预,长对话累积效应未评估NLP 栏 · arXiv
2邻近跟踪Enabling Streaming User Transcription in Full-Duplex Speech-to-Speech Models · 2609.15759语音到语音;并行挂载流式转写头(连接点:播客转写与轮次控制)0.6B 编码器加 9B 级主干:双工内平均词错率 10.21%、独立流式 7.73%;代价是平滑轮次接管延迟由 257 ms 升到 477 ms、用户打断后的接管率由 100% 降到 94%栏目摘要称「并开源代码」,原文只有将来时表述且全文无仓库链接;收益与代价必须成对引用NLP 栏 · arXiv
2邻近跟踪-Elicitation: Benchmarking multi-turn entity extraction in voice agents · 2609.13602语音智能体评测;多轮实体收集(连接点:语音交互任务级评测协议)200 个任务、10 类实体、3 个环境:4 个语音配置的稳健精确成功率只有 0.14–0.41;加脚手架把「连续三次运行全部成功」的比例提升 14–31 个百分点,但每次多花 21–28 秒;核验后的错误只有 24–37% 被修复;各实体库「连续三次运行全部成功」的比例从 0.02(药品)到 0.60(日期)每个主环境只跑一次;有意省略呼叫方识别环节,与真实链路有差距AI 栏 · arXiv
2邻近跟踪Pull: Lazy Materialization of Working Memory for Stateful LLM Conversations · 2609.14773长程记忆;惰性物化的可寻址工作记忆(连接点:长程会话的 token 成本)本地确定性净化器零大模型调用:单跳省 75.1% token 且等价性检验通过(Δ=−0.002,噪声 σ=0.018),多跳省 72.0%;长对话基准 F1 0.299→0.464;生命周期层把 Recall@10 提到 96.0%属系统层优化、不改变模型能力;未给出真实部署的分布与工作量级NLP 栏 · arXiv
3直接命中Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement · 2609.13406自进化;形式化分类坐标无实验、无数字(全文唯一量化来自他人工作):用两个开关把现有系统分成锚定 / 目标漂移 / 完全自指三类,并列出经典保证失效的四条条件纯形式论文;四条缺陷中两条依赖引用而非测量;不能用于支撑任何性能主张AI 栏 · arXiv
3邻近跟踪LabAgent: Customize Any Research Hubs for Scientific Discoveries Using AI Agents · 2609.13437科研智能体;技能入库门槛与持久记忆(连接点:可复用技能的准入条件)ADMET 65 条中 32 条落入已发表误差棒、平均排名 2.62(榜单自身 1.87);BiomniBench-DA 均值 74.4;GeneBench-Pro 解对 2/10;ProteinGym 平均 Spearman 0.443「每领域第一」只在均值层面成立,逐任务为领先 20 / 落后 17 / 打平 13;原文承认两个子领域上对比方法更好AI 栏 · arXiv
3邻近跟踪CoMem: Collective-Individual Memory Synergy for Evolutionary Multi-Agent Systems · 2609.15009多智能体记忆;私有沉淀与集体策展(连接点:共享记忆的污染与反效)某多智能体框架上 ALFWorld 79.85→89.55、PDDL 60.78→70.19,跨框架平均 +8.02 / +4.70;反向发现是共享记忆常低于无记忆(同环境某框架 59.53、52.80 对无记忆 67.78)投稿状态为已投 AAAI 2027(非录用);无方差与显著性;未提供代码AI 栏 · arXiv
3邻近跟踪Homeostatic Continual Learning · 2609.13771持续学习;用结果异常反查数据共现特征(连接点:环境漂移下的记忆更新)无基准、无基线、无指标,全文未报告实验数字,只有一个自设的排队示例立场与示例论文,作者自列 5 项待完成工作;不可当作实验结果引用AI 栏 · arXiv
3邻近跟踪Quantifying the Generation Modality Gap in Speech-Text Language Models · 2609.14743语音-文本联合生成;模态差距度量(连接点:长音频语义连贯性度量框架)匹配数据与匹配生成设置、270M→456M 参数:语境困惑度从纯语音的 228.8 降到语音-文本的 49.9,但说话人相似度 0.70→0.62、自动 MOS 3.41→3.09 反而变差,音素指标几乎不变无人类听测、每配置单一种子;结论限于该模型族NLP 栏 · arXiv
3邻近跟踪Why LLM Agents Collapse Without Oversight: The Enforcement Gap as the Mechanism Behind Emergence World Failures · 2609.15293智能体治理;审计与执行的脱节(连接点:长程运行的监督闭环)栏目条目报告:崩溃机制是「审计检测到危险但控制器忽略」,并称不到 20 行代码的条件检查可把攻击成功率降到四分之一单一作者、单环境报告;未提供多环境复现与统计口径AI 栏 · arXiv
3邻近跟踪HazardAuditor: From Executable Threats to Safer Computer-Use Agents · 2609.15134计算机操作智能体;执行级防护(连接点:长程执行的安全门)栏目条目报告:用规范事件表示与偏好优化训练防护,在异构计算机操作智能体上安全防护准确率最高提升 16.5 个百分点防御自身漏报率与误杀代价未报告;跨环境泛化未验证AI 栏 · arXiv
3邻近跟踪Token Efficient Task Execution via Application Behavior Modeling for Web Agents · 2609.13491Web 智能体;应用行为建模降低 token(连接点:长程执行成本)栏目条目报告:45 个学习管理系统任务上,较两个对比系统分别省 44% 与 80% 的 token,同时提升任务成功率单一应用域;未报告模型规模与方差AI 栏 · arXiv
3邻近跟踪AutoTailor: Automatic, User-Aligned Capability Selection and Adaptation for Web Agents · 2609.13548Web 智能体;工具集与能力的自动裁剪(连接点:长程 agent 的接口面治理)栏目条目报告:用离线过滤加在线动态重选构建紧凑工具集合,在保持或提升准确率的同时大幅降低 token 成本与延迟依赖特定工具生态;多用户偏好冲突的处理未给出AI 栏 · arXiv
3邻近跟踪Partition Scores Are Not System Scores: Deployment-Fidelity Gaps in Decomposed Algorithm Selection · 2609.13785评测效度;分解式评测与部署分数的差距(连接点:评测口径高估)栏目条目报告:定义部署保真度差距,证明分解式算法选择的分区分数会高估可部署系统性能,并在五个基准上验证该差距为正属理论加基准验证;延迟、成本等部署变量未纳入模型AI 栏 · arXiv
3邻近跟踪PolicyMem: Geometric Policy Memory for LLM Governance · 2609.13734安全策略记忆;自然语言策略的外部化与检测-重写-验证(连接点:策略门禁与归因)栏目条目报告:把自然语言策略外部化为低秩子空间对象,用投影能量构成检测-重写-验证循环,在五个基准上达到不安全行为检测的领先水平并支持策略归因只在五个基准上验证;未报告与人工规则门的成本对照NLP 栏 · arXiv

长程任务评估:门禁口径、重复稳定性与风险切片

这一批关于评测的工作有一个共同结论:分数本身没有错,错的是把分数当成单一事实。自然语言的策略可以含混到把合规失败变成能力不足,同一个模型重复运行会在动作层产生完全不同的轨迹却被判定掩盖,多轮约束满足率会随轮次衰减到零,而大多数风险切片在一个总分里根本看不见。

1. DynSTEER: Dynamic Stage-wise Trajectory Evaluation and Execution-time Review for Agents(arXiv:2609.14637,直接命中·AI 栏)

  • 研究问题:长程智能体轨迹评估有三种失效方式:只看终态,无法定位错误发生在哪一步;用单条参考轨迹做匹配,会惩罚合法的替代路径;事后用大模型裁判通读全轨迹,成本高且不能提前终止注定失败的运行。
  • 改动位置(维度):评测协议本身——用公开任务视图编译里程碑图,把「执行时审查」和「终态验证」拆开。
  • 核心方法机制
    • 里程碑图只从公开任务视图编译:先让模型按提示生成多份候选计划,再由确定性程序做契约校验(剔除幻觉接口、类型不匹配、环依赖),按严格多数共识保留里程碑与优先边,最后做传递归约。评测因此不需要 ground truth。
    • 双时钟观测:原始事件时钟用于致命雷区即时拦截,闭合动作时钟只在工具返回且智能体交回控制权时推进;用最近支配点(编译领域所说的必经节点,即从入口到该里程碑必须经过的那个节点)界定每个阶段的证据窗口,避免并行分支互相污染。
    • 三层判官按不确定度路由:规则判官、单次结构化判官、单维度专家判官;执行时设四类早停(致命雷区、结构不变量失败、持续低质量、前沿停滞)。
  • 关键定量结果(含比较对象与口径)
    • ToolSandbox 的 509 个本地沙箱场景 × 4 个模型上,区分度从终态验证的 0.0270 提升到 0.0500(作者表述为相对提升 85.2%),模型对可分性从 5/6 升到 6/6,配对 Wilcoxon 检验 p<0.01 1
    • 终态验证的打分饱和很直观:22.63% 的运行拿到精确的满分 1.0。
    • 错误定位上,抽样出 60 条「判官与专家标注不一致」的轨迹做盲审,阶段化评测定位首个关键错误与专家一致率 91.7%,而终态验证器定位到的中间错误为 0。
    • 早停的收益必须分失败类型核算:519 次终止运行(覆盖 173 个任务)合计节省 34.51% 的进度,但净管线收益在死锁类失败上为每 run 省 63.05 秒,在低分策略类上反而每 run 多花 3.81 秒。
    • 判官成本被压到很低:61.4% 的检查由零大模型调用的规则判官完成,结构化判官 29.8%,专家判官只有 8.8%。
  • 证据强弱与复现边界:报告了每模型分数的标准差、模型对区分的配对检验,以及一次 60 条轨迹的盲人工审计,信号强度是够的。但评测建立在同一批已录轨迹的重放上,作者用节省进度反推的「省了多少步」不等于端到端真实节省;三个组件没有逐项消融;只在单一基准、单一沙箱后端上验证;未报告运行次数与随机种子;arXiv 摘要页与论文正文都没有公开代码链接。
  • 对目标研究线的连接点:直接命中长程任务评估。它证明过程质量可以和终态成功分离——有的运行终态拿满分,阶段评判仍然在工具合规与效率上扣分,这正是任何轨迹级信用分配需要先有的可观测信号。
  • 结论与阅读建议:建议精读(优先级 1)。在设计智能体评测流水线、需要把「失败在哪一步」与「最终成不成」分开报告的团队适用。
  • 入口:AI 栏 · arXiv

2. Policy Loopholes in Agent Evaluation: When Policy Ambiguity Masquerades as Agent Error(arXiv:2609.14400,直接命中·NLP 栏)

  • 研究问题:基准用自然语言写的任务策略如果本身有歧义和漏洞,智能体按字面与合理推断行事会被判失败;这种失败被记成了模型能力不足,而实际上罚的是出题方。
  • 改动位置(维度):评测效度;把策略漏洞当成一类可审计的评测缺陷。
  • 核心方法机制:先在两组任务策略上人工审出 17 处漏洞并归类,再用同一批模型做多次独立运行,对比受漏洞影响与不受影响的题目得分、方差与失败归因,最后检查后续版本的基准改动是否覆盖了这些漏洞题。
  • 关键定量结果(含比较对象与口径)
    • 1,968 次运行(3 个模型 × 4 次 × 航空 50 题与零售 114 题)中,17 处漏洞里有 7 处落在航空任务的 50 道题上 2
    • 受漏洞影响的题目平均得分 37%,不含漏洞的题目 51%;其中 GPT-5 被扣掉 32.4 个百分点,是所有模型里惩罚最重的。
    • 漏洞题的跨次运行方差是无漏洞题的 1.62 倍(0.110 对 0.068):同一个模型在同一道题上结果更飘,方向与「模型能力不足」这一解释相反。
    • 后续基准版本的改动集包含全部 7 道漏洞题(超几何检验 p=1.6%),等于外部确认了这份清单。
  • 证据强弱与复现边界:论文已被 REALM EMNLP 2026 收录,实验规模足以支撑「策略漏洞是系统性评测缺陷」这一结论。边界是:采样温度与模型精确版本未报告,漏洞清单来自作者人工审计,无法排除其他未被发现的漏洞;结论针对任务型对话基准,迁移到开放式任务还需要另行审计。
  • 对目标研究线的连接点:直接命中长程任务评估。凡是要用自然语言规格驱动智能体的团队,都应该把「策略规范审计」放进评测流程,而不是等失败发生后再去归因。
  • 结论与阅读建议:建议精读(优先级 1)。正在设计智能体评测集、发布榜单或做发布门禁的团队必读。
  • 入口:NLP 栏 · arXiv

3. MTAC-IFBench: Benchmarking Instruction-Following in Multi-Turn Agentic Coding(arXiv:2609.14992,直接命中·NLP 栏)

  • 研究问题:一次给全的约束遵循已经被测得很透,但真实的长程编码任务是一条条追加要求的:模型在多轮之间守住早先约束的能力,几乎没有基准在测。
  • 改动位置(维度):评测基准;多轮渐进式约束的满足与保持。
  • 核心方法机制:100 个编码实例、共 9,133 条约束,平均每次交互 7.04 轮、每个实例 91.33 条约束,分 6 个主类别与 18 个次类别;同一框架下跑 11 个模型,分别统计约束满足率与增量约束满足率(只看本轮新加约束是否被满足)。
  • 关键定量结果(含比较对象与口径)
    • 11 个模型的总约束满足率落在 60.6%–80.4%,看起来不算差;但增量约束满足率只有 1.1%–12.7%,几乎没有模型超过 13% 3
    • 多数模型在第 6 轮之后增量满足率归零——也就是后面的要求基本不再被吸收。
    • 判官一致性 0.855–0.924,说明这个差距不是判分噪声造成的。
  • 证据强弱与复现边界:约束条目数量与轮次结构披露充分,判官一致性有报告。缺口是:没有随机种子、没有显著性检验,评测绑定单一智能体框架的特定版本,换框架后绝对数值不可直接比较。
  • 对目标研究线的连接点:直接命中长程任务评估。它把「长程」拆成了轮次维度上的约束衰减,这对任何多轮编码代理的验收标准都是直接的补充指标。
  • 结论与阅读建议:建议精读(优先级 1)。做多轮编码代理、需要给「指令遵循是不是撑得住长程」设验收线的团队适用。
  • 入口:NLP 栏 · arXiv

4. Same Patient, Different Order: Action-Level Reliability of Clinical LLM Agents Under Repeated Runs(arXiv:2609.13582,直接命中·NLP 栏)

  • 研究问题:智能体基准几乎都只跑一次就给结论。同一个模型、同一批题重复运行时,动作层面到底稳不稳,分数能不能反映这种不稳。
  • 改动位置(维度):评测协议;重复运行下的动作级一致性。
  • 核心方法机制:在 MedAgentBench 上做 1,000 次运行,四个运行组各 250 次、每组重跑 5 次,用两个 4 比特量化的中小模型;除了看通过率,还逐次对比生成的医嘱集合与最终判定,并用 Wilson 区间、McNemar 配 Holm 校正和簇 bootstrap 报告不确定度。
  • 关键定量结果(含比较对象与口径)
    • 有一个配置下,43 组里有 43 组的医嘱集合每一次都不同;而同一批运行的最终判定,在 43 组里有 22 组完全没变 4
    • 四个运行组里,第一次运行就出现组内不一致的组数分别是 28 组中的 12 组、49 组中的 40 组、35 组中的 27 组、50 组中的 50 组(分母是该组的题目数):第一次跑就不一样是常态,不是尾部偶发。
  • 证据强弱与复现边界:不确定度报告是本批最规范的一档(区间、配对检验加多重校正、簇 bootstrap),而且作者主动声明「协议可迁移、比率不可」,把结论限定在方法层。边界是:只覆盖两个量化小模型与单一临床基准;论文声明的代码仓库在核验时返回 404,复现需要等资源放出。
  • 对目标研究线的连接点:直接命中长程任务评估。它给所有「一次运行定结论」的智能体评测提供了一个可直接套用的动作级稳定性协议,也解释了为什么只有总分上升并不代表系统变稳。
  • 结论与阅读建议:建议精读(优先级 1)。做智能体发布门禁、需要给「稳定性」设阈值的团队适用。
  • 入口:NLP 栏 · arXiv

5. MemRiskBench: Trace-Aware Risk-Preserving Evaluation for Long-Horizon LLM Agents(arXiv:2609.14976,直接命中·AI 栏)

  • 研究问题:长程智能体的风险评测通常写成最终答案对不对,而风险往往出现在轨迹中间:越权访问、隐私泄漏、跨域信息串用,这些在总分里看不见。
  • 改动位置(维度):评测基准;轨迹级风险检查与低成本子集选择。
  • 核心方法机制:120 个脚本化 episode,5 类风险各 24 个,配确定性轨迹检查,主判定不依赖大模型裁判;另外设计一个风险保持的子集选择器,让缩小评测规模时不丢高风险样本。
  • 关键定量结果(含比较对象与口径)
    • 5 个 1.5B–7B 本地模型共 600 条轨迹上,平均任务成功率为 0.775–0.885(满分 1),而最差的一项跨域泄漏只有 1/24(4%)——两个数字放在一起,说明总成功率完全不能代表安全性 5
    • 用 20% 的样本时,相对全量评测的排序 Spearman 仍有 0.975,风险覆盖与高风险检出都保持 1.0,计算量降到五分之一。
  • 证据强弱与复现边界:用 1,000 次 bootstrap 与 Fisher 检验加 Holm 校正报告统计,方法层面清晰。缺口是每个模型只跑一次,因此模型间比较没有重复带来的不确定度;环境为脚本化构造,不含自由形式的工具使用。
  • 对目标研究线的连接点:直接命中长程任务评估。当评测预算不够跑全量轨迹时,这类「风险保持子集」是可复用的做法。
  • 结论与阅读建议:建议扫读(优先级 2)。做智能体安全门禁与评测成本控制的团队适用。
  • 入口:AI 栏 · arXiv

6. 同维度的一篇评测效度近邻

  • Partition Scores Are Not System Scores: Deployment-Fidelity Gaps in Decomposed Algorithm Selection(arXiv:2609.13785,AI 栏·邻近跟踪):栏目条目报告该工作定义了「部署保真度差距」,证明把评测拆成分区分别打分时,分区分数会系统性地高估真正可部署系统的性能,并在五个基准上验证该差距为正,建议两类分数并排报告。连接点:与本期 Policy Loopholes 同一类问题——评测口径本身制造了高估;但该文只把差距与基准验证结合,延迟与成本等部署变量并未进入模型,因此按邻近跟踪处理。入口:AI 栏 · arXiv

长程执行的失败定位与状态交接

分数之外,长程系统还有两个工程问题必须先解决:失败之后能不能准确定位到第一步错在哪,以及控制权在模型之间转移时能不能不把已经做完的事再做一遍。本批各有专门的直接命中,而且两篇都给出了「不看分数也能复核」的中间信号。

1. Root-Cause Attribution Is a Search Problem: Continual Search for Long-Horizon Agent Failures(arXiv:2609.13463,直接命中·AI 栏)

  • 研究问题:长程智能体每次运行都会产出几十万 token 的执行记录,用大模型单遍判读做根因归因,会过早停在「看起来合理」的诊断上,把真正相关的证据留在没读过的区域。
  • 改动位置(维度):失败诊断流程;把根因定位从一次性判断改造成跨轮搜索。
  • 核心方法机制:同一份记录先跑一遍原生单轮归因,然后把同一个会话分叉成两个条件,两者共享判官配置、评测记录与第一轮预测,只有后续指令不同:对照组要求复查并确认现有结论,实验组要求挑战当前结论、检视未读的工具输出与未探索区域、重新评估候选失败步。判官是有工具权限的智能体,按需检索工件而不是把整段轨迹塞进上下文;另用去重后的累计观测 token 衡量「真正读到了多少新证据」。
  • 关键定量结果(含比较对象与口径)
    • 自建的长轨迹集(50 条人工标注失败记录,中位 286K token、1.05 MiB)上,F1 从单轮 0.349 提升到 0.498;对比强基线的联合准确率在另一套基准上从 0.156 提到 0.257、加权 F1 从 0.426 提到 0.500 6
    • 「花更多算力」不等于「判断更准」:把同一判官改成自一致性独立重采样,每条轨迹多花 6.52 美元,联合准确率反而从 0.153 降到 0.138;而把低推理力度配在跨轮搜索上,只用约 62% 的累计 token 就在第三轮达到 0.533。
    • 证据覆盖是可以直接观测的:工件覆盖率从两条件下的同为 70.8%,在实验组第三轮达到 94.6%、第四轮 97.4%,对照组从第二轮起停在 77.0%。
    • 增益有尺寸门槛:在两条短轨迹基准上,继续追问会让准确率下降(有一处从 0.345 掉到 0.241)——短记录上追问只是对话压力,不是发现机制。
  • 证据强弱与复现边界:主基准上做了四次独立重采样,并报告每次的增益区间(联合准确率 +0.037~+0.055),成本按公开价目折算,判官提示词逐字公开;执行记录尺寸做了三分位分层检验。边界是:其余基准均为单次判官运行,主表差值没有区间;自建的 50 条标注集未公开,也无标注者一致性统计;判官提示词是按基准定制的,存在提示工程与结论混淆的风险。
  • 对目标研究线的连接点:直接命中长程任务评估。它的可迁移结论很实用:在长记录上,把预算投给「跨轮扩展搜索」比投给「单轮更高推理力度」更划算,而独立重采样不能替代顺序搜索。
  • 结论与阅读建议:建议精读(优先级 1)。做智能体失败分析、运维归因与自动评测诊断的团队适用。
  • 入口:AI 栏 · arXiv

2. Do Not Restart: Residual Completion for Stateful Agent Handoffs(arXiv:2609.13800,直接命中·AI 栏)

  • 研究问题:为了省成本,系统会把任务从便宜模型转交给强模型。但有状态任务转交时必须保留已经被用户接受的选择、已经产生的效果和还没完成的义务;否则继任者要么重启任务(重复不可逆动作,比如重复付款),要么宣称完成而漏掉未完成的义务。
  • 改动位置(维度):交接协议与权限授予;把「保留什么、允许做什么」变成可冻结的契约。
  • 核心方法机制
    • 在继任者提出方案之前先冻结残差契约,契约包含已固定部分与开放义务;冻结之后提案与执行都不得增删或改写它,构造失败就不授予写权限。
    • 只有整段剩余计划通过检查(接口被允许、类型与接地良好、效果在允许集内、保持已固定进度、覆盖全部义务、依赖与终局声明有显式证据路径)才给予原生写权限。
    • 成功只能由实时回执认定:动态输入在执行时按前序回执重绑,只有原生回执与记录的结果一致才算完成,否则结束本次交接——它不修复旧计划,也不假装回滚。
  • 关键定量结果(含比较对象与口径)
    • 在 5 个有状态工具使用评测面、每个评测面 5 次完整运行上,宏平均质量比全任务强模型高 1.2 个点,成本只有 34.6%;换成另一组模型对,质量高 0.9 个点、成本 22.0% 7
    • 与路由与级联基线相比:某路由基线宏平均 −2.1 点、成本 59.7%;某级联基线 −1.3 点、成本 96.3%;本方法 +1.2 点、成本 34.6%。
    • 消融显示三阶段缺一不可:直接接管 58.9%(68.82 美元)→ 加契约构造 62.0% → 加可执行残差补全 65.4% → 加检查执行 70.8%(38.80 美元),其中整图准入一步就贡献 8.8 个点并省下 8.26 美元。
    • 审计表的数字比总分更有参考价值:接受绑定正确率 100%(50/50)、持久写义务召回 91.2%(62/68)、无支撑的实时写误接收 0%(0/50,对应 95% 单侧上界 5.8%)、不必要的检查执行拦截 4.7%(2/43)、因遗漏造成的虚假完成 4.0%(2/50);124 次干预 100% 发生在首次真实写操作之前。
  • 证据强弱与复现边界:每个评测面 5 次完整运行并报宏平均标准差(0.54 与 0.58 个点),审计项给出分子分母与一个单侧置信上界,还做了拒绝重放的确定性一致性检查。边界是:未报告每个评测面的任务数量,无法评估统计功效;成本口径为供应商侧支出,不含延迟与用户模拟器开销;逐面并不一致(有两面略低于强模型);代码只承诺开源。
  • 对目标研究线的连接点:直接命中长程任务评估与执行可靠性。它给出一个可照抄的检查顺序:先冻结契约、再要求整段计划通过、最后才给写权限,因为靠运行末端的监控无法回滚已经提交的不可逆变更。
  • 结论与阅读建议:建议精读(优先级 1)。做多模型路由、有状态工作流与不可逆操作的团队必读。
  • 入口:AI 栏 · arXiv

3. When Tool Calls Succeed but Workflows Fail: Anomalies at the Agent-Tool Boundary(arXiv:2609.15397,直接命中·AI 栏)

  • 研究问题:工具调用返回成功,整个工作流仍然可能出错:副作用发生了但没人记账,或者调用成功而业务状态没变。这类失败既不在工具层报错,也不在模型层报错,落在两者之间的边界上。
  • 改动位置(维度):工具接口的能力模型;把外部效果异常当成一类需要接口契约来表达的东西。
  • 核心方法机制:提出效果历史模型,归纳出 8 类外部效果异常,然后用一份工具注册表快照做能力普查,检查现有接口规范能表达其中几类。
  • 关键定量结果(含比较对象与口径):普查覆盖快照中的 98,291 个工具:74.0% 至少写了一类注释字段,61.7% 把四类注释字段写全;但八类异常所需的边界能力,原文的结论是「无一可以被完整表达」——第一类能力只能部分表达,其余多为不表达 8
  • 证据强弱与复现边界:这是一篇纯分析性工作,原文自述没有调用任何工具,因此没有实验、种子或消融;普查结论依赖固定时点的接口快照,接口规范演进后数字会变。
  • 对目标研究线的连接点:直接命中长程执行可靠性。它把「工具调用成功率很漂亮」这一常见指标的空洞之处讲清楚了:真正需要的是可复用的事务契约,而不是更细的日志。
  • 结论与阅读建议:建议扫读(优先级 2)。设计智能体工具接口、做执行审计的团队适用。
  • 入口:AI 栏 · arXiv

4. 同维度的四篇近邻

  • Why LLM Agents Collapse Without Oversight: The Enforcement Gap as the Mechanism Behind Emergence World Failures(arXiv:2609.15293,AI 栏·邻近跟踪):栏目条目报告该工作把无监督环境下的智能体崩溃归因为「执行差距」——审计环节检测到了危险,控制器却没有照做,并称不到 20 行代码的条件检查可以把攻击成功率降到四分之一。连接点:与本期评测类工作互补,提醒监督不能只做检测还要做执行;单一作者、单环境报告,未提供多环境复现与统计口径,按邻近跟踪处理。入口:AI 栏 · arXiv
  • HazardAuditor: From Executable Threats to Safer Computer-Use Agents(arXiv:2609.15134,AI 栏·邻近跟踪):栏目条目报告该工作用规范事件表示与偏好优化训练执行级防护,在异构计算机操作智能体上把安全防护准确率最高提升 16.5 个百分点。连接点:长程执行的安全门;防御自身的漏报率与误杀代价未报告,按邻近跟踪处理。入口:AI 栏 · arXiv
  • Token Efficient Task Execution via Application Behavior Modeling for Web Agents(arXiv:2609.13491,AI 栏·邻近跟踪):栏目条目报告该工作在 45 个学习管理系统任务上,较两个对比系统分别节省 44% 与 80% 的 token,同时提升任务成功率。连接点:长程执行的单位成本;只有单一应用域、未报告模型规模与方差,按邻近跟踪处理。入口:AI 栏 · arXiv
  • AutoTailor: Automatic, User-Aligned Capability Selection and Adaptation for Web Agents(arXiv:2609.13548,AI 栏·邻近跟踪):栏目条目报告该工作用离线过滤加在线动态重选,为 Web 智能体构建紧凑的工具集合,在保持或提升准确率的同时大幅降低 token 成本与延迟。连接点:长程智能体可暴露的接口面治理;多用户偏好冲突时的处理未给出,按邻近跟踪处理。入口:AI 栏 · arXiv

长程任务训练与测试时算力分配

训练侧这一批给出两个可对照的配方:一个把「让 harness 自己长出来」用在临床长程任务上,一个把强化学习后训练的奖励换成可执行的规格;另有一篇用一条可证明的参考线,回答了长程任务里预算应该买什么。

1. Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents(arXiv:2609.13543,直接命中·AI 栏)

  • 研究问题:临床长程任务里,一次对话要走完 72 轮、跨越多个就诊批次,而每一轮都有必须完成的关键动作。固定流程的驾驭层要么太死、跟不上任务变化,要么太松、漏掉关键动作。
  • 改动位置(维度):驾驭层自我演化加技能库加子智能体隔离;模型本身不动。
  • 核心方法机制:用一个自演化的驾驭层迭代改进流程(共 10 次迭代,最终选用第 7 版),把反复出现的处置方式沉淀为技能库,并把不同职责分给三个互相隔离的子智能体,避免上下文互相污染。
  • 关键定量结果(含比较对象与口径)
    • 10 个批次、120 位患者、72 轮的临床评测上,关键动作完成度提升 0.73(满分 1 的评分口径;相对提升 25%,p<0.001),留出集提升 0.625(相对提升 22%,p=0.024),时效性提升 0.45(相对提升 13%)9
    • 诊断准确率没有变化(−0.02,不显著)——这是设计使然,改进的是流程执行而不是医学判断能力。
  • 证据强弱与复现边界:留出集单独报告且显著,是这批工作里较少见的做法;论文已被 EMNLP 2026 Findings 收录。边界是:单次 rollout、没有随机种子,指标波动无法评估;论文声明的代码仓库在核验时返回 404,复现需要等资源放出。
  • 对目标研究线的连接点:直接命中长程任务训练。它示范了「只改驾驭层、不动权重」在真实高风险长程任务上的收益上限与边界:流程指标升、判断指标不动。
  • 结论与阅读建议:建议精读(优先级 1)。做长程行业流程代理、需要把「流程完成度」与「专业判断」分开度量的团队适用。
  • 入口:AI 栏 · arXiv

2. Salesforce Koa: An Enterprise Language Model for Agentic Tool Use(arXiv:2609.15066,直接命中·NLP 栏)

  • 研究问题:把多轮工具调用能力训练进模型时,用自由形式的偏好数据容易学到与工具契约无关的捷径;能不能把「规格」本身作为训练信号。
  • 改动位置(维度):后训练奖励与数据构造;规格驱动的强化学习。
  • 核心方法机制:在 120B 级开源基座上做规格驱动 GRPO,把工具使用的可执行规格(含一段冻结的辅助校验器)与任务奖励结合,训练多轮工具调用策略。
  • 关键定量结果(含比较对象与口径)
    • 企业工具使用基准加权得分 69.41,比一个同代基线高 14.9 分,但仍低于两个前沿闭源系统(74.00 与 83.99)10
    • 多轮工具调用分数从 54.12 提到 59.50;值得注意的是,同一数据用监督微调后该项反而下降,说明收益来自奖励设计而非数据量。
    • 客户关系管理场景得分 0.86。
  • 证据强弱与复现边界:规格驱动奖励相对监督微调的反向对照有说服力。缺口是:训练数据规模、rollout 预算、随机种子与统计检验全部未报告,读者无法判断这个差距是否落在噪声内;没有权重或模型卡链接;期刊栏目的「超越专有基线」只在其中一个基线成立,原文自述仍低于最强的前沿模型。
  • 对目标研究线的连接点:直接命中长程任务训练。它支持「可执行的规格比自由形式偏好更适合多轮工具训练」这一方向,但不足以支撑选型结论。
  • 结论与阅读建议:建议扫读(优先级 2)。做企业级工具代理后训练的团队适用。
  • 入口:NLP 栏 · arXiv

3. When Agents Slow Down: Understanding LLM Agents' Test-Time Strategies via Elo-per-token Analysis(arXiv:2609.15309,直接命中·NLP 栏)

  • 研究问题:智能体自己决定何时修订、何时调工具、何时停止,于是「性能随 token 增长」的曲线无法与独立重复采样这条已知基准比较,标准基准又只返回单一判定而丢掉轨迹。长程任务的算力到底该买什么,没有可比口径。
  • 改动位置(维度):测试时算力评估与预算分配;把自适应策略放到统一尺度上。
  • 核心方法机制
    • 把「某系统在某 token 预算下的最好提交」当作一个选手,用 Bradley–Terry 模型把同任务内的两两比较聚合成 Elo,从而跨任务可比;同时区分丢弃同会话对局的 self-Elo 与保留全部对局的 joint-Elo。
    • 给出独立重复采样的理论参考线:其 Elo 随算力对数线性增长,斜率是 400 Elo/decade;再定义「局部斜率跌破该参考线」的拐点,并证明拐点之后继续加深同一条轨迹渐近不划算。
    • 中间提交协议让智能体可以随时提交当前解并拿到分数与逐用例反馈,形成(分数, token)流。
  • 关键定量结果(含比较对象与口径)
    • 14 个开放式任务 × 4 个通用智能体系统 × 每单元 5 个独立 session、目标预算 1 亿 token:所有系统的局部斜率在预算较小时都超过 400,随后下降,并且在最大预算处全部跌破 400——也就是后期的边际收益已经不如独立采样 11
    • 预算分配给出了可执行规则:某任务拐点在 3800 万 token,规则给出把 1 亿预算切成 3 个 session;该分配比单次长 session 高 264 Elo,比十次短 session 高 355 Elo(90% 自举区间分别为 [+135,+412] 与 [+226,+618],三 session 在 79% 的复制中评级最高)。
    • 但这条规则不是普适的:在另一个任务上,一次、两次、三次 session 的分配在统计上无法区分。
    • 人类对照是本批最值得记的一个数字:同一场持续多天的竞赛里,人类提交曲线对算力对数呈凸形并持续改善数天,顶级人类组合最终超过两个智能体系统;把模型换成更大的档位只改变绝对水平、不改变形状。
  • 证据强弱与复现边界:方法层做了不少扎实工作——每单元 5 个独立 session、500 次会话级自举、定理化的参考线、明确标注统计上无法区分的情形,代码仓库已公开(原始 trial 数据尚未发布)。边界也很清楚:每任务只有 5 个 session,增益区间很宽;含缓存与不含缓存两个 token 口径不可混比,而演化类方法必须用不含缓存口径;人类对照来自历史提交记录与本地重判,不是同期同环境的直接对抗;测试时训练那一支只有 5 次运行、40 步、单一任务。
  • 对目标研究线的连接点:直接命中长程任务训练与评估。它同时给出评估口径(用同一尺度下的 Elo 作为 token 预算的函数)和算力决策规则(按拐点切分并行 session),是本批最适合直接带进研发流程的一篇。
  • 结论与阅读建议:建议精读(优先级 1)。做长程智能体推理预算、并行采样与成本决策的团队必读。
  • 入口:NLP 栏 · arXiv

4. 训练侧的两篇近邻

  • HISPO: Hierarchical Importance-Sampling Policy Optimization with Entropy-Derived Segments(arXiv:2609.15471,AI 栏·直接命中):把长推理的强化学习按熵导出的分段做重要性采样。1.7B 基座加 LoRA、7,500 道数学题、单卡约 570–645 GPU 小时:AIME25 的 Acc@8 为 8.33,对 GSPO 的 5.83;Pass@8 为 17.46 对 16.19;MATH500 为 68.00 与 81.25。连接点:长推理训练的信用分配;但配对自举区间多跨零(宏 Pass@8 增益 +1.31,区间 [−1.41,+4.15]),无多训练种子、无公开代码,因此按扫读处理。入口:AI 栏 · arXiv 12
  • Atria Dawn: The Dawn of Agentic Superintelligence(arXiv:2609.15818,AI 栏·直接命中):744B 混合专家模型,用可验证经验管道训练。16 个基准中 5 项最高(自动化 53.8、工具调用 77.0、深度检索 96.0、浏览检索 92.5、网络攻防 86.5)、3 项第二,其余 8 项明显落后;769 条人机协作记录中 33.2% 的已完成任务被认为「无 AI 不可行」,但方法由 AI 提出 64.6%、最终决定由人做出 85.5%。连接点:长程任务训练;训练数据、算力与超参全部未报告,性能取自官方发布页,栏目摘要「在 16 个基准中表现领先」是过度概括,因此按扫读处理。入口:AI 栏 · arXiv

轨迹学习与自进化:从改整条流水线走向只改一个模块

本批在自进化方向出现了一个清晰的分工:一类工作把「改哪里」缩到最小范围——只改 harness 的某个模块、只改探索策略的代码、只改记忆;另一类工作则把「在哪里试错」搬到比真实环境便宜的地方,用历史轨迹做离线回放;还有一篇干脆不做实验,先把「什么样的自进化框架在形式上就不成立」这件事说清楚。

1. ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement(arXiv:2609.14857,直接命中·NLP 栏)

  • 研究问题:让智能体自己改写自己的 harness,得到的改进到底能不能迁移。作者点名三种失败模式:在评测基准或其子集上演化,无法区分「可复用的改进」与「基准特化」;用单条轨迹更新,会把 harness 的系统性缺陷和具体题目的解法细节搅在一起;在单体 harness 上优化,无法把反复出现的行为缺陷定位到该负责的那个组件。
  • 改动位置(维度):harness 的代码结构,五模块化 credit assignment;模型权重全程冻结。
  • 核心方法机制
    • 演化数据与下游评测基准完全不相交:自建 2,000 条可执行演化任务,构造后再用实例级相似度筛除与基准高度重叠的题目。
    • 对比轨迹采样:同一实例 rollout 多次,按成功次数分成全成功、混合、全失败三档,跨 epoch 保留历史轨迹补足对比证据,再把诊断汇成结构化条目(哪个模块是元凶、改动会不会改变结果)。
    • 把 harness 拆成五个模块——智能体循环、工具使用、观测管理、上下文管理、任务完成判定——每个模块独立演化,最后做一次跨模块整合。
    • 三道验证门把住回滚:静态程序检查(语法树、导入、协议合规)、看不见奖励的差异审查(判定为针对演化任务特化就回滚)、每次改动后随机抽两个任务实跑。
  • 关键定量结果(含比较对象与口径)
    • TerminalBench 2.0 上平均成功率 47.57% → 52.43%、Pass³ 30.34% → 35.96%;SWE-Bench Verified 上 73.40% → 76.45% 13
    • 跨域迁移是这篇最值得看的一处:在终端任务上演化出来的 harness 冻结之后拿到 SWE-Bench Verified 上,平均成功率从 73.40% 升到 75.80%,说明改进没有只贴在演化用的那批题上。
    • 模块化本身是有效的:非模块化演化 46.44%、五个模块一起联合演化 44.19%,两者都低于不做任何演化的 47.57%;只有分模块独立演化再整合才到 52.43%。
    • 同一协议下与既有 harness 演化方法对比(统一骨干、统一 16 轮演化、统一禁用联网检索):基线 61.79%,作者复现的 AHE 62.54%、Meta-Harness 62.92%,ModularRSI 67.42%——既有方法在解耦协议下只动了约 1 个百分点。
    • 换骨干也能迁移:GLM-5.2 从 59.55% 到 61.80%、MiniMax-2.5 从 41.57% 到 44.94%。
    • 单模块的效果并不都同向:只演化观测管理把平均交互步数从 34.70 降到 22.50,但平均成功率只有 49.81%——效率与质量要分开看。
  • 证据强弱与复现边界:4 组消融、每任务 3 次独立 rollout、三道自动回滚门,演化集与评测集按实例级筛选隔离,代码与生成物已开源。缺口在于全文没有随机种子、方差、置信区间或显著性检验,每个配置只有一个数值;作者自述受算力限制,主演化只用了 2,000 条里的 120 + 120 条;对照方法 AHE 与 Meta-Harness 是作者在自家框架下复现并统一到 16 轮的改写版本,不是原报告设置。
  • 对目标研究线的连接点:直接命中轨迹学习与自进化,也是本批对「长程任务评估」最直接的一课:只报平均成功率会掩盖独立变化,这篇同时报平均成功率、至少一次成功、三次全成功和平均交互步数,四个数字方向并不一致。
  • 结论与阅读建议:建议精读(优先级 1)。正在做智能体 harness 优化、把评测集与优化集分开的人应当先读。
  • 入口:NLP 栏 · arXiv

2. Dream-RSI: Recursive Self-Improvement through Evolving Worlds(arXiv:2609.14858,直接命中·NLP 栏)

  • 研究问题:递归自改进的瓶颈不在候选生成,而在「怎么管理和改进探索策略」。失败模式很具体:固定探索策略在搜索空间变大后会把算力持续投给已经失败的方向;而想在线优化策略,又会撞上元层反馈延迟昂贵、元策略空间巨大这两堵墙。
  • 改动位置(维度):只改探索策略的代码,零梯度步,底层模型、评测器与执行接口全部固定。
  • 核心方法机制
    • 发现过程被记成一棵发现树:每个节点保存文件系统快照、产物、评测诊断与分数,于是「历史走过的路」本身就是一台可复用的回放模拟器。
    • 离线「做梦」:在一个 LLM 常驻的策略开发智能体里改写探索策略代码,产出多个候选版本,每个版本都在历史每一棵树上回放评估,用「发现质量 − 执行成本 + 并行奖励」的组合分排序,只把胜出版本部署到在线。
    • 策略选择自带一条不劣保证:候选集包含当前策略,因此新版本在固定历史上的平均回放分不会低于旧版本——注意这条保证只作用于回放分,不等于在线性能单调不降。
  • 关键定量结果(含比较对象与口径)
    • Lasso 正则化路径任务(6 个 held-out 数据集的平均运行时间 / 累计发现智能体调用数):固定探索基线 3587.1 ms / 550 次调用,Dream-RSI 2931.0 ms / 317 次;在小模型上 2516.7 ms / 3200 次 → 2350.6 ms / 1879 次 14
    • 三个数学优化任务里两个达到或超过所选 baseline;自相关不等式上最优值仍属对比系统 SimpleTES(1.453675,Dream-RSI 为 1.456375)。
    • GPU kernel 工程四项全部改进:两项在可比性能下少用 2.43× 与 1.79× 的 generation 预算,两项在可比预算下性能高 2.09× 与 1.44×。
    • 一个值得记住的反例:把历史抽象成高层方向性洞见再注入提示词,两种范式在同等预算下都变得比不加指导更差(原文只给图,未给数字)。
  • 证据强弱与复现边界:受控对比做得干净——同发现智能体、同评测器、同初始化、同逐轮预算,首轮按构造完全相同;三领域共 8 个任务给出成对的质量与成本。边界同样明显:没有重复实验与方差,数学任务对照表的既有系统数字取自各自原报告,模型、预算、框架都不同因而不具可比性;数学用 generation 计、Lasso 用调用数计,两个口径不能合成一句「省了多少」;回放只覆盖历史真正到达过的分支,作者自己写明「策略只能梦见历史走过的地方」;官方仓库标注完整代码与复现脚本仍在准备中。
  • 对目标研究线的连接点:直接命中轨迹学习与自进化。它把「轨迹」从上下文材料和训练数据之外,变成第三种用途——可反复使用的评判环境,这对任何想复用既有执行记录做自我评估的团队都直接可用。
  • 结论与阅读建议:建议精读(优先级 1)。做开放式发现、进化式搜索、探索策略调度的团队适用。
  • 入口:NLP 栏 · arXiv

3. RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments(arXiv:2609.15364,直接命中·AI 栏)

  • 研究问题:智能体进入一个接口、工具和失败模式都没被预训练覆盖的新环境时,能否在不更新参数、没有标签、没有人盯的前提下,自己探索出可用的因果关系并固化成可复用的记忆。
  • 改动位置(维度):记忆与探索调度,属上下文与 harness 层;模型权重、智能体框架全程固定。
  • 核心方法机制
    • 三个角色分工:actor 带着可持续演化的记忆执行,verifier 直接检视环境证据并给出成败与支撑反馈(与 actor 的私有推理和记忆隔离,以降低相关性错误),curriculum agent 决定下一步该练什么、生成练习任务直到新练习不再带来新知识。
    • 两阶段探索:先广(并行提出多个不同方向的练习,按知识缺口排下一轮)后深(顺序递归,一次只攻一个高难任务,每条被核验的经验在下一步之前先写进记忆)。
    • 测试时记忆复用:探索结束即冻结记忆、关闭课程与记忆更新,actor 直接拿记忆执行目标任务。
    • 隔离工程写得很细:本地验证与官方评测分离、验证探针跑在受检查点保护的副本上、探索后环境重置、官方评测器不向学习方泄露分数。
  • 关键定量结果(含比较对象与口径)
    • OSWorld 2.0 的 82 个离线任务上,同一框架只关掉探索与持久记忆,平均得分 71.97 → 78.98、满分任务比例 37.80 → 42.68;Agents' Last Exam 的 67 个任务上 83.75 → 84.82、49.25 → 50.75 15
    • 两阶段结构有可测差异:四个任务上的阶段消融,完整版平均 74.54%,只留先广 65.52%,只留后深 56.50%——而且只留后深在两个任务上低于不做探索的基线。
    • 原文给出的失败模式审计比成绩更有用:探索不够聚焦(反复练文档处理,始终没测「获取不可用用户信息」)、验证不完整(verifier 在官方评分卡下对无支撑的字段值仍判通过)、记忆固化错误规则(把缺失数据标记当成有效答案、把不可得信息当成否定答案,后续直接复用)。
  • 证据强弱与复现边界:报告口径披露得罕见地细——OSWorld 的 RSI 行只替换了 41/82 个分数、ALE 是 19 个新分数加 48 个保留基线分,未获探索的任务仍留在分母里,原文明确说保留的基线分「不是独立的 RSI 评测」;跨系统比较不是同协议评测,作者自己也写明了。此外消融只覆盖四个任务,只留先广的条件被限制在最多两个练习项目、预算并不对等;没有种子、方差或显著性检验。在满分任务比例上,RSIAgent 的 50.75 仍低于对比系统 GPT-6 Astra 的 52.24。
  • 对目标研究线的连接点:直接命中轨迹学习与自进化,同时给长程任务评估立了一个可抄的规矩:自进化系统的评测必须把探索与评测隔离,并同时报部分完成与全部完成两个口径。
  • 结论与阅读建议:建议精读(优先级 1),但引用其分数时必须带上聚合口径。做无参数自适配、记忆式自改进的团队适用。
  • 入口:AI 栏 · arXiv

4. AlgoEvo: Self-Evolving Agentic Search for Automated Algorithm Discovery(arXiv:2609.15820,直接命中·AI 栏)

  • 研究问题:用大模型自动发现算法时,框架把模型困在预定义控制流的刚性流水线里:模型只是被动采样器,同一框架不能跨范式复用,而标量性能反馈丢掉了「某个启发式为什么成或为什么败」的结构化细节。
  • 改动位置(维度):搜索循环的控制权与知识结构:交互式智能体搜索、外部化设计技能库、分层经验库;不改模型参数。
  • 核心方法机制:智能体在任务内自主选择「读代码、改策略、做诊断、跑评测」并决定时机;范式知识外部化为可插拔设计技能,只在至少两个不同任务的经验一致支持时才写回技能库;经验分三层——单次评测事件蒸馏成经验卡、同一任务的卡组成树并用蒙特卡洛树搜索遍历、跨任务按情境触发注入。
  • 关键定量结果(含比较对象与口径)
    • 统一协议下(同一实例划分、同一评测入口、每种子 500 次评估上限、3 个随机种子)比较 6 个任务、3 种范式。单目标 TSP 上用 39 次评估、2.9M tokens 达到训练/测试目标值 5.986 / 7.007,四个对比方法都吃满 500 次(3.2M–4.3M tokens)16
    • 但「更少评估」要分范式看:单目标与多目标约 33–39 次评估即收敛,多组件协同设计任务用掉 271–275 次,接近 500 的上限,其收益是「不高于基线预算」而非提前收敛。
    • 组件消融(CVRP-DR,3 个种子):去掉经验库 +0.66%,去掉设计技能库 +0.58%,去掉情境触发注入只有 +0.21%——经验与技能是主因。
    • 反例同样存在:FJSP 4-Ops 训练值 646.4±3.3,略高于对比方法 Rotating-EoH 的 645.10±3.37,差值落在对方标准差量级内。
  • 证据强弱与复现边界:3 个随机种子并报样本标准差、统一协议、组件消融、跨任务迁移与多轮累积实验齐全;但全文没有显著性检验与置信区间,作者自己在解释「诊断密集型运行结果最好」时写明需要更大样本;TSP → Bi-TSP 的跨任务迁移增益 +4.7% 伴随 ±141.6 的标准差,差值小于离散度。代码与项目页在原文中找不到任何可点击链接,只称随补充材料提供。
  • 对目标研究线的连接点:直接命中轨迹学习与自进化,对长程任务评估提供了一条方法论:要让不同搜索范式可比,必须把实例划分、评测入口、种子与预算全部统一。
  • 结论与阅读建议:建议扫读(优先级 2)。做算法发现、进化式搜索、经验复用机制的团队适用。
  • 入口:AI 栏 · arXiv

5. Generalized Agent Iteration: One Formal Framework for Iterative Policy Improvement and Recursive Self-Improvement(arXiv:2609.13406,直接命中·AI 栏)

  • 研究问题:递归自改进被跨尺度大量宣称,却缺少一个能把「迭代策略改进」和「递归自我改进」放进同一坐标的框架;经典保证只在更新原则与评估基准都位于智能体之外时成立,一旦自我指涉就逐条失效而无法指明。
  • 改动位置(维度):形式化本身。不改参数、不改技能、不改奖励,没有实验。
  • 核心方法机制:把系统写成策略、动作评论器、修改器、修改评论器、评估基准五个分量,用两个开关区分实例——修改机制是否属于智能体本身,评估基准是否有外部来源且不可被智能体改写。由此得到三分:锚定的、目标漂移的、完全自指的。四条缺陷按「违反了哪条经典条件」列出,并给出既有系统的定位表。
  • 关键定量结果(含比较对象与口径):本文没有任何实验数字。全文唯一的量化引用来自他人工作(58.33% 的设置首次有效尝试即改进、78.26% 越过自身最好分继续搜索的次数最终以更低分收尾),属于被引论文的口径,不能当作本文结果引用。
  • 证据强弱与复现边界:这是本批证据最弱的一篇——四条缺陷中两条标注为「结构性」,其「被观察到」依赖引用而非测量;作者自述自洽条件的解集尚未刻画、从递归自改进到经典迭代改进的归约目前只是文字论述。它的价值在词汇和检查清单,不在结论强度。
  • 对目标研究线的连接点:给轨迹学习与自进化提供了一组可以直接使用的诊断坐标:一个自改进系统改的是哪个分量、改进机制在不在智能体内部、评估标准会不会被系统自己改写。原文自述当前可运行的自改进系统多数落在「锚定」一行。
  • 结论与阅读建议:建议按邻近跟踪处理(优先级 3)。适合在设计自进化架构时对照检查,不适合用来支撑任何性能主张。
  • 入口:AI 栏 · arXiv

6. 技能、经验与记忆:同一维度的六篇可迁移工作

下面六篇都不改模型参数,改的都是「把经验放在哪里、以什么形式复用」。它们与前面几篇的差别在于:证据规模与场景更窄,但对已经确定要走「技能库 + 经验沉淀」这条路的团队,它们的消融数字与失败模式可以直接对照。
  • SkillLift: Learning Dense Rubrics from Sparse Oracles for Efficient Skill Evolution(arXiv:2609.15396,AI 栏·直接命中):核心思路是「排序监督比绝对分数更省预言调用」,把技能搜索与外部预言成本解耦——内层用冻结的评分标准零成本指导技能修订,外层只用少量 rollout 做排序对齐。两个基准 × 3 个骨干上都是第一:一个从 50.3 升到 68.4,另一个从 29.9 升到 62.5,token 成本是对比方法的 1/2.68 到 1/2.62。风险是只有 3 个 rollout 种子、无置信区间与显著性检验。入口:AI 栏 · arXiv 17
  • MOSCOPT: Mixture-of-Skills Collective Optimization for LLM Agents(arXiv:2609.14399,AI 栏·直接命中):无参数的文本原生优化算法,联合优化 10 个技能的技能池与每次选 3 个的门控技能,靠类似自适应优化器的双状态更新与三阶段交错更新。Qwen3.6-Plus 上五个基准均值 74.1,高于最强单技能基线 71.5;关掉三阶段交错更新掉到 67.3,是最大降幅项。原文已被 PRICAI 2026 收录。入口:AI 栏 · arXiv 18
  • GeoSkill: Experience-Driven Hierarchical Skill Learning with Collaborative Revision for Geospatial Agents(arXiv:2609.13667,AI 栏·直接命中):分层技能库(规划层加工具层)配一套判定—批评—修订的协同修订机制,只有被归因为技能缺陷的失败才触发修订,避免把无效失败写成技能。强骨干上评测 79.03 对 ReAct 的 58.06,小骨干 41.13 对 11.29;消融显示三层贡献为 65.32→72.58→79.03。无种子与方差,未提供代码。入口:AI 栏 · arXiv
  • EMR: Self-Evolving Medical Multi-Agent System via Experience Mining and Reuse(arXiv:2609.15161,NLP 栏·直接命中):三级临床经验库(原则、模式、案例),同时挖掘正面经验与警示经验,供多智能体系统自我演化。小骨干均值 77.8→81.1,强骨干达到 93.9;去掉经验库下降 6.7%,只去掉原则级下降 4.6%,说明抽象层级本身在起作用;结果取 3 次独立运行的均值。无置信区间与显著性检验,未提供代码。入口:NLP 栏 · arXiv
  • Learning to Coach for Experiential Learning(arXiv:2609.15851,NLP 栏·直接命中):与常见做法相反,这里冻结执行者、只训练一个教练模型,用「执行者作答是否正确」作为奖励(分同实例与跨实例两种),让教练从执行轨迹里提炼可迁移的经验。FrozenLake 7.4→65.4、Sokoban 3.8→23.6;而且迭代教练优于把解码预算翻倍(82.6 对 77.0),说明收益来自经验提炼而不是算力。环境为小型规划类,方差与显著性未报告。入口:NLP 栏 · arXiv
  • LabAgent: Customize Any Research Hubs for Scientific Discoveries Using AI Agents(arXiv:2609.13437,AI 栏·邻近跟踪):技能入库有明确门槛——只有当整条流程真正跑通才允许沉淀,另配一个复现智能体与记录「失败到修复命令」的持久记忆。ADMET 任务 65 条中有 32 条落入已发表误差棒内,平均排名 2.62(榜单自身为 1.87);BiomniBench-DA 均值 74.4;GeneBench-Pro 解对 2/10;ProteinGym 平均 Spearman 0.443;统计做法较完整,用了配对 t 检验并报告不显著情形。需要注意:栏目所称「每领域第一」只在均值层面成立,逐任务统计为领先 20、落后 17、打平 13,原文也承认在聚类与细胞组成两个子领域上对比方法更好。连接点:可复用技能的准入条件与失败记忆的写法。入口:AI 栏 · arXiv

7. 长程记忆:三篇与记忆直接相关的工作

  • Pull: Lazy Materialization of Working Memory for Stateful LLM Conversations(arXiv:2609.14773,NLP 栏·邻近跟踪):用一个本地确定性净化器维护可寻址的元数据目录(零大模型调用),查询时再惰性物化、且可逆。单跳场景省下 75.1% 的 token,并通过等价性检验(Δ=−0.002,噪声 σ=0.018)说明质量未降;多跳省 72.0%;长对话基准的 F1 从 0.299 升到 0.464;生命周期层把 Recall@10 提到 96.0%。连接点:长程会话的 token 成本;这是系统层优化,不改变模型能力本身。入口:NLP 栏 · arXiv 19
  • CoMem: Collective-Individual Memory Synergy for Evolutionary Multi-Agent Systems(arXiv:2609.15009,AI 栏·邻近跟踪):私有经验先沉淀,再由集体策展决定是否提升为共享记忆(需使用次数至少 3 次且奖励高于基线),检索走并行双流。MacNet 框架上 ALFWorld 79.85→89.55、PDDL 60.78→70.19,跨框架平均 +8.02 与 +4.70。真正值得记的是反向发现:在 PDDL 环境里,DyLAN 框架下的 G-Memory 得 59.53、MetaGPT 得 52.80,都低于完全不用记忆的 67.78。连接点:共享记忆的污染与反效;投稿状态为已投 AAAI 2027(非录用),无方差与显著性检验。入口:AI 栏 · arXiv
  • Homeostatic Continual Learning(arXiv:2609.13771,AI 栏·邻近跟踪):主张用结果异常值反查数据流中的共现异常,把它们当作新特征,再学模型与策略,以应对环境漂移。必须说明的是:这篇没有基准、没有基线、没有指标,全文未报告任何实验数字,只有一个自设的排队示例,作者自己还列了 5 项待完成工作。连接点:环境漂移下记忆与模型的更新思路;不可当作实验结果引用。入口:AI 栏 · arXiv

TTS 生成与评估:无参考分数到底能不能当评估器和奖励

本批语音与音频栏目 30 篇论文里,有七篇直接落在 TTS 生成与评估这条线上,它们合起来指向同一个问题:当合成语音已经足够干净,我们手里那些自动打分器还剩下多少分辨力;以及把它们直接优化成奖励时,会发生什么。

1. The Limits of Reference-Free Speech Quality Metrics as Evaluators and Rewards on Modern Text-to-Speech(arXiv:2609.13150,直接命中·音频栏)

  • 研究问题:UTMOS、DNSMOS、SCOREQ 这类无参考质量预测器同时被当作 TTS 的自动评估器和偏好优化奖励。当两段音频都变干净之后,它们打分更高的那一段,还是听者更偏好的那一段吗?
  • 改动位置(维度):TTS 评估协议与后训练奖励设计;对无参考指标效度的审计。
  • 核心方法机制
    • 把评估重写成「同文本、跨系统」的成对偏好判定:预测器给哪一段分高,就判它偏好哪一段,报成对准确率(随机水平 0.5),另在可得处报 clip 级 Spearman。
    • 被测信号合计 64 个特征:13 个无参考预测器家族展开出的 33 个分数变体、13 个韵律描述子、18 个经典信号描述子;全部音频先归一到 −23 LUFS。
    • 用「个体听者与多数派一致的比例」定义人类可靠性上限,让预测器有一个可比的参照,而不是和 1.0 比。
    • 另做 500 条干净 clip 的受控干预,以及对 6 个语料的正则化线性头域内校准(严格折外评估)。
    • 奖励侧:策略是一个 0.6B 的语音编解码语言模型,按 12.5 Hz 的帧率输出声学 token,用 GSPO 优化 300 步、G=16、不加 KL 惩罚,分别用单一预测器和等权复合(WER + Distill-MOS + UTMOSv2)当奖励。
  • 关键定量结果(含比较对象与口径)
    • 质量梯度上一路塌陷。在伪影与录音缺陷密集的 BVCC 上,SCOREQ 成对准确率 0.909、UTMOSv2 0.899,已接近该语料的人类上限 0.887;换到 4 个商业系统构成的干净语料 TTS-HP,最好的单指标 UTMOSv2 只有 0.528,而该语料人类上限是 0.764 20
    • 内容无关的基线几乎打平。「永远选更长的那段 clip」在 TTS-HP 上拿到 0.524,与最强的单一预测器 0.528 基本持平;SQUIM-PESQ 在该语料上是 0.470,即系统性地偏好人类评分更低的一段(p=0.002)。
    • 听者自己也分裂。把 TTS-HP 每对的 15 名标注者随机对半分,两个半数的多数派只有 0.53 的一致率(随机水平 0.5),BVCC 上同一数字是 0.81——干净音频上的排序本身就很浅。
    • 域内校准能把最好的单指标抬高 1.5% 到 6.6%:SOMOS 0.670→0.714、TTS-Arena 0.575→0.611、TTS-HP 0.513→0.523,代价是每个语料要消耗最多 20% 的偏好标注。
    • 奖励侧是最直接的警告:用 SCOREQ 当奖励,它自己接近最优,而作为独立裁判、并不在奖励里的 UTMOS-v1(满分 5)从 4.51 掉到 1.26、人评 Elo 从 2098±101 掉到 1675±115;等权复合奖励把两个独立裁判守回 4.56 与 2125±95,均在基线区间内。
  • 证据强弱与复现边界:证据结构清晰——bootstrap 95% 区间(TTS-HP n=2666,约 ±0.02)、按来源分组的折外划分、留一语料迁移测试、500 条 clip 的受控干预,以及一次 30 名评分者、300 次比较的自建听测,还用观测数据说明「孤立的小 p 值只作描述性证据」。边界同样明确:奖励实验每种奖励只跑一次,没有重复次数、种子方差或显著性检验;语料只有 6 个且自述偏英语;TTS-HP 只含 4 个商业系统、18 个声音。作者把结论定位成「现实配方下可被利用的存在性证明」,不是普遍规律。
  • 对目标研究线的连接点:直接命中 TTS 评估与奖励设计。它给出的可操作结论是「换一个更好的单一分数解决不了问题,要换成域内校准的复合打分」;同时提醒任何以自动 MOS 作为发布门禁的流程,都要先报出该语料上的人类上限。
  • 结论与阅读建议:建议精读(优先级 1)。做 TTS 后训练奖励、语音质量门禁和评测集设计的人应当先读这一篇。
  • 入口:音频栏 · arXiv

2. Tone on a Budget: A Reference-Free Metric for Lexical Tone in Massively Multilingual Text-to-Speech(arXiv:2609.14817,直接命中·NLP 栏)

  • 研究问题:对有声调的语言,能不能做出一个既不需要参考录音、也不需要声调标注语料的声调度量,并用它量化「几小时干净音频」对 TTS 的真实收益。
  • 改动位置(维度):TTS 评估指标(声调轴)与训练数据预算核算。
  • 核心方法机制
    • 度量的标准答案来自输入文本的变音符号:锐音符→高调、重音符→低调、长音符→中调、无符号元音→中调;强制对齐只用剥离声调符号后的字符级 CTC,永远只提供时间窗、不提供标签。
    • 音高用一次 F0 跟踪得到;用 Theil–Sen 斜率减掉整体降调趋势,再以每句自身中位数做调域锚定,最后按两个阈值分档。阈值只在一次标定中确定后冻结,测试划分与标定划分按转写哈希做句子级不重合。
    • 输出不是一个数而是两个:balanced tone accuracy 与 coverage,弃权不与「判成中调」混算。
    • 用同一配方在一个大规模多语零样本 TTS 基座上做 0 / 1 / 5 / 15 / 28.5 小时预算的约鲁巴语微调,并用 27 条与训练材料不重合的探针测三条轴:字错率、声调度量、说话人相似度。
  • 关键定量结果(含比较对象与口径)
    • 度量本身的不动点不在 1.0。冻结阈值在不重合测试划分上是 0.580,同划分的标签置换控制 0.334;300 条原生录音、37 位说话人构成的原生锚点为 0.596(95% CI 0.578–0.614),也就是说合成语音该被拿来和 0.596 比,而不是和满分比。
    • 它测的确实是声调:用 PSOLA 逐级压平声调,度量从 0.543 单调掉到 0.333(等于随机),同一批音频的字错率从 0.084 只变到 0.110,基本看不见 21
    • 盲听支持方向:3 名母语听者在 67 个盲听 A/B 里 89.6% 选对声调正确的一段(Wilson 95% CI 80.0–94.8,p<10⁻⁴)。
    • 但度量与听者的逐次对应没有建立:DunDun 的每对 margin 相对人类正确性的 AUROC 是 0.612(95% CI 0.343–0.879,区间含 0.5),point-biserial 相关 0.152(CI 含 0)。作者把这一项当作未解决的负结果原样报出。
    • 预算扫描给出的真实收益分布:声调度量 0 小时 0.5674±0.0197 → 5 小时 0.628±0.014 → 15 小时 0.676±0.056(5 与 15 小时的训练种子区间重叠),字错率 0.0562 → 0.018(5 小时)→ 0.021(15 小时),说话人相似度全程 0.81–0.84 不动。换算到「随机→原生锚点」区间,0 小时就已经覆盖 0.89,微调买到的声调增益大部分落在锚点之上、这个轴分辨不出来。
  • 证据强弱与复现边界:报告纪律在同批里是最好的一档——5 个解码种子与 3 个训练种子分开报并明确两类误差棒不能相减,多处给出 95% 区间、置换控制、答案键翻转 oracle,盲听带 catch 门槛,还标出「无度量的斯瓦希里语对照不作为证据」。边界同样明确:只有 3 名听者(其中两人满分通过 catch);探针仅 27 条 utterance,作者自己算出条目抽样半宽约 ±0.063,约为该指标可用区间的四分之一;论文声称发布度量与协议,但全文没有任何可点击链接,代码与权重目前取不到。
  • 对目标研究线的连接点:直接命中 TTS 评估。它示范了两件事:对声调语言,字错率结构性看不见声调,必须另设轴;任何评估指标都要把 accuracy 与 coverage 并列,并用原生锚点而不是满分做上限。
  • 结论与阅读建议:建议精读(优先级 1)。做多语 TTS、低资源语言数据预算或语音评估指标的团队适用。
  • 入口:NLP 栏 · arXiv

3. Cross-Lingual F5-TTS 2: A Simplified Framework for Language-Agnostic Voice Cloning(arXiv:2609.15184,直接命中·音频栏)

  • 研究问题:跨语言零样本克隆通常依赖强制对齐切分和音频提示转写两道数据准备工序,能不能把这两道工序同时去掉而不丢掉说话人相似度。
  • 改动位置(维度):TTS 生成流程;训练数据构造与时长预测鲁棒性。
  • 核心方法机制
    • 预训练模型自造的提示替代真实提示:对每条真实训练样本,用同一个预训练模型合成一段同说话人的语音当声学条件,真实语音当被预测目标,于是训练对不再需要对真实语音做强制对齐。
    • 缺失的提示转写用可学习占位 token 加结束标记补上,占位数量由提示与目标时长之比决定,保持预训练时「提示在前、目标在后」的布局。
    • 给时长/语速预测器加静音感知增强:70% 提示原样,另有 10% 在前、10% 在后、10% 在两侧插入原提示时长 30%–70% 的静音,标签不变。
    • 骨干沿用 F5-TTS-Base 的 22 层、16 头、1024 维扩散 Transformer,训练语料为约 9.5 万小时的中英语音。
  • 关键定量结果(含比较对象与口径)
    • 说话人相似度在三个语内测试集上都是本文最高:LibriSpeech-PC test-clean 0.687、Seed-TTS test-en 0.683、test-zh 0.768(对比基线 F5-TTS 的 0.668 / 0.676 / 0.762)22
    • 代价是自然度:UTMOS 与 CMOS 在三个集合上都略低于两个基线,字错率只在 LibriSpeech-PC test-clean 最低(2.014),在 Seed-TTS 的 en/zh 上分别是 1.629 与 1.594,高于 F5-TTS 的 1.545 与 1.475。
    • 文本条件消融说明占位设计不是细节:提示转写完全留空时,Seed-TTS test-en 的字错率是 7.116,换成可学习占位加结束标记后降到 1.629。
    • 静音增强的效果很集中:提示两侧带静音时,原语速预测器的时长相对误差是 70.211% / 70.984% / 85.491%,加增强后降到 13.154% / 15.364% / 18.933%;同一模型只换时长来源,带静音提示下的字错率也从 3.463 / 3.241 / 4.006 降到 2.454 / 1.919 / 1.738。
    • 跨语言:8 个训练分布之外的提示语言 × 中英两个目标语言共 16 个子集,说话人相似度在 14 个子集上更高,同时 UTMOS 普遍低于上一代跨语言版本,自然度代价是一贯的。
  • 证据强弱与复现边界:消融干净——文本条件与数据规模两组都在同一模型、同一训练步数下做,静音实验做到「同一模型只换时长来源」,客观指标全部用第三方预训练模型。缺口在于所有设置都是单次运行,没有重复次数、种子方差、置信区间或显著性检验;主观听测只说每个测试集随机抽 15 条,未报听者人数与协议,因此 SMOS 与 CMOS 无法复核。代码与权重可通过作者项目页取得,是目前本批少数可复现的语音生成工作。
  • 对目标研究线的连接点:直接命中 TTS 生成。对播客生成只有一个句级接口:播客素材切片普遍带首尾静音,这套静音感知时长预测能把这类提示造成的时长膨胀压回干净提示水平,可以用在素材预处理的鲁棒性环节上——原文没有任何分钟级节目、多说话人轮换或节目级评测证据。
  • 结论与阅读建议:建议精读(优先级 1)。做跨语言克隆、语音数据准备流水线的团队适用。
  • 入口:音频栏 · arXiv

4. StepAudio 3 Realtime Technical Report(arXiv:2609.14005,直接命中·音频栏)

  • 研究问题:在实时口语交互里同时拿到深度推理、低延迟和自然的轮次转换。
  • 改动位置(维度):语音生成与实时交互系统;推理与延迟的调度。
  • 核心方法机制:约 196B 总参数、11B 激活参数的混合专家架构,语言骨干基于 Step 3.7 Flash,音频前端取 Qwen3-Omni 的音频 Transformer 编码器;核心是「边说边想」——同一次音频模型的两个并发调用分别充当表述脑与发声脑,默认先说后想,配播放感知调度;另有自适应思考(决定该轮是否显式推理)与多 token 预测头(MTP3/MTP5)做推理加速。
  • 关键定量结果(含比较对象与口径)
    • 识别端最强项:LibriSpeech test-clean 1.18 词错率(对比 Doubao 2.0 ASR 2.94、Seed 2.0 Lite 1.47)、AISHELL-1 0.49 字错率 23;WenetSpeech test-meeting 4.35 落后于 HY3.0 的 4.12。
    • 全双工 Artificial Analysis 子集总体 98.9(对比 GPT-realtime-2 High 95.3、Qwen Audio 3.0 Realtime Plus 98.4),其中轮次接管 100.0、打断处理 99.0。
    • 多 token 预测带来 1.76×–2.05× 的墙钟加速,但原文同时给出代价:该配置下指令遵循分下降;边际接受率从第一个预测头的 65.0% 掉到第四、五头的 10.7% 与 5.7%。
    • 任务型与自建对话基准并没有全面领先:τ-Voice 56.0%,低于 Grok Voice Think Fast 2.0 High 的 56.5%;自建 StepAudioChat 实时模式宏平均 70.41,低于 Kimi K3 的 77.1。
  • 证据强弱与复现边界:基线用相同测试音频与打分流程重跑,τ-Voice 有条件时对三次试验取平均,自建基准每题带有效/缺陷成对对照。但全文没有人工听测,语音自然度与交互体验没有听者证据;没有重复次数、方差或显著性检验;训练数据规模与语种清单未报告;自建基准由同一团队造题并判分,存在自评风险。代码、权重与数据均未提供,项目页抓到的可读内容只有演示视频。
  • 对目标研究线的连接点:本批最能体现「推理与延迟如何取舍」的实时语音系统报告,与播客生成只有间接关系。它评测的全部是交互类与任务类基准,没有长篇内容生成、脚本化多说话人节目或节目级评测,因此对播客节目级结论不支撑
  • 结论与阅读建议:建议扫读(优先级 2)。做实时语音交互、语音 agent 延迟预算的团队读方法与分轴评测设计即可。
  • 入口:音频栏 · arXiv

5. The VoiceMOS Challenge 2026: Evaluating Speech Enhancement, Emotional TTS and Accented TTS Systems(arXiv:2609.13792,直接命中·音频栏)

  • 研究问题:第五届 VoiceMOS 挑战赛在语音增强、情感 TTS、带口音 TTS 三个赛道上,参赛系统相对官方基线表现如何。
  • 改动位置(维度):TTS/语音评估的公开赛道体系与自动 MOS 预测。
  • 核心方法机制:三赛道各自配官方开源基线——语音增强用统一非侵入式质量模型,情感 TTS 用 UTMOS 加一个通用大模型裁判并配情感分类模型,口音赛道用预训练说话人嵌入与在训练集上微调的同架构模型两条基线;指标统一为 utterance 级 Spearman 秩相关,评测划分在说话人与源话语上都不相交。
  • 关键定量结果(含比较对象与口径)
    • 共 18 支唯一队伍完成最终提交,三个赛道分别是 4 / 8 / 7 份(其中一支队同时参加两个赛道,提交总数为 19)。
    • 语音增强赛道全部超过基线,最佳 ACR 秩相关 0.779,最佳 CCR 只有 0.487——成对比较明显比单样本打分难 24
    • 情感 TTS 赛道最佳 QMOS 0.785、最佳 EMOS 0.758(QMOS 评自然度与整体质量,EMOS 评与目标情感的匹配程度),情感并不比自然度难;唤醒度最易预测,中性情感反而对多数队伍更难。
    • 口音赛道多数队伍同时超过两条基线,最佳队伍在说话人相似度与口音相似度上都是第一(原文只在图中呈现,正文未给数值)。
  • 证据强弱与复现边界:赛道设计可复用——开发/测试严格不相交、每样本固定评分人数(8 / 4–9 / 4.9)、基线与权重开源、对不完整提交标注缺失样本数。但每队只提交一次,没有重复次数、方差或置信区间;口音赛道的分数只在图里,正文无法逐条引用;18 支队伍分布在三个赛道,跨队差距缺统计支撑。
  • 对目标研究线的连接点:直接命中 TTS 评估的组织形式。原文把「长音频或全双工对话评测」明确列为尚未覆盖的未来方向,这正好解释了本频道的播客专项缺口为什么至今是零。
  • 结论与阅读建议:建议扫读(优先级 2)。需要搭内部主观听测协议或选自动 MOS 模型的团队适用。
  • 入口:音频栏 · arXiv

6. 生成侧的另外两篇可扫读工作

  • DiTAR+: Dual Optimization for Robust Autoregressive Diffusion Speech Synthesis(arXiv:2609.13909,音频栏·直接命中):针对自回归扩散语音合成的解码不稳定,做两处配套改动——用局部窗口加膨胀步长构造稀疏的远距离上下文,以及在扩散骨干的前若干层屏蔽声学前文的注意力。中文困难集词错率 12.478%→9.893%;25–35 秒长句的说话人相似度 0.741→0.759、词错率 2.778%→2.173%,正是自回归合成最容易崩长句的地方;主观评测由 10 名评测员完成并设了对照。需要如实说明的取舍是:论文自报的质量分 3.82 略低于自身基线的 3.88。未报告参数量、无方差与显著性、无代码链接。入口:音频栏 · arXiv 25
  • CAL-MOS: Bridging Layers with Adapters for Robust MOS Prediction Across Speech Foundation Models(arXiv:2609.14956,音频栏·直接命中):在 10 个语音基础模型 × 4 个 MOS 数据集上系统检验「取哪一层做 MOS 预测」,结论是最佳层强依赖骨干与数据集,朴素的层加权融合并不稳定;改成给每一层加轻量适配器再做平均池化后,在 utterance 层平均 0.388 与 0.749、system 层 0.052 与 0.932,作者原本谨慎表述为「缩小与完全微调的差距」,但表中该配置在两个骨干的平均指标上已经优于完全微调。数据集规模与语言、重复次数、方差全部未报告。入口:音频栏 · arXiv

播客生成与评估:本批的缺口审计与可迁移接口

先给结论:本批三个栏目 309 篇论文中,没有任何一篇以「端到端全自动播客节目制作」或节目级播客评估为核心研究问题。 没有节目级基准,没有多说话人长音频的连贯性指标,也没有话题编排与轮换的评测协议。原因是可查的:本批唯一涉及长音频的公开赛道报告把「长音频或全双工对话评测」明确写成了尚未覆盖的未来方向;而语音生成方向的直接命中全部停留在句子级、同文本跨系统的成对比较上。
在这个前提下,本批能提供的只有组件级接口。以下五篇都属于邻近跟踪,每一篇已经注明它能迁移到哪一层、以及哪一层它明确不支撑。
  • Causal Analysis and Mitigation of Spurious Onsets in Full-Duplex Speech LLMs(arXiv:2609.13445,NLP 栏):把「全双工模型在对方完全没说话时抢着开口」这一现象量化到机制层——5 分钟数字静音输入下,两个模型分别出现 12/40 与 11/40 次自发开口,累积发生率 30.0% 与 27.5%(95% CI 16.6–46.5%);更关键的是开口概率在一帧之内跃升超过 9 个数量级(一帧约 80 毫秒),说明它不是小概率事件累积,而是可以定位的决策突变。用因果反事实的分布散度作阈值,在留出种子上抑制了 13/13 与 9/9,同时保留全部 40/40 的真实响应,95 分位决策耗时 45.60 与 60.61 ms,落在 80 ms 的帧预算内,且无需重训。对播客/对话节目的可迁移接口是「双人对话的沉默段处理」;但它只覆盖两个模型,长对话中的累积效应没有评估,节目级结论不支撑。入口:NLP 栏 · arXiv
  • Enabling Streaming User Transcription in Full-Duplex Speech-to-Speech Models(arXiv:2609.15759,NLP 栏):在全双工语音到语音模型上并行挂一个轻量转写头,让对话的同时产出流式文稿:双工内平均词错率 10.21%,独立流式 7.73%。代价必须成对引用——平滑轮次接管延迟从 257 ms 升到 477 ms,用户打断后的接管率从 100% 降到 94%;反直觉的是,加上转写头之后一个通用知识问答基准的分数反而从 66.59 升到 69.01。栏目摘要称该工作「并开源代码」,实际原文只有将来时的开源表述,全文没有仓库链接。可迁移接口是「边对话边出稿」;对播客节目级结论不支撑。入口:NLP 栏 · arXiv
  • Grounded in Sound: Reinforcement Learning with a Frozen Acoustic Judge to Curb ASR Insertion Hallucinations(arXiv:2609.14455,音频栏):用一个 0.3B 的冻结字符级声学判分器给 7B 模型的强化学习奖励加锚,抑制「音频里没说的话被写出来」。AMI-IHM 子集插入错误减少 28.3%、AMI-SDM 减少 22.3%;但只有 AMI-SDM 的词错率显著下降(35.89%→34.71%),另一子集的 −0.42 置信区间包含 0。报告的严谨度值得学:三种子、会议级簇 bootstrap、四项预指定分析。可迁移接口是「把声学证据锚进奖励」,这正是播客自动转写与文稿生成环节需要的;节目级结论不支撑。入口:音频栏 · arXiv
  • Quantifying the Generation Modality Gap in Speech-Text Language Models(arXiv:2609.14743,NLP 栏):在匹配数据与匹配生成设置的条件下比较纯语音、纯文本与语音-文本三种配置(270M 到 456M 参数):加入文本后语义连贯性大幅改善,语境困惑度从纯语音的 228.8 降到 49.9;但说话人相似度从 0.70 降到 0.62、自动 MOS 从 3.41 降到 3.09,音素指标几乎不变。也就是说,语义与音色在联合建模里是此消彼长的,节目级系统如果同时要求「内容连贯」和「音色一致」,必须把这两条轴分开设计、分开评估。原文无人类听测、每配置单一种子,属部分支撑:它支撑「长音频语义连贯性怎么度量」与「语义对音色的取舍」,不支撑节目级结论。入口:NLP 栏 · arXiv
  • -Elicitation: Benchmarking multi-turn entity extraction in voice agents(arXiv:2609.13602,AI 栏):语音智能体在「多轮问出准确信息」这件事上的表现远低于直觉——200 个任务、10 类实体、3 个环境下,四个语音配置的稳健精确成功率只有 0.14–0.41;加脚手架能把「连续三次运行全部成功」的比例提升 14–31 个百分点,但每次通话多花 21–28 秒,而且核验后的错误只有 24–37% 被真正修复。实体库之间的难度差得很大,「连续三次运行全部成功」的比例从 0.02(药品)到 0.60(日期);一次只能收集一个字段时通过率 0.75,三个字段时降到 0.53。它做了 10,000 次任务级自举、100,000 次符号置换与 Holm 校正,统计上是本批音频相关工作里最讲究的一档。可迁移接口是「语音交互的任务级评测协议」;原文自述每个主环境只跑一次、且有意省略呼叫方识别环节,因此节目级结论不支撑。入口:AI 栏 · arXiv
把五篇放在一起,能看清节目级系统还缺什么:沉默与打断的机制问题已经有可复现的解法,转写与文稿已经能与对话并行,语义连贯性已经能度量;缺的是把分钟级编排、多说话人一致性、话题推进与节目级听感凑成一条闭环的公开基准——本期横向对比也印证,语音评估的公开赛道仍然只做到句子级。

机制地图与同维度横向对比

同一批论文里,有若干组工作在回答同一个问题却给出了不同的答案。下面三组对照把它们的差异摆在一起,方便按自己的场景选。

长程评估:三种让分数失真的机制,各自有解

失真机制代表工作关键数字对应的修法
只看终态,错误步骤不可见,且终态分数饱和DynSTEER · 2609.14637终态验证下 22.63% 的运行拿满分;阶段化后模型对可分性 6/6(p<0.01),错误定位与专家一致率 91.7%,终态验证器定位中间错误为 0用公开任务视图编译里程碑图,把阶段分与终态分并行报告
出题方的策略有歧义,失败被记成能力不足Policy Loopholes · 2609.1440017 处漏洞、7/50 航空题受影响;受害题 37% 对无漏洞题 51%;跨次方差 1.62 倍在收集标注前审计策略文本,把漏洞从评测集里剔出去或改写
单次运行掩盖动作层的不稳定Same Patient, Different Order · 2609.1358243/43 组医嘱集合逐次不同,而 22/43 组判定完全不变;首轮即分歧最高达 50/50重复运行并报告动作级一致性,不只报通过率
多轮约束随轮次衰减到零MTAC-IFBench · 2609.14992总量满足率 60.6–80.4,增量满足率仅 1.1–12.7,多数模型第 6 轮后归零把「增量约束满足率」设为独立验收指标
四者并不互斥:一个可信的长程评测需要同时报阶段分、策略审计结论、重复一致性与轮次衰减曲线。上表四篇都没有公开代码;本批提供公开代码仓库的是另一条线上的 When Agents Slow Down(arXiv:2609.15309),它衡量的算力边际收益与上面四类的失真不是同一层问题,但拐点方法可以直接用来校准预算。

自进化:改的层次越窄,结果越稳

改什么代表工作冻结了什么关键数字
harness 的五个模块ModularRSI · 2609.14857模型权重平均成功率 47.57→52.43;非模块化 46.44、五模块联合 44.19 均低于基线;跨域冻结迁移 73.40→75.80
探索策略的代码Dream-RSI · 2609.14858模型、评测器、执行接口零梯度步;调用 550→317,运行时间 3587.1→2931.0 ms
记忆与探索调度RSIAgent · 2609.15364模型参数、agent harnessOSWorld 2.0 平均 71.97→78.98;完整版 74.54% > 只先广 65.52% > 只后深 56.50%
搜索控制权与经验组织AlgoEvo · 2609.15820模型参数、奖励定义、评测入口TSP 用 39 次评估把目标值降到 5.986 / 7.007,而四个对比方法吃满 500 次预算后最好也只到 6.309 / 7.337
四者的共同点是窄改动 + 强验证:ModularRSI 用三道自动门做回滚,Dream-RSI 的策略选择保证回放分不劣于旧策略,RSIAgent 把本地验证与官方评测彻底隔离,AlgoEvo 只在至少两个任务经验一致时才把模式写回技能库。反过来说,本批没有一篇能证明「整体重写优于局部修补」;ModularRSI 的联合演化结果(44.19,低于基线)与 AlgoEvo 多组件任务用掉 271–275 次评估(接近上限)都指向同一个方向。

语音评估:单一分数正在被拆成多维校准

做法代表工作关键数字代价
继续用单一无参考预测器干净语料上最佳单指标 0.528,人类上限 0.764,时长基线 0.524与随机猜测差别不大;而且把它当奖励时,优化过程会把分数刷高而不改善真实质量
域内校准的复合打分The Limits of Reference-Free Speech Quality Metrics · 2609.13150相对最佳单指标 +1.5%~+6.6%;当奖励时把独立裁判与人评守在基线区间内每个语料要消耗最多 20% 的偏好标注
按语言另设轴Tone on a Budget · 2609.14817声调压平时度量 0.543→0.333,而字错率 0.084→0.110 不动需要可靠标调的正字法;只验证了一种语言
公开赛道 + 多维听测VoiceMOS Challenge 2026 · 2609.13792单样本打分最佳 0.779,成对比较最佳只有 0.487赛道仍只到句子级,长音频未覆盖
换骨干时重做层选择CAL-MOS · 2609.14956最佳层强依赖骨干与数据集;逐层适配器加平均池化后在两个骨干上已优于完全微调数据集规模与语言未报告
一句话总结这批语音评估的共识:没有一个可以「装上去就不用管」的分数。评估者要报出自己语料上的人类上限,奖励设计要用复合项,声调这类语言属性要单独设轴,换骨干要重新校准。

全量覆盖审计与数据缺口备忘

1. 三栏目 309 篇论文的全量覆盖审计

本期候选池只来自微信公众号「arXiv 每日学术速递」2026 年 9 月 15 日批次的三个允许栏目,逐条过筛后的结构如下。
  • 人工智能学术速递(147 篇):智能体、规划与决策 33;自然语言与多模态智能 46;其他/综合 AI 38;多智能体与博弈 8;知识表示、推理与符号 AI 5;可信、安全与 AI 治理 5;评测、基准与数据集 5;机器学习与表示学习 4;AI 应用与系统 3。
  • 自然语言处理学术速递(132 篇):大语言模型与基础模型 73;其他/综合 NLP 23;信息抽取、检索与问答 8;语音语言联合与音频文本 7;机器翻译与跨语言处理 6;评测、数据集与基准 4;多模态语言处理 4;文本生成、摘要与编辑 3;安全、隐私、公平与可解释 NLP 2;对话系统与智能体 1;语义、语法与语言学分析 1。
  • 语音与音频学术速递(30 篇):其他/综合语音音频 12;语音合成与声音生成 5;数据集、基准与评测 3;语音识别与关键词检测 2;音频事件检测与场景理解 2;音乐信息检索与音乐生成 2;语音翻译与语音语言模型 2;安全、隐私与深度伪造音频 2。
三个栏目合计 309 篇,本期收录 45 篇:直接命中 30 篇、邻近跟踪 15 篇。逐篇查重在本期发布前对全部收录篇目与频道历史已发内容交叉检索,零重复。
需要说明的是,本期长程智能体方向的收口集中在「评测效度与执行可靠性」这一层,并非因为其他方向没有论文:大语言模型与基础模型栏目 73 篇里,绝大多数是提示压缩、领域适配、摘要与幻觉检测类工作,与「长程任务」这一限定没有直接关系;同理,无人车、医学影像、EEG、基因组等方向的论文虽在三个栏目内,但不落在四条目标线上,按栏目定位不予收录。

2. 播客生成与评估:专项缺口备忘

  • 直接命中为零:本批三个栏目的 309 篇候选论文中,没有任何一篇以端到端单篇「全自动播客节目制作与评估」作为核心研究任务,也没有出现针对长音频播客的话题轮换、跨说话人连贯性或节目级听感的专属评测基准。
  • 可迁移的是组件,不是节目:本期用于说明底层接口的五篇工作(全双工静音自发开口的因果抑制、语音到语音并行流式转写头、声学判分器锚定的识别奖励、语音与文本联合建模的语义-音色取舍、语音智能体多轮实体收集基准)全部是句级或交互级证据,正文已逐篇标注「节目级结论不支撑」。
  • 公开赛道自己划清了边界:本期语音评估的公开赛道报告把「长音频或全双工对话评测」明确列为尚未覆盖的未来方向,这与本频道连续多期记录的缺口一致。

3. 代码开源、复现条件与跨源口径披露

为方便研发团队判断复现成本,本期收录论文的资源状态与跨源差异汇总如下。
  • 已开放且经核验可取:ModularRSI(作者代码仓库,含生成物与演化脚本)、RSIAgent(代码仓库为 Apache-2.0 许可,项目页另提供消融数据下载)、Cross-Lingual F5-TTS 2(作者项目页给出代码仓库与权重)、When Agents Slow Down(作者代码仓库已公开,原始 trial 数据原文称将另行发布)、VoiceMOS Challenge 2026(官方基线仓库与两个公开权重)。
  • 明确仍在准备中:Dream-RSI 的仓库可访问,但完整代码与复现脚本在发布计划中标注为「准备中」。
  • 声明已发布、本次核验取不到:Same Patient, Different Order 与 Asclepius 两篇声明的代码仓库在核验时均返回 404;Tone on a Budget 声明发布度量、冻结标定与验证协议,但全文没有任何可点击链接。
  • 仅承诺、尚未发布:Do Not Restart、Enabling Streaming User Transcription 均用将来时表述开源,目前无入口。
  • 跨源口径与署名差异(均已按 arXiv 原文更正后写入正文):
    • 机构类:2609.13672 栏目把机构统一写成北京信息科技大学,原文首位通讯作者标注为独立研究者;2609.15397 栏目所写机构与原文第二作者的独立研究者身份不符;2609.14858 栏目漏列作者官方渠道给出的 Google 与 Google DeepMind;2609.15820 栏目漏列华为诺亚方舟实验室;2609.14817 栏目漏列第三位独立研究者;2609.15309 栏目未列原文的四家机构;2609.14005 栏目机构栏留空,原文署名为 StepFun-Audio Team;2609.15818 栏目作者名单被截断且机构栏留空。
    • 结论类:2609.15309 栏目的「显著提升」没有原文统计支撑(原文只用自举区间,并明确报告了不可区分的情形);2609.15818 栏目的「16 个基准中表现领先」对照原文应为 5 项最高、3 项第二、其余 8 项明显落后;2609.14005 栏目的「多个基准取得领先」对应八项中的四项;2609.15066 栏目的「超越专有基线」只在其中一个基线成立;2609.14455 栏目把 28.3% 与「降低词错率」并列,实际词错率只在其中一个子集显著下降;2609.14817 栏目称「验证其有效性」而未提原文自报的负结果;2609.13437 栏目的「每领域第一」只在均值层面成立。
    • 收录状态类:2609.14400 原件标注已收录 REALM EMNLP 2026、2609.14399 标注已收录 PRICAI 2026、2609.13543 标注 EMNLP 2026 Findings、2609.15009 标注为投稿 AAAI 2027(非录用),栏目摘要均未提及,本篇按原文标注。
    • 标题类:2609.13667 的 arXiv 原题在「For」与「Geospatial」之间缺少空格,本篇按可读写法排印,其余标题逐字取自原文。

4. 本期未解决的问题

  • 本批没有任何一篇工作把「自进化」与「成本核算」放在同一张表里给出可比的单位成本;ModularRSI、Dream-RSI、AlgoEvo 用的都是各自的计费口径(轮数、调用数、token 数),跨方法不可直接比较。
  • 语音评估侧的公开赛道仍然只到句子级,且本批没有出现把长音频纳入评估的尝试;跨语言声调度量只在一个语言上验证,作者本人也把它列为未解决的边界。
  • 少量论文的代码状态在核验时无法确认真伪(仓库 404 或仅声明未发布),本期按「取不到」如实记录,未把它们计入可复现工作。

References

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
  15. 15
  16. 16
  17. 17
  18. 18
  19. 19
  20. 20
  21. 21
  22. 22
  23. 23
  24. 24
  25. 25

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel