
工具边界、证据回返与 TTS 文本对齐:9.2 论文雷达
聚焦 9 月 2 日三个允许栏目,按工具边界、记忆失效、自进化证据与 TTS 文本评测分层筛出 35 篇论文,并给出重点原文阅读顺序与研发验收检查项。
本批先看什么
本批候选来自微信公众号「arXiv 每日学术速递」在 2026 年 9 月 2 日发布的三个栏目:人工智能学术速递、自然语言处理学术速递、语音与音频学术速递。筛选标准有四个:是否直接落在长程智能体、轨迹学习、自进化、TTS 生成与评估;方法改动落在模型权重、harness/环境、技能或记忆、轨迹表示、评测协议中的哪一层;关键结果是否有可核对的指标;论文是否给出足够的复现边界。
本期收录 30 篇直接命中,以及 5 篇邻近但值得跟踪。语音与音频栏目本批没有 TTS 生成、TTS 评估、播客生成或播客评估的直接命中。
Ready to Speak 处理的是 TTS-friendly 文本,BiMTokenizer 是语音 codec,PIPDP 是生成器归因,MATCHA 是音乐属性评测;这些论文分别提供迁移线索,不能合并成“本批已有完整 TTS 或播客生成结果”。这批论文最清楚的共同问题是:长程系统的增益究竟来自哪里。模型权重改变、工具边界改变、环境状态改变、技能或记忆改变、轨迹奖励改变,以及仅仅换了一套评测协议,必须分开记账。下面的“直接命中”指论文的研究对象或方法本身落在频道目标线上;“邻近跟踪”指论文来自允许栏目,且连接点明确,但研究对象仍属于另一层。
阅读优先级
| 优先级 | 论文 | 主要改动位置 | 先核对什么 |
|---|---|---|---|
| 精读 | ARISE-RL | RL 训练、任务生成、经验记忆 | Generator/Solver 共进化后,frozen base、best checkpoint、final checkpoint 与 held-out 是否同时成立 |
| 精读 | Beneath the Diff | 自进化循环、编辑记忆、盲测 | in-loop 提升是否能穿过 semantic diversity 与 blind audit |
| 精读 | trajectory-judge | 轨迹评测 | 结果正确但路径错误的 silent fault 是否被发现 |
| 精读 | Making Prospective Memory SLM-Shaped | 前瞻性记忆的符号生命周期 | intent 的写入、触发、完成与失效是否由可验证状态机承担 |
| 精读 | Invalidation Contracts | 缓存/记忆协议、失效 | 记忆命中后,模型是否遵守版本戳和失效提示 |
| 精读 | Compile, Don't Memorize | 上下文 harness、类型化 IR | 规则编译带来的通过率是否覆盖编译失败和剩余总体低通过率 |
| 精读 | EM²Mem | 事件中心多模态记忆 | 事件合并错误、构建成本与 evidence recall 是否一起报告 |
| 精读 | Dense Process Supervision | 轨迹奖励、事实效用估计 | 中间事实的奖励是否真的改善 credit assignment,而非放大抽取错误 |
| 精读 | From Base Rollouts to RL Reasoning | 采样预算与 RL 行为诊断 | RL 增益有多少只是更高效地搜索已有能力 |
| 精读 | Ready to Speak | TTS-friendly 文本偏好对齐 | 文本端启发式分数与 TTS→ASR、听测之间是否保持一致 |
| 精读 | OpenAgentFlow | 运行时安全边界 | action-commit 前的拦截、provenance 和 trace 是否构成完整控制面 |
| 精读 | ClinTraceBench | 纵向状态、来源追踪、成本 | 历史压缩损失能否在播客或语音场景复现 |
优先级基于四个可检查维度:直接相关性、机制新颖性、证据密度和对研发验收的影响。它表示原文阅读顺序,不表示论文质量的最终排名。
一、状态、记忆与长程可靠性
长程系统先要回答一个朴素问题:模型在第 60 轮看到的状态,还是第 1 轮留下的那个状态吗?这一组论文把状态保持、记忆路由、缓存失效、事件锚定和来源追踪拆开了。
1. Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls
- 作者/时间:Dheeraj Mohandas Pai、Lu Xian;arXiv v1 于 2026-08-02 提交,公众号栏目于 2026-09-02 发布。作者将任务设计成 clean-room MD5 测试,而不是一般工具调用问答。1
- 问题与方法:测试 196 次相互依赖的工具调用、64 轮状态传递和四个 32-bit word,刻意隔离状态携带、算术处理与服务执行三类失败。模型需要持续维护中间状态,最后给出 MD5 结果。1
- 结果与证据:摘要报告 gpt-oss-120b 在 temperature 0 下多数完成运行得到正确结果;论文将“保留自身 reasoning context”和“让 thinking-enabled worker 投票”作为两个有用设置,但摘要没有给出它们各自的消融结果。完整运行次数、失败分布和置信区间也未报告,因此“多数”无法继续换算成成功率。1
- 局限与关系:这是诊断性、合成式的状态基准,能隔离长程记忆问题,尚未覆盖真实工具副作用、恢复成本和持久数据库。它适合做播客研究 agent 的“长轨状态保持”底线测试。
- 结论:精读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
2. Learning What to Retain: Gated-Memory Routing for Efficient Collaboration in Multi-Agent LLM Systems
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。2
- 问题与方法:Gated-Memory Routing 学习三个控制器:Memory Write Gate 只写入非冗余步骤,Retrieval Gate 提供紧凑相关子集,Adaptive Halting Controller 决定何时停止。改动位于记忆路由和多智能体协作 harness,模型权重并非唯一变量。2
- 结果与证据:五个 reasoning/code benchmark 上,平均准确率比最强 baseline 高 2.44 个百分点;HumanEval inference cost 相对论文所列 baseline 降低 31.9%。这里的 cost 单位以及 baseline 的逐项定义,当前摘要没有说明,不能把 31.9% 改写成 token、时延或货币节省。每个 benchmark 的分数、记忆写入错误率和不同随机种子的结果也未报告。2
- 局限与关系:准确率与成本结果支持“选择性保留”值得测试,尚未回答误删关键步骤、跨任务迁移和长时间运行后的记忆污染。对播客制作 agent,写入的对象应从“整段历史”改成可定位的事实、状态和动作记录。
- 结论:值得扫读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
3. Invalidation Contracts for Cross-Episode Agent Memory
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。3
- 问题与方法:论文给每个 API recovery suggestion 附 version stamp 与 cacheability hint,并分别记录 validity savings 和 planner compliance。它改的是记忆与缓存协议,研究重点是“记忆已经失效后,系统是否能知道”。3
- 结果与证据:约 9,400 个 episodes、7 个模型、3 条 serving path、2 个领域构成评测面板。row-level invalidation compliance 提升 0–66.7 个百分点;7 个模型中有 4 个把 token cost 降到论文 baseline 的 29%–33%,payload 相对无契约条件增加 15%。table-level post-drift recovery 的 first-attempt success rate 在 7 个模型中的 5 个为 0%。这些数字来自 arXiv 摘要与全文记录,完整任务表仍需回到原文核对。3
- 局限与关系:协议有效与 planner 遵守是两个变量。播客知识库需要同时保存节目版本、事实更新时间、可缓存范围和重新核验动作;只保存“相关片段”会把过期信息重新带回脚本。
- 结论:精读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
4. EM²Mem: Event-Centric Multimodal Memory for Large Language Models
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。4
- 问题与方法:EM²Mem 在建记忆时把 captions、frames、transcripts、summaries 和 graph facts 绑定到 event anchors。每个 event-indexed cell 同时保存时间上下文、关系、语义事实和 provenance,减少推理时重新拼接孤立模态片段的工作。4
- 结果与证据:EgoLifeQA、Ego-R1 Bench 和 Video-MME (L) 三个长视频 QA benchmark 上,相对最强 memory baseline 的平均准确率分别提升 2.0、2.4、3.7 个百分点;strict event-level Top-5 evidence recall 为 30.8%,比 WorldMM 高 7.0 个百分点。EgoLifeQA 的 Full overall 为 66.0;去掉 temporal-context views、semantic memory、episodic graph 后分别为 60.4、61.4、61.6。对齐构建的 6,057 条 30 秒记录、500 个问题相对四通道 RRF 的 R@1 提升 5.1、R@5 提升 3.4、300 秒 coverage 提升 5.4 个百分点,95% CI 为 [+2.6,+8.3],McNemar exact p=0.0003;QA 由 60.0 到 63.0,但 95% CI 为 [−0.8,+6.8]、p=0.1505。单查询延迟降低 4.67 倍,推理 token 降低 63.66%。5
- 局限与关系:构建阶段共 89.23M tokens,WorldMM 为 60.55M;论文使用 2 张 NVIDIA A100 40GB 和 8 个并发 worker,构建成本依赖跨查询摊销。事件切分或合并错误率、多 seed、长播客验证和域外泛化未充分报告;官方代码为 LightMem。播客迁移时应把事件、说话人、节目版本和证据链接作为一个可回放单元。6
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
5. Making Prospective Memory SLM-Shaped: Typed Intention Stores for Small-Model Agents
- 作者/时间:Jinqing Zhao、Chengcan Wu;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。7
- 问题与方法:PIS 把 deferred-intention lifecycle 写入 typed code,让模型负责有范围的语言工作,代码负责意图的存储、触发和状态变更。方法 training-free,也没有 selector fine-tuning 或 trajectory distillation。7
- 结果与证据:在 PM-Bench 上,DeepSeek-Chat 的 Set-F1 为 82.9%;Gemma-E2B 无 store 时为 4.2%,加入 7 个 retrospective memories 后最高 6.6%,PIS 达 66.2%。另一组设置中,PIS 为 70.1%,retrospective memory 最高为 54.4%。这些结果把前瞻性意图与回顾性记忆分开了,但摘要没有列每个任务的方差和完整错误类型。7
- 局限与关系:PIS 的优势来自可验证生命周期,不代表所有长期记忆都应移出模型。播客 agent 可以把“下期追踪某人某项声明”“某来源过期后重新核验”存成 typed intention,再让语言模型生成提醒文本。
- 结论:精读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
6. ClinTraceBench: Source-Verifiable Longitudinal Clinical Reasoning over EHR-Derived Dialogues
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。8
- 问题与方法:ClinTraceBench 包含 385 个 MIMIC-IV-derived verified dialogues、event-ID provenance 和 9-task taxonomy,使用 L0–L4 deterministic checks 加 L5 human audit;作者报告这套检查协议的 agreement 为 98.92%,这里的数字描述核验协议,不是模型准确率。论文比较 full context、retrieval、压缩、LLM summary、Mem0、A-Mem 等 8 种 history representation。8
- 结果与证据:6,271 个问题、32 个 cells(8 种 history representation × 4 个模型 backbone)、200,672 个 predictions 构成实验面板。压缩策略出现关系损失与多访视 aggregation tax,blind-to-full gap 为 29.8–62.7 个百分点;Haiku full-context 成本为 25.76 美元,Sonnet 为 106.21 美元。摘要没有给出每个任务的完整分数。8
- 局限与关系:临床衍生数据不能直接代表普通用户或音频。它提供的事件 ID、来源追踪和成本—能力 Pareto,适合迁移到长期嘉宾、主题和节目版本记忆。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
二、工具边界、执行协议与环境
记忆能否被正确读取,仍然不同于动作能否在正确时机发生。这一组论文把 action-commit、路由格式、动作类别、组件清理、真实时空环境和状态型评估拆开。
7. OpenAgentFlow: Enabling System-Wide Safety Boundaries for Heterogeneous AI Agent Fleets
- 作者/时间:南方科技大学等;arXiv v1 于 2026-08-14 提交,公众号栏目于 2026-09-02 发布。9
- 问题与方法:OpenAgentFlow 把 GUI、API、tool 和 LLM invocation 统一为 AgentEvent,在 action-commit 前由共享 Policy Enforcement Point 拦截。控制平面保存 provenance、session state、audit 和可更新策略,改动重心是运行时治理,而非单个 prompt。9
- 结果与证据:Android 300-case action-event benchmark 上 accuracy 为 94.0%,attack block 为 95.3%;动态策略 30 个 cases 中 27 个符合预期;100-case emulator 中 98 个 traced cases 的 raw accuracy 为 90.8%,trace-adjusted pass 为 92.9%。9
- 局限与关系:摘要没有给出攻击类型、策略更新成本和真实多租户部署条件。它适合做播客研究/发布 agent 的权限边界基线:读、写、发布、覆盖和删除应使用不同的提交门。
- 结论:精读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
8. Control-Data Flow Separation: Stable Prompt Optimization in Multi-Agent LLMs
- 作者/时间:Waterloo/Manulife 团队;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。10
- 问题与方法:论文把 execution-critical routing、format 和 termination 从可优化的语言 data flow 中拆出,改用 typed、validated program objects。提示优化器可以改语言内容,协议对象则负责保持执行边界。10
- 结果与证据:在 synthetic reasoning、collaborative review 和 insurance rating 三类任务上,作者报告 eventual protocol validity 达到 100%,并伴随任务表现提升。摘要没有给出逐任务分数、失败恢复成本和协议对象的人工维护成本。10
- 局限与关系:100% 指协议最终有效性,不能替换任务正确率、工具副作用和用户满意度。播客 pipeline 可以把章节结构、引用格式、版权禁区和发布状态从自由文本中抽成可校验对象。
- 结论:精读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
9. Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。11
- 问题与方法:论文把动作分成 TOOL_CALL、ASK、REFUSE、CONFIRM,并区分 action-class miscalibration 与 action-execution failure,提出
Acc ≤ GAR作为可见上界。评估对象从“答对没有”移到“是否选对了动作类别”。11 - 结果与证据:BFCL v3 multi-turn 面板与 τ²-bench cross-check 显示,aggregate accuracy 71.8% 的 xLAM 在 miss-param 场景的 Gold Action Recall 只有 19.5%;BFCL 中 Qwen3-8B、Qwen3-14B、gpt-oss-20b 和 xLAM-2-8b 的 miss-param GAR 分别为 84.0%、79.0%、76.0% 和 19.5%,xLAM 的 miss-func GAR 为 10.0%。200-case audit 中 gold-turn action rate 为 71/200,eventually action rate 为 88/200,grader-pass masking 为 26/200。Qwen3-8B 在 τ² retail 114 tasks 的 SRI 三 seed accuracy delta 为 +6.00±0.88 个百分点;retry 使 12 个 cell 中 11 个 trajectory accuracy 变差。12
- 局限与关系:文本工具调用结果尚未证明能直接迁移到语音输入。播客 agent 至少要分别评分检索、追问、拒答、确认和转人工,工具调用成功率无法覆盖动作时机错误。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
10. CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。13
- 问题与方法:CordisBench 包含 1,200 个问题,放在受控形式化环境和 Cordis runtime 中,要求模型判断依赖组件、teardown 顺序后的状态、全称/存在条件和可执行重配置。题目按 2、4、8、16、24、32 个相关交互测试 reasoning effort。13
- 结果与证据:交互增加后,final state 和跨 teardown order 的可靠性下降;中等 effort 下,GPT-5.6 Luna 在 16-interaction subset 每题接近 3,000 reasoning tokens。独立 finite reference semantics 与 Cordis runtime 在 528 个 executable questions 的 observation/action outcome 上全部一致;这个一致性是参考语义与运行时之间的比较。13
- 局限与关系:受控 runtime 提供了有限语义,真实 harness 的插件数量、异步事件和外部副作用仍未验证。播客 agent 修改转录器、切段器或发布插件时,应把依赖清理和回滚作为长程任务的一部分。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
11. Deploying and Evaluating a Smart-Agriculture Agentic Engine for Full-Season Soybean Farm Operations
- 作者/时间:synkrasis-labs;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。14
- 问题与方法:FAIRY 是部署在哈工大智慧农业基地的 full-stack agent system,用“everything is an event”统一传感器、遥感、作物状态、机械动作和干预,并配套技能库、多 agent orchestration、边缘/前沿模型和全路径 trace。14
- 结果与证据:评估 9 个 agent controllers 和 100 个 full-season soybean scenarios,覆盖 64-ridge 空间场、时序决策、农艺约束、延迟效应和最终产量,同时测 success、时空正确性、token cost 与 edge runtime。摘要未给各 controller 的具体分数。14
- 局限与关系:真实部署场景提高了环境真实性,单一农业基地仍限制外部效度。它为长程播客 agent 提供的可迁移模板是:状态时间戳、动作副作用、延迟反馈、最终交付和运行成本一起记录。
- 结论:精读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
三、轨迹、搜索与证据回返
轨迹论文的分水岭是:系统有没有记录“哪一步改变了结果”,以及模型是否会在证据不足时换路。最终答案、过程奖励、置信度、错误依赖和搜索预算分别回答不同问题。
12. trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories
- 作者/时间:Hadi Mohammadi;arXiv v1 于 2026-08-29 提交,公众号栏目于 2026-09-02 发布。15
- 问题与方法:论文在确定性 support-desk 工具环境中,用 scripted oracle policy 和 fault injector 构造已知单步故障,再按客户可见结果是否幸存分成 silent faults 与 loud faults。5 类 judge 在 400 条轨迹上比较 detection、定位、故障类型、校准和成本。15
- 结果与证据:outcome-only judge 捕获 84% loud faults、45% silent faults,同时误报 33% 正确轨迹;14B step-rubric judge 将 silent recall 从 0.451 提升到 0.766,配对差为 0.314,95% CI 为 [0.240,0.389],false-alarm 为 0,F1 约 0.923,type macro-F1 约 0.606。人为追加的 unsupported claim 只有 0.18 recall;self-consistency 使成本约增至 3 倍,F1 反而下降 0.009,silent recall 下降 0.006。结果来自 400 条轨迹、temperature 0、seed 7 和 10,000 次 trajectory bootstrap。16
- 局限与关系:环境是确定性的 support desk,虚假承诺结果提醒我们仍要审计最终交付中的承诺、引用和状态变更。播客 agent 应把“最终脚本正确”“每次检索有依据”“工具调用顺序合理”“没有未兑现承诺”分别计分。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
13. Dense Process Supervision for Search Agents via Fact Utility Estimation
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。17
- 问题与方法:论文把搜索 reasoning 过程表示成离散 evidence facts 的累积:从 observations 抽取 structured facts,放入 fact store,再按语义等价 fact cluster 在 group rollouts 上估计 Bayesian posterior utility,最后转成 dense step rewards。17
- 结果与证据:NQ、TriviaQA、PopQA、HotpotQA、2Wiki、MuSiQue 和 Bamboogle 七个 benchmark 上,Qwen2.5-7B FactAgent 平均 EM 为 51.2,E-GRPO 为 45.8,VinePPO 为 45.9;七项 EM 分别为 46.3、69.4、46.7、44.6、51.5、19.4、44.0。冷启动 SFT 平均 EM 为 32.3,SFT+RL 为 49.5;rollout 4/6/8 时 EM 为 48.5/51.2/51.4,平均 21.1 秒/题。训练使用 8×A100,评测使用 4×A100;训练 seed、置信区间和显著性检验未报告。18
- 局限与关系:fact store 的错误会直接污染 reward。对播客研究 agent,适合把每个检索事实、来源、时间和中间判断纳入 credit assignment,但必须把事实抽取器和奖励模型分别验收。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
14. DualStake: Dual-Path Confidence Calibration in Deep Research Agents
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。19
- 问题与方法:DualStake 把置信度拆成 evidence path 和 answer path,提出 Evidence Confidence(E-Conf)与 Answer Confidence 的双路径诊断。证据路径回答“来源是否足够支持”,答案路径回答“模型是否愿意这样作答”。19
- 结果与证据:论文将 E-Conf 描述为比 Answer Confidence 更强的不确定性信号,含义是它在作者的检索后风险识别设置中更能提示证据不足;摘要没有报告用于定义“更强”的具体 calibration 或 discrimination 指标,也没有给出完整 benchmark、置信度曲线、成本或语音条件下的漂移。19
- 局限与关系:它提供的是文本 QA 证据链线索。播客事实核查 agent 可以在脚本生成前根据 E-Conf 触发补搜或转人工,而不是用成稿的流畅度代替证据稳定性。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
15. EDGE: Error Dependency Graph-Guided Multi-Error Attribution in Multi-Agent LLM Systems
- 作者/时间:Virginia Tech 团队;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。20
- 问题与方法:EDGE 从 observed error events 构建 Error Dependency Graph,用 counterfactual rollout 验证 causal subset,再用 two-stage LLM-as-judge 做归因。它把多个错误之间的依赖和干预纳入轨迹分析。20
- 结果与证据:在 TRAIL、MAST 和 Who&When prompts 上,多数 model/setting 的 category-level multi-error attribution 提升。摘要没有给出逐设置数值、人工标注规模与反事实 rollout 成本。20
- 局限与关系:多错误归因仍依赖 judge 和构造出的反事实。播客流水线可以用它区分 ASR 错误、事实检索错误、脚本规划错误和 TTS 渲染错误的传播关系,避免把最后一句错读全部归给模型。
- 结论:精读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
16. Explore Before Committing: Hypothesis-Guided Search for Deep Research Agents
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。21
- 问题与方法:HypoSearch 针对单一 evolving trajectory 在早期方向错误后自我强化的问题,先生成轻量 hypotheses,再做有界独立分支搜索,比较 branch-level evidence 后再 commit。pilot SFT 用行为信号筛选紧凑训练轨迹。21
- 结果与证据:四个 deep-research benchmark、三种 backbone 中,Qwen3.5-122B 在 BC-small 上从 46.7 提升到 60.0,同时使用的工具调用少于 5 条独立分支轨迹的预算。这里的“5”按分支轨迹计,不是工具调用次数。摘要没有给出其他 benchmark 的完整结果、分支预算和证据质量标注。21
- 局限与关系:分支搜索带来额外调用成本,pilot SFT 也尚未构成完整长期学习验证。播客研究 agent 可以先列互斥假设,再分别找证据,降低选题和事实核查的确认偏误。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
17. One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning
- 作者/时间:复旦大学、东南大学、上海交通大学团队;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。22
- 问题与方法:AnySearch 先在 curriculum RL 中注入显式 budget state 和结构化 reasoning scaffold,再移除 scaffold,在自适应采样预算下训练。复合 reward 同时考虑 answer accuracy 与 budget efficiency,改动发生在训练策略和轨迹预算。22
- 结果与证据:七个 general/multi-hop QA benchmark 上,模型跨预算优于 baseline,并泛化到未见约束;摘要没有给出每个预算点的曲线、训练成本、重复运行和完整提升幅度。22
- 局限与关系:预算感知策略适合播客脚本研究的“少搜、深搜、转人工”决策,但应把辅助模型调用、工具重调用、任务成功和整轨时间分别记账。
- 结论:精读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
四、自进化与知识更新
自进化最容易被一个高分误导。需要分开问:谁在改变,谁在打分,谁被留在最终 checkpoint,held-out 是否改善,系统是否只是学会了搜索或迎合 verifier。
18. ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning
- 作者/时间:Fanrui Zhang、Ruixue Ding、Qiang Zhang、Xi Chen、Boli Chen、Shihang Wang、Qiuchen Wang、Hongmin Zhan、Jinxin Bian 等;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。23
- 问题与方法:ARISE-RL 用 Generator/Solver rubric-mediated co-evolution:Generator 从真实工具观察生成中等难度任务与 rubric,Solver 用细粒度 rubric satisfaction 学习;RG-SED 只有在 memory 带来经验 reward 提升时才蒸馏。方法同时改动任务生成、过程奖励和经验记忆。23
- 结果与证据:ECR-Bench 覆盖 single-tool deep research 和 multi-tool travel planning,摘要报告所有 benchmark 上稳定 SOTA。当前摘要证据没有给出具体分数、baseline 表、seed 数量、frozen base/best/final checkpoint、held-out 曲线和回滚阈值。23
- 局限与关系:rubric 让过程反馈变得可计算,但“稳定 SOTA”仍需要完整实验表和独立重复来支撑。它对频道目标的价值是提供一个可检验的自进化闭环:任务难度、rubric 质量、solver 学习、memory 蒸馏和外部盲测必须拆成五个验收点。
- 结论:精读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
19. Beneath the Diff: Diagnosing and Mitigating Algorithmic Mode Collapse in Code-Level Autonomous Research Loops
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-08-31 提交,公众号栏目于 2026-09-02 发布。24
- 问题与方法:代码级 autonomous research loop 让 LLM 提议训练管线修改、执行并保留提升 in-loop 指标的编辑。论文发现表面编辑多样性保持,semantic/mechanism diversity 却塌缩;DAPS 通过类别覆盖重加权、持久编辑记忆和验证门修复。三层协议隔离 in-loop、audit 和 blind 指标。24
- 结果与证据:semantic cluster decay 降低 69.1%,blind/audited relative faithfulness 的相对变化为 +83.7%/+81.6%,这里的数字是相对变化,不是百分点。论文同时称 in-loop 优化速度保持;摘要没有给出该速度指标的定义或数值。摘要还没有披露完整任务、模型和样本规模;relative faithfulness 是该循环定义的指标,不能直接换写成真实研究质量。24
- 局限与关系:这是本批最直接的 reward hacking 警报之一。播客自动选题或脚本迭代可以把未被循环访问的事实、引用完整性和听者评测设为 blind audit,避免自进化只优化内部评分器。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
20. Synthetic Worlds for Temporal Evaluation and Knowledge Updating in LLMs
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-08-31 提交,公众号栏目于 2026-09-02 发布。25
- 问题与方法:ParallelEvents 生成虚构但连贯的未来世界和事件轨迹,以避开真实语料污染,同时保留时间一致性;Synapse 用生成数据做 mid-training 与 instruction tuning,测试参数化知识的写入和更新。25
- 结果与证据:摘要报告 Synapse 在一个未明确命名的指标上相对既有方法提升 14.23%;摘要没有明确该指标的口径和比较 baseline,因此这不能直接写成无条件的性能提升。当前摘要还没有给出旧知识保持、冲突消解、训练成本和遗忘曲线。25
- 局限与关系:虚构世界可控制,真实播客知识还要面对来源时效、错误传播和说话人归属。它适合启发节目人物、事件和时间线的更新测试,但不能直接证明真实音频知识更新有效。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
21. From Base Rollouts to RL Reasoning: A Budgeted Search Perspective
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。26
- 问题与方法:UDF 把 token sampling、beam/tree search 和 sequence resampling 放进共同的 budgeted operating space,用 pass@k、self-consistency、best-of-N 和 first-finish success 比较 paired Base/RL checkpoints,并提出 BOPTR:
N_Base≈αN_RL^β。BOPTR 表示 Base 与 RL rollout budget 之间的经验对应关系,α、β是按 benchmark 和 cohort 拟合的参数,不是理论常数。26 - 结果与证据:Qwen2.5-7B 的 transfer error 为 3.41 个百分点,95% CI 为 [2.32, 5.53];三 seed 结果为 3.07±0.39 个百分点。扩展到 10 个模型、4 个家族时为 3.28–4.87 个百分点,未拟合 benchmark 为 5.03 个百分点。26
- 局限与关系:作者把结论限定为 recipe/cohort 的行为诊断,而非参数级等价性证据,实验也未覆盖真实工具轨迹。它提醒研发团队:播客脚本 agent 的多候选采样、重排和预算曲线,应与“模型是否学会新能力”分开。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
22. Autoresearch for Marketplace Catalogs: From Legacy Forms to AI-Native Matching
- 作者/时间:Thumbtack 团队;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。27
- 问题与方法:生产环境中的 autoresearch loop 按 occupation 独立执行 propose–evaluate–keep;6-rubric LLM judge 加 7-critic persona panel,另用 parity-mapping 将 legacy form Q&A 映射到新 taxonomy。27
- 结果与证据:系统自 2026 年 4 月起覆盖 132 个 occupations。摘要给出生产覆盖和评估结构,未给每轮改动的成功率、人工 QA 抽检比例、held-out 结果与回滚记录。27
- 局限与关系:生产部署说明 harness 与人工接口的重要性,尚不足以证明自进化算法本身带来稳定能力提升。它适合与 ARISE-RL、Beneath the Diff 对照:一个重真实循环,一个重训练闭环,一个重独立审计。
- 结论:值得扫读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
23. Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。28
- 问题与方法:论文用 metamorphic testing 生成保持数学意义的等价答案变体,审计 verifier 而非 model。四个 verifier 共 307,420 个 verdicts,按 answer category 分解 false negatives。28
- 结果与证据:self-validation 在同一输入上为 53.8%–95.2%,差距 41.3 个百分点;同一题库中的等价答案变体,在两种 verifier 配置下有 49.9% 的 paired verdict 不一致;默认 LaTeX 配置下 93.0% in-contract failures 集中在空格/标点;numeric cascade 在 10^4 阈值处把 off-by-one 错误接受率从 0% 跳到 100%。28
- 局限与关系:数学 verifier 的错误比例不能直接迁移到音频 judge。可迁移的是测试方法:对播客事实、引用、格式和 TTS 文本奖励做语义等价改写、数字变体、标点变体与 ASR 噪声测试。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
24. EvoSCM: Scientific Belief Revision Through Causal Model Evolution and Experimentation
- 作者/时间:中山大学、清华大学团队;arXiv v1 于 2026-09-02 提交,公众号栏目于 2026-09-02 发布。29
- 问题与方法:EvoSCM 维护 competing structural causal model hypotheses,循环执行 abduction、discriminative intervention、falsifiable prediction、experiment、error-derived correction 和 deductive validation。29
- 结果与证据:在 DiscoverPhysics 上,摘要报告 EvoSCM 比 baseline 更准确,也更有效利用实验交互;具体准确率、交互次数、重复运行和模型清单尚未在摘要中报告。29
- 局限与关系:可修订、可证伪的 belief state 与自由文本假设有清楚区别。对研究型播客 agent,这条线可以落实为“候选解释—区分性证据—保留/退役”的状态,而不是把一版脚本观点永久写进记忆。
- 结论:值得扫读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
五、TTS 文本入口与音频评测边界
本批音频线的结论需要分层看:TTS-friendly 文本属于生成入口;codec 负责语音表示;生成器归因负责来源审计;音乐属性评测负责验证“自动指标是否贴近人评”;ASR 与副语言论文属于上游理解。它们回答的题目不同。
25. Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。30
- 问题与方法:论文把 TTS-friendly generation 定义为 preference alignment,构建 CORA 与 Recipe 两个成对偏好数据集,比较 FaST 和多种 alignment baseline。目标是让 LLM 在生成文本时处理数字、标点、句长、歧义和口语可听性。30
- 结果与证据:CORA 与 Recipe 各使用 5 个 train/validation/test splits,平均 over 5 folds;CORA validation/test 各 81 条,Recipe 各 100 条。FaST 通常处于 TTS-friendliness/helpfulness Pareto frontier,10-sample 训练时优势更明显,100-sample 时 SFT 具有竞争力。CORA 第一 split 的 MUSHRA 听测抽取 20 个问题,Pocket TTS、100M、alba voice、24 kHz mono、CPU,最终 Prolific QC 为 N=14;heuristic 与 80 个 utterance-system pairs 的 MUSHRA 均值 Spearman ρ=.84、p≪.001,FaST/DPO 各为 .74,Prompting 为 .54,Oracle 为 .13。每个 approach 的五折平均不是五次独立训练的统计保证。31
- 局限与关系:论文输出的是 TTS-friendly 文本,不是语音波形;FaST 可能生成更长文本,长篇播客、多语言和 end-to-end speech LLM 尚未验证。官方主代码、数据和指标为 tts-friendly-gen,PolyNorm 的英文示例重实现使用 ml-speech-polynorm-bench。对播客脚本最直接的迁移是把文本规范化放到 TTS 之前,并同时保留文本可读性、ASR 可懂度、说话人保持和听者判断。32
- 结论:精读;本批最直接的 TTS 迁移项。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
26. BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。33
- 问题与方法:BiMTokenizer 是约 1.1 kbps 的单塔 speech codec,采用双向 Mamba/状态空间 backbone、Residual Spherical Leech Quantization,并用冻结的 Whisper-small 或 SenseVoice-small 作为 semantic teacher,配合 Vocos vocoder。33
- 结果与证据:Seed-TTS-Eval 的 test-en 为 WER 1.87%、SIM 0.59、UTMOS 4.11;test-zh 为 WER 1.72%、SIM 0.65、UTMOS 3.30。与 Spark-TTS 的中文结果相比,Spark-TTS 的 WER 1.20% 更低、SIM 0.67 更高。官方 README 还报告 test-clean 的参数量 253M、14.82G MACs、RTF 0.007。3435
- 局限与关系:双向 backbone 依赖未来帧,当前结果不能直接当作流式方案;196,560-entry codebook 也会扩大自回归 TTS 的预测空间。论文没有把主观 MOS、长播客段落质量或完整 TTS 质量基准作为系统结论。它适合提供 WER+SIM+UTMOS 的多指标参考。
- 结论:值得扫读;TTS 高迁移价值近邻。
- 入口:语音与音频学术速递[9.2] · arXiv 原文 · 官方代码
27. Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。36
- 问题与方法:PIPDP 研究语音生成器留下的被动指纹,测试 residual energy、reproducibility、saliency,以及 phase、high-frequency dithering、envelope smoothing、bit-depth dither 和 band notch 等感知透明扰动。实验覆盖 10 个 speech generators、25,000 条合成 utterances、3 个 attribution detectors,并在 VCTK 与 ESD 上做闭集 10-way attribution。36
- 结果与证据:中等 bit-depth dither(b=10)使 WavLM-AASIST accuracy drop 29.9%,w2v-bert-MLP drop 48.2%;同时 ΔDNSMOS 为 0.205、STOI 为 0.9909,transparent ratio 为 94.4%。20 人听测 40 条 utterances;Fleiss κ 为 0.82,衡量听者对“扰动是否可感知”这一标签的一致性。36
- 局限与关系:闭集归因、VCTK/ESD 和 10 个生成器限制了外推;论文没有提供完整 TTS 质量基准、真实播客混音条件、MOS 或系统级用户效用。它可迁移到合成语音来源审计,却不能代替自然度、可懂度和说话人相似度评测。
- 结论:值得扫读;TTS 评估近邻。
- 入口:语音与音频学术速递[9.2] · arXiv 原文
28. On the Human and Computer Alignment of Attribute-Based Music Matches
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。37
- 问题与方法:MATCHA 用 300 个 triplets、83 位音乐专家和 1,105 条属性级判断,比较 melody、harmony、rhythm、voice、timbre 五种属性的人评与计算指标对齐。样本包括 150 个 human-composed 与 150 个 AI-generated triplets,AI 部分含 Stable Audio Open 与 AI-Media。37
- 结果与证据:melody agreement 超过 85%、κ 约 0.60;case-level agreement 平均 77.3%(SD 12.4%)。AS subset 指 Stable Audio Open 生成的 120 个 triplets;该子集的计算指标与人类属性判断之间的 Kendall τ 为 −0.11–0.21,多数不显著。这里的 Kendall τ 衡量计算指标排序与人评排序的对齐程度;不同指标在不同属性上互补,未出现覆盖全部属性的单一指标。37
- 局限与关系:音乐属性体系不能代替 WER、SIM 或 TTS MOS,也不能替代播客的事实与叙事评估。可迁移的部分是“属性分解+多人判断+逐属性检验自动指标”,例如把内容清晰、韵律、音色、背景混音和伪影拆开测。
- 结论:值得扫读;生成音频感知评测近邻。
- 入口:语音与音频学术速递[9.2] · arXiv 原文 · 官方代码与演示
29. Topic Matching in the Wild: Benchmark and Lessons from Real-World ASR Transcripts
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-08-27 提交,公众号栏目于 2026-09-02 发布。38
- 问题与方法:论文从真实 contact-center phone conversations 构造人工标注的 topic–utterance judgments,比较 regex、zero-shot sentence embedding 和 Gemini LLM matcher,也比较 keyphrase 与 natural-language description 两种 topic 表示。输入具有口语重复、缺少标点和 ASR 错误。38
- 结果与证据:摘要称 lightweight LLM 加 natural-language descriptions 在 topic–utterance 匹配效果上表现最好;具体绝对分数、噪声分层结果和实时延迟仍未报告。这里的“最好”只指匹配效果的相对比较。38
- 局限与关系:联络中心短 utterance 与长播客段落分布不同。它仍可直接启发章节主题检测、广告/品牌提及和实时 coaching card,但迁移实验需要重新控制长上下文、说话人和跨语言条件。
- 结论:邻近跟踪。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
30. Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。39
- 问题与方法:研究 Whisper-large-v2、Qwen2-Audio-7B-Instruct、Qwen2.5-Omni-7B 和 Chroma-4B,在 Expresso 的 4 名说话人、7 种 speaking styles 上用 CKA、LOSO linear probing、open-ended tone prediction 和 content-prosody leakage ratio 分析副语言信息。39
- 结果与证据:late-encoder probing 指在编码器后段表征上训练线性探测器,其准确率约为 82%–85%;tone accuracy 为 19.7%–53.7%,chance 为 14.29%;总体 Omni 为 53.7%,Qwen2-Audio 为 19.7%,Chroma 为 22.6%。content-driven leakage 在 Qwen2-Audio 为 97.7%、Chroma 为 84.4%、Omni 为 27.2%。论文用 NMI(normalized mutual information,归一化互信息)刻画内容与风格表征的共享信息;较高的 content-driven leakage 表示探测结果更可能由文本内容而非独立的副语言风格信号驱动。39
- 局限与关系:四名说话人和单一 speaking-style 设置限制人口泛化;NMI leakage 也受文本熵影响。论文测的是语音理解中的副语言表征,不能当作 TTS 风格可控性、自然度或播客连贯性结果。它适合提醒评测者把内容保持、韵律控制和模型是否使用副语言信号分开。
- 结论:邻近跟踪。
- 入口:语音与音频学术速递[9.2] · arXiv 原文
其余直接命中:值得扫读
以下五篇补齐本批直接命中清单。它们分别落在研究 agent harness、自动化发现、上下文编译、技能实际使用和参数知识审计;结果字段继续保留指标口径与证据边界。
31. Dr. Claw: An AI Scientist Workspace for Vibe Research
- 作者/时间:作者团队与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。40
- 研究问题与方法:Dr. Claw 在现有命令行 coding-agent executor 外包裹可控、可审计、human-in-the-loop workspace,用 persistent state objects、skill library 和 multi-executor coordination 把规划、执行、写作连成可恢复轨迹。改动位置是 harness 与研究工作流,模型权重保持在同一 backend 对照中。40
- 结果、证据与局限:与同 backend 的 bare CLI agent 对比,摘要报告 research completeness 更高并保留审计过程;完整分数、任务数量、独立重复和人工介入成本未报告。官方仓库为 OpenLAIR/dr-claw,许可为 AGPL-3.0。4041
- 与目标研究线的关系:它提供研究 agent 的状态对象、技能库和审计轨迹基线;播客研究 agent 可以把选题、证据卡、音频任务和发布状态变成可恢复对象。
- 结论:值得扫读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
32. Agentic Empirical Asset Pricing: Methodological Foundations
- 作者/时间:Yingjian Pan 等;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。42
- 研究问题与方法:AEAP 定义 agent 自主完成 empirical asset-pricing discovery 的范式,提出 reference architecture、discovered-factor evaluation standard 和 discovery-system out-of-sample backtest。SEADS 与 5 个 reimplemented baselines 在 2 个 US equity panels 上比较,并以 rolling re-execution 检查过程可靠性。42
- 结果、证据与局限:作者指出单一 metric 不能稳定排序 discovery system;摘要没有给出完整效果量、面板细节、重复运行分布或交易成本。证据支持“过程重现性应进入评估”,尚不足以给出系统排名。42
- 与目标研究线的关系:播客研究 agent 也应同时报告发现质量、来源重放、时间外验证和成本,而非只展示一篇最终稿。
- 结论:值得扫读。
- 入口:人工智能学术速递[9.2] · arXiv 原文
33. Compile, Don't Memorize: A Context Compilation Architecture (CCA) for In-Context Learning
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。43
- 研究问题与方法:CCA 把 prose context 编译成 typed IR,固定 rules、output_spec、available_tools、data_profile,再接 executable verifiers 和 violation-gated correction loop。它改的是上下文 harness 与校验协议。43
- 结果、证据与局限:CL-bench 含 1,899 tasks、4 个 open base models;vanilla→CCA 的 overall pass rate 为 Kimi 15.4%→21.4%、GLM 16.1%→21.2%、DeepSeek 15.0%→17.7%、Qwen3 11.9%→12.4%。LongBench-v2 上 CCA 53.88 低于 vanilla 57.85,adaptive router 为 60.24;CCA full wall-clock 约为 vanilla 1.6 倍。主结果使用 paired McNemar,全文未见多 seed 独立重复或主结果置信区间。4344
- 与目标研究线的关系:长程播客研究/制作 agent 可以先编译节目规范、版权禁区、音频工具和引用格式,再执行并校验;规则密集任务的收益与整体低通过率必须同时保留。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
34. Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。45
- 研究问题与方法:论文提出 Retrieval-Invoked Actual-Use Effect(RAE),只在 agent 实际检索 skill 的任务上比较 matched skill-enabled 与 skill-disabled execution,并把失败链拆成检索、返回技能、理解/grounding/synthesis 和 final format。45
- 结果、证据与局限:评估 17 个 LLM、MBPP+、HumanEval+ 和 Math500。Math500 上 Llama-3.3-70B 的 aggregate lift 为 +14.2 个百分点,RAE 为 −39.4 个百分点;Gemini-2.5-Flash-lite 为 +13.2 与 −11.0 个百分点。MBPP+ 的 DeepSeek-V3.2 三个 partition seeds 为 −9.1/−15.4/−23.1;这些 seeds 是数据划分重复,不是多次训练。20,000 paired multinomial bootstrap 和 exact McNemar 支持敏感性分析,训练重复与部署成本未报告。45
- 与目标研究线的关系:播客制作 agent 调用转录、事实核查、发音和版权技能时,应做同任务有/无技能的反事实对照,单独记录技能解释和最终合成是否真的受益。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
35. LLMPEDIA: Browsing, Verifying, and Comparing the Parametric Encyclopedic Knowledge of LLMs
- 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。46
- 研究问题与方法:LLMPEDIA 从 GPT-5-mini、DeepSeek-V3.2、Llama-3.3-70B 三个模型家族无 retrieval 递归生成约 1.3M articles,抽取 atomic claims,再与 Wikipedia/curated web stack 审计支持、反驳或 insufficient,提供 claim-level 和跨模型浏览视图。46
- 结果、证据与局限:均匀随机样本的 true rate 为 68.4%;论文把它与 MMLU 报告的高于 90% 的结果作口径对照,差距超过 21 个百分点,但两者的样本、标签和任务定义不同,不能当作同一 benchmark 分数的直接差值。30.5% claims 被归为 insufficient。审计依赖 Wikipedia/web stack,摘要未报告每模型细分、时效漂移和播客知识更新结果。46
- 与目标研究线的关系:研究 agent 可把每个播客断言绑定来源、时间、模型差异和 insufficient 状态,形成可回放的 claim ledger;参数知识与外部证据必须分开。
- 结论:精读。
- 入口:自然语言处理学术速递[9.2] · arXiv 原文
研发验收检查表
状态与记忆
- 是否把状态保持、检索命中、引用正确、失效遵守、冲突处理和删除后重答分开测?
- 是否能从每个长期事实回到事件、时间、来源和版本?
- 压缩或事件合并后,是否保留跨段关系,而不是只保留孤立句子?
- 前瞻性任务是否有可验证的触发、完成、取消和过期状态?
工具与环境
- 是否分别记录动作类别选择、工具执行结果、最终交付和副作用?
- 是否在 action-commit 前检查权限、provenance、目标对象和不可逆程度?
- 工具、插件或 prompt 改动后,依赖清理、版本回滚和异步状态是否仍正确?
- 是否在真实时序环境中记录延迟反馈、恢复成本、token 和整轨墙钟时间?
轨迹与证据
- 是否有 silent fault 注入,能识别“结果碰巧正确、过程已经错误”的轨迹?
- 是否给中间事实、来源和步骤分配可解释的效用,而不是把全部 reward 压到最终答案?
- 是否把 evidence confidence 与 answer confidence 分开?
- 是否保留多个假设分支,并在 commit 前比较独立证据?
- 错误归因是否使用反事实或干预,而不是让最终 judge 猜一个 root cause?
自进化
- 是否同时保留 frozen base、best checkpoint、final checkpoint 和 held-out 结果?
- 是否预先固定随机种子、重复次数、回滚阈值和停止条件?
- 是否把模型权重、harness、技能库、记忆、轨迹表示和 verifier 的变化逐项消融?
- 是否检查 semantic/mechanism diversity、失败转成功和成功转失败,而非只看 self-judge 或 in-loop reward?
- 是否为 verifier 做语义等价改写、数字/标点变体和未被循环访问的盲测?
TTS 与长音频
- 文本端是否分别记录数字/标点规范化、句长、歧义、TTS→ASR、WER、SIM、UTMOS/MOS 和听者判断?
- TTS 生成是否区分整段再合成与局部编辑,并记录 Refiner、迭代上限、延迟和调用成本?
- 长播客是否分开测输入长度、事实定位、事实理解、跨段推理和最终用户行动?
- 音频质量是否同时包含自动指标、主观听感、说话人保持、表达控制、生成器取证和调用率?
- 是否设置“无生成调用”对照,证明音频调用本身带来的增益?
精选原文阅读顺序
第一组先读长程可靠性与记忆:
- Long-Horizon State Tracking
- Making Prospective Memory SLM-Shaped
- Invalidation Contracts
- EM²Mem
- ClinTraceBench
第二组再读工具边界、轨迹和自进化:
- OpenAgentFlow
- Control-Data Flow Separation
- Calibration is the Bottleneck
- trajectory-judge
- Dense Process Supervision
- DualStake
- Explore Before Committing
- ARISE-RL
- Beneath the Diff
- From Base Rollouts to RL Reasoning
- Where the Verifier Fails
第三组处理 TTS 文本入口和音频迁移:
以下 22 篇是从 30 篇直接命中与 5 篇邻近项中挑出的精选阅读顺序,不构成 35 篇论文的全量排名。其余 11 篇直接命中仍按正文中的“精读”或“值得扫读”结论安排阅读:
- Learning What to Retain、FAIRY、EDGE、One Policy, Any Budget
- Autoresearch for Marketplace Catalogs、EvoSCM、Dr. Claw、Agentic Empirical Asset Pricing
- Compile, Don't Memorize、Skill Following、LLMPEDIA
本批最值得带回工程实验的判断有三条:第一,先定位长程失败发生在状态、动作、轨迹、交付还是副作用;第二,自进化先证明盲测和 held-out 改善,再讨论是否学到了新机制;第三,TTS 与播客评测要把文本、语音、听感、来源审计和最终行动分开。
References
- 1Long-Horizon State Tracking arXiv v1
arxiv.org
- 2Learning What to Retain arXiv v1
arxiv.org
- 3Invalidation Contracts arXiv v1
arxiv.org
- 4EM²Mem arXiv v1
arxiv.org
- 5EM²Mem arXiv HTML 全文
arxiv.org
- 6EM²Mem 官方代码
github.com
- 7Making Prospective Memory arXiv v1
arxiv.org
- 8ClinTraceBench arXiv v1
arxiv.org
- 9OpenAgentFlow arXiv v1
arxiv.org
- 10
- 11
- 12Calibration arXiv HTML 全文
arxiv.org
- 13CordisBench arXiv v1
arxiv.org
- 14FAIRY arXiv v1
arxiv.org
- 15trajectory-judge arXiv v1
arxiv.org
- 16trajectory-judge arXiv HTML 全文
arxiv.org
- 17Dense Process Supervision arXiv v1
arxiv.org
- 18
- 19DualStake arXiv v1
arxiv.org
- 20EDGE arXiv v1
arxiv.org
- 21Explore Before Committing arXiv v1
arxiv.org
- 22One Policy Any Budget arXiv v1
arxiv.org
- 23ARISE-RL arXiv v1
arxiv.org
- 24Beneath the Diff arXiv v1
arxiv.org
- 25Synthetic Worlds arXiv v1
arxiv.org
- 26
- 27
- 28Where the Verifier Fails arXiv v1
arxiv.org
- 29EvoSCM arXiv v1
arxiv.org
- 30Ready to Speak arXiv v1
arxiv.org
- 31Ready to Speak arXiv HTML 全文
arxiv.org
- 32Ready to Speak 官方代码
github.com
- 33BiMTokenizer arXiv v1
arxiv.org
- 34BiMTokenizer arXiv HTML 全文
arxiv.org
- 35BiMTokenizer 官方代码
github.com
- 36PIPDP arXiv HTML 全文
arxiv.org
- 37MATCHA arXiv HTML 全文
arxiv.org
- 38Topic Matching in the Wild arXiv v1
arxiv.org
- 39Heard but Not Heeded arXiv HTML 全文
arxiv.org
- 40Dr. Claw arXiv v1
arxiv.org
- 41Dr. Claw 官方仓库
github.com
- 42
- 43CCA arXiv HTML 全文
arxiv.org
- 44CCA 官方代码
github.com
- 45Skill Following arXiv HTML 全文
arxiv.org
- 46LLMPEDIA arXiv v1
arxiv.org
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
