工具边界、证据回返与 TTS 文本对齐:9.2 论文雷达

工具边界、证据回返与 TTS 文本对齐:9.2 论文雷达

聚焦 9 月 2 日三个允许栏目,按工具边界、记忆失效、自进化证据与 TTS 文本评测分层筛出 35 篇论文,并给出重点原文阅读顺序与研发验收检查项。

本批先看什么

本批候选来自微信公众号「arXiv 每日学术速递」在 2026 年 9 月 2 日发布的三个栏目:人工智能学术速递、自然语言处理学术速递、语音与音频学术速递。筛选标准有四个:是否直接落在长程智能体、轨迹学习、自进化、TTS 生成与评估;方法改动落在模型权重、harness/环境、技能或记忆、轨迹表示、评测协议中的哪一层;关键结果是否有可核对的指标;论文是否给出足够的复现边界。
本期收录 30 篇直接命中,以及 5 篇邻近但值得跟踪。语音与音频栏目本批没有 TTS 生成、TTS 评估、播客生成或播客评估的直接命中。Ready to Speak 处理的是 TTS-friendly 文本,BiMTokenizer 是语音 codec,PIPDP 是生成器归因,MATCHA 是音乐属性评测;这些论文分别提供迁移线索,不能合并成“本批已有完整 TTS 或播客生成结果”。
这批论文最清楚的共同问题是:长程系统的增益究竟来自哪里。模型权重改变、工具边界改变、环境状态改变、技能或记忆改变、轨迹奖励改变,以及仅仅换了一套评测协议,必须分开记账。下面的“直接命中”指论文的研究对象或方法本身落在频道目标线上;“邻近跟踪”指论文来自允许栏目,且连接点明确,但研究对象仍属于另一层。

阅读优先级

优先级论文主要改动位置先核对什么
精读ARISE-RLRL 训练、任务生成、经验记忆Generator/Solver 共进化后,frozen base、best checkpoint、final checkpoint 与 held-out 是否同时成立
精读Beneath the Diff自进化循环、编辑记忆、盲测in-loop 提升是否能穿过 semantic diversity 与 blind audit
精读trajectory-judge轨迹评测结果正确但路径错误的 silent fault 是否被发现
精读Making Prospective Memory SLM-Shaped前瞻性记忆的符号生命周期intent 的写入、触发、完成与失效是否由可验证状态机承担
精读Invalidation Contracts缓存/记忆协议、失效记忆命中后,模型是否遵守版本戳和失效提示
精读Compile, Don't Memorize上下文 harness、类型化 IR规则编译带来的通过率是否覆盖编译失败和剩余总体低通过率
精读EM²Mem事件中心多模态记忆事件合并错误、构建成本与 evidence recall 是否一起报告
精读Dense Process Supervision轨迹奖励、事实效用估计中间事实的奖励是否真的改善 credit assignment,而非放大抽取错误
精读From Base Rollouts to RL Reasoning采样预算与 RL 行为诊断RL 增益有多少只是更高效地搜索已有能力
精读Ready to SpeakTTS-friendly 文本偏好对齐文本端启发式分数与 TTS→ASR、听测之间是否保持一致
精读OpenAgentFlow运行时安全边界action-commit 前的拦截、provenance 和 trace 是否构成完整控制面
精读ClinTraceBench纵向状态、来源追踪、成本历史压缩损失能否在播客或语音场景复现
优先级基于四个可检查维度:直接相关性、机制新颖性、证据密度和对研发验收的影响。它表示原文阅读顺序,不表示论文质量的最终排名。

一、状态、记忆与长程可靠性

长程系统先要回答一个朴素问题:模型在第 60 轮看到的状态,还是第 1 轮留下的那个状态吗?这一组论文把状态保持、记忆路由、缓存失效、事件锚定和来源追踪拆开了。

1. Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls

  • 作者/时间:Dheeraj Mohandas Pai、Lu Xian;arXiv v1 于 2026-08-02 提交,公众号栏目于 2026-09-02 发布。作者将任务设计成 clean-room MD5 测试,而不是一般工具调用问答。1
  • 问题与方法:测试 196 次相互依赖的工具调用、64 轮状态传递和四个 32-bit word,刻意隔离状态携带、算术处理与服务执行三类失败。模型需要持续维护中间状态,最后给出 MD5 结果。1
  • 结果与证据:摘要报告 gpt-oss-120b 在 temperature 0 下多数完成运行得到正确结果;论文将“保留自身 reasoning context”和“让 thinking-enabled worker 投票”作为两个有用设置,但摘要没有给出它们各自的消融结果。完整运行次数、失败分布和置信区间也未报告,因此“多数”无法继续换算成成功率。1
  • 局限与关系:这是诊断性、合成式的状态基准,能隔离长程记忆问题,尚未覆盖真实工具副作用、恢复成本和持久数据库。它适合做播客研究 agent 的“长轨状态保持”底线测试。
  • 结论:精读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

2. Learning What to Retain: Gated-Memory Routing for Efficient Collaboration in Multi-Agent LLM Systems

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。2
  • 问题与方法:Gated-Memory Routing 学习三个控制器:Memory Write Gate 只写入非冗余步骤,Retrieval Gate 提供紧凑相关子集,Adaptive Halting Controller 决定何时停止。改动位于记忆路由和多智能体协作 harness,模型权重并非唯一变量。2
  • 结果与证据:五个 reasoning/code benchmark 上,平均准确率比最强 baseline 高 2.44 个百分点;HumanEval inference cost 相对论文所列 baseline 降低 31.9%。这里的 cost 单位以及 baseline 的逐项定义,当前摘要没有说明,不能把 31.9% 改写成 token、时延或货币节省。每个 benchmark 的分数、记忆写入错误率和不同随机种子的结果也未报告。2
  • 局限与关系:准确率与成本结果支持“选择性保留”值得测试,尚未回答误删关键步骤、跨任务迁移和长时间运行后的记忆污染。对播客制作 agent,写入的对象应从“整段历史”改成可定位的事实、状态和动作记录。
  • 结论:值得扫读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

3. Invalidation Contracts for Cross-Episode Agent Memory

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。3
  • 问题与方法:论文给每个 API recovery suggestion 附 version stamp 与 cacheability hint,并分别记录 validity savings 和 planner compliance。它改的是记忆与缓存协议,研究重点是“记忆已经失效后,系统是否能知道”。3
  • 结果与证据:约 9,400 个 episodes、7 个模型、3 条 serving path、2 个领域构成评测面板。row-level invalidation compliance 提升 0–66.7 个百分点;7 个模型中有 4 个把 token cost 降到论文 baseline 的 29%–33%,payload 相对无契约条件增加 15%。table-level post-drift recovery 的 first-attempt success rate 在 7 个模型中的 5 个为 0%。这些数字来自 arXiv 摘要与全文记录,完整任务表仍需回到原文核对。3
  • 局限与关系:协议有效与 planner 遵守是两个变量。播客知识库需要同时保存节目版本、事实更新时间、可缓存范围和重新核验动作;只保存“相关片段”会把过期信息重新带回脚本。
  • 结论:精读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

4. EM²Mem: Event-Centric Multimodal Memory for Large Language Models

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。4
  • 问题与方法:EM²Mem 在建记忆时把 captions、frames、transcripts、summaries 和 graph facts 绑定到 event anchors。每个 event-indexed cell 同时保存时间上下文、关系、语义事实和 provenance,减少推理时重新拼接孤立模态片段的工作。4
  • 结果与证据:EgoLifeQA、Ego-R1 Bench 和 Video-MME (L) 三个长视频 QA benchmark 上,相对最强 memory baseline 的平均准确率分别提升 2.0、2.4、3.7 个百分点;strict event-level Top-5 evidence recall 为 30.8%,比 WorldMM 高 7.0 个百分点。EgoLifeQA 的 Full overall 为 66.0;去掉 temporal-context views、semantic memory、episodic graph 后分别为 60.4、61.4、61.6。对齐构建的 6,057 条 30 秒记录、500 个问题相对四通道 RRF 的 R@1 提升 5.1、R@5 提升 3.4、300 秒 coverage 提升 5.4 个百分点,95% CI 为 [+2.6,+8.3],McNemar exact p=0.0003;QA 由 60.0 到 63.0,但 95% CI 为 [−0.8,+6.8]、p=0.1505。单查询延迟降低 4.67 倍,推理 token 降低 63.66%。5
  • 局限与关系:构建阶段共 89.23M tokens,WorldMM 为 60.55M;论文使用 2 张 NVIDIA A100 40GB 和 8 个并发 worker,构建成本依赖跨查询摊销。事件切分或合并错误率、多 seed、长播客验证和域外泛化未充分报告;官方代码为 LightMem。播客迁移时应把事件、说话人、节目版本和证据链接作为一个可回放单元。6
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

5. Making Prospective Memory SLM-Shaped: Typed Intention Stores for Small-Model Agents

  • 作者/时间:Jinqing Zhao、Chengcan Wu;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。7
  • 问题与方法:PIS 把 deferred-intention lifecycle 写入 typed code,让模型负责有范围的语言工作,代码负责意图的存储、触发和状态变更。方法 training-free,也没有 selector fine-tuning 或 trajectory distillation。7
  • 结果与证据:在 PM-Bench 上,DeepSeek-Chat 的 Set-F1 为 82.9%;Gemma-E2B 无 store 时为 4.2%,加入 7 个 retrospective memories 后最高 6.6%,PIS 达 66.2%。另一组设置中,PIS 为 70.1%,retrospective memory 最高为 54.4%。这些结果把前瞻性意图与回顾性记忆分开了,但摘要没有列每个任务的方差和完整错误类型。7
  • 局限与关系:PIS 的优势来自可验证生命周期,不代表所有长期记忆都应移出模型。播客 agent 可以把“下期追踪某人某项声明”“某来源过期后重新核验”存成 typed intention,再让语言模型生成提醒文本。
  • 结论:精读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

6. ClinTraceBench: Source-Verifiable Longitudinal Clinical Reasoning over EHR-Derived Dialogues

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。8
  • 问题与方法:ClinTraceBench 包含 385 个 MIMIC-IV-derived verified dialogues、event-ID provenance 和 9-task taxonomy,使用 L0–L4 deterministic checks 加 L5 human audit;作者报告这套检查协议的 agreement 为 98.92%,这里的数字描述核验协议,不是模型准确率。论文比较 full context、retrieval、压缩、LLM summary、Mem0、A-Mem 等 8 种 history representation。8
  • 结果与证据:6,271 个问题、32 个 cells(8 种 history representation × 4 个模型 backbone)、200,672 个 predictions 构成实验面板。压缩策略出现关系损失与多访视 aggregation tax,blind-to-full gap 为 29.8–62.7 个百分点;Haiku full-context 成本为 25.76 美元,Sonnet 为 106.21 美元。摘要没有给出每个任务的完整分数。8
  • 局限与关系:临床衍生数据不能直接代表普通用户或音频。它提供的事件 ID、来源追踪和成本—能力 Pareto,适合迁移到长期嘉宾、主题和节目版本记忆。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

二、工具边界、执行协议与环境

记忆能否被正确读取,仍然不同于动作能否在正确时机发生。这一组论文把 action-commit、路由格式、动作类别、组件清理、真实时空环境和状态型评估拆开。

7. OpenAgentFlow: Enabling System-Wide Safety Boundaries for Heterogeneous AI Agent Fleets

  • 作者/时间:南方科技大学等;arXiv v1 于 2026-08-14 提交,公众号栏目于 2026-09-02 发布。9
  • 问题与方法:OpenAgentFlow 把 GUI、API、tool 和 LLM invocation 统一为 AgentEvent,在 action-commit 前由共享 Policy Enforcement Point 拦截。控制平面保存 provenance、session state、audit 和可更新策略,改动重心是运行时治理,而非单个 prompt。9
  • 结果与证据:Android 300-case action-event benchmark 上 accuracy 为 94.0%,attack block 为 95.3%;动态策略 30 个 cases 中 27 个符合预期;100-case emulator 中 98 个 traced cases 的 raw accuracy 为 90.8%,trace-adjusted pass 为 92.9%。9
  • 局限与关系:摘要没有给出攻击类型、策略更新成本和真实多租户部署条件。它适合做播客研究/发布 agent 的权限边界基线:读、写、发布、覆盖和删除应使用不同的提交门。
  • 结论:精读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

8. Control-Data Flow Separation: Stable Prompt Optimization in Multi-Agent LLMs

  • 作者/时间:Waterloo/Manulife 团队;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。10
  • 问题与方法:论文把 execution-critical routing、format 和 termination 从可优化的语言 data flow 中拆出,改用 typed、validated program objects。提示优化器可以改语言内容,协议对象则负责保持执行边界。10
  • 结果与证据:在 synthetic reasoning、collaborative review 和 insurance rating 三类任务上,作者报告 eventual protocol validity 达到 100%,并伴随任务表现提升。摘要没有给出逐任务分数、失败恢复成本和协议对象的人工维护成本。10
  • 局限与关系:100% 指协议最终有效性,不能替换任务正确率、工具副作用和用户满意度。播客 pipeline 可以把章节结构、引用格式、版权禁区和发布状态从自由文本中抽成可校验对象。
  • 结论:精读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

9. Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。11
  • 问题与方法:论文把动作分成 TOOL_CALL、ASK、REFUSE、CONFIRM,并区分 action-class miscalibration 与 action-execution failure,提出 Acc ≤ GAR 作为可见上界。评估对象从“答对没有”移到“是否选对了动作类别”。11
  • 结果与证据:BFCL v3 multi-turn 面板与 τ²-bench cross-check 显示,aggregate accuracy 71.8% 的 xLAM 在 miss-param 场景的 Gold Action Recall 只有 19.5%;BFCL 中 Qwen3-8B、Qwen3-14B、gpt-oss-20b 和 xLAM-2-8b 的 miss-param GAR 分别为 84.0%、79.0%、76.0% 和 19.5%,xLAM 的 miss-func GAR 为 10.0%。200-case audit 中 gold-turn action rate 为 71/200,eventually action rate 为 88/200,grader-pass masking 为 26/200。Qwen3-8B 在 τ² retail 114 tasks 的 SRI 三 seed accuracy delta 为 +6.00±0.88 个百分点;retry 使 12 个 cell 中 11 个 trajectory accuracy 变差。12
  • 局限与关系:文本工具调用结果尚未证明能直接迁移到语音输入。播客 agent 至少要分别评分检索、追问、拒答、确认和转人工,工具调用成功率无法覆盖动作时机错误。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

10. CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。13
  • 问题与方法:CordisBench 包含 1,200 个问题,放在受控形式化环境和 Cordis runtime 中,要求模型判断依赖组件、teardown 顺序后的状态、全称/存在条件和可执行重配置。题目按 2、4、8、16、24、32 个相关交互测试 reasoning effort。13
  • 结果与证据:交互增加后,final state 和跨 teardown order 的可靠性下降;中等 effort 下,GPT-5.6 Luna 在 16-interaction subset 每题接近 3,000 reasoning tokens。独立 finite reference semantics 与 Cordis runtime 在 528 个 executable questions 的 observation/action outcome 上全部一致;这个一致性是参考语义与运行时之间的比较。13
  • 局限与关系:受控 runtime 提供了有限语义,真实 harness 的插件数量、异步事件和外部副作用仍未验证。播客 agent 修改转录器、切段器或发布插件时,应把依赖清理和回滚作为长程任务的一部分。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

11. Deploying and Evaluating a Smart-Agriculture Agentic Engine for Full-Season Soybean Farm Operations

  • 作者/时间:synkrasis-labs;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。14
  • 问题与方法:FAIRY 是部署在哈工大智慧农业基地的 full-stack agent system,用“everything is an event”统一传感器、遥感、作物状态、机械动作和干预,并配套技能库、多 agent orchestration、边缘/前沿模型和全路径 trace。14
  • 结果与证据:评估 9 个 agent controllers 和 100 个 full-season soybean scenarios,覆盖 64-ridge 空间场、时序决策、农艺约束、延迟效应和最终产量,同时测 success、时空正确性、token cost 与 edge runtime。摘要未给各 controller 的具体分数。14
  • 局限与关系:真实部署场景提高了环境真实性,单一农业基地仍限制外部效度。它为长程播客 agent 提供的可迁移模板是:状态时间戳、动作副作用、延迟反馈、最终交付和运行成本一起记录。
  • 结论:精读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

三、轨迹、搜索与证据回返

轨迹论文的分水岭是:系统有没有记录“哪一步改变了结果”,以及模型是否会在证据不足时换路。最终答案、过程奖励、置信度、错误依赖和搜索预算分别回答不同问题。

12. trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories

  • 作者/时间:Hadi Mohammadi;arXiv v1 于 2026-08-29 提交,公众号栏目于 2026-09-02 发布。15
  • 问题与方法:论文在确定性 support-desk 工具环境中,用 scripted oracle policy 和 fault injector 构造已知单步故障,再按客户可见结果是否幸存分成 silent faults 与 loud faults。5 类 judge 在 400 条轨迹上比较 detection、定位、故障类型、校准和成本。15
  • 结果与证据:outcome-only judge 捕获 84% loud faults、45% silent faults,同时误报 33% 正确轨迹;14B step-rubric judge 将 silent recall 从 0.451 提升到 0.766,配对差为 0.314,95% CI 为 [0.240,0.389],false-alarm 为 0,F1 约 0.923,type macro-F1 约 0.606。人为追加的 unsupported claim 只有 0.18 recall;self-consistency 使成本约增至 3 倍,F1 反而下降 0.009,silent recall 下降 0.006。结果来自 400 条轨迹、temperature 0、seed 7 和 10,000 次 trajectory bootstrap。16
  • 局限与关系:环境是确定性的 support desk,虚假承诺结果提醒我们仍要审计最终交付中的承诺、引用和状态变更。播客 agent 应把“最终脚本正确”“每次检索有依据”“工具调用顺序合理”“没有未兑现承诺”分别计分。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

13. Dense Process Supervision for Search Agents via Fact Utility Estimation

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。17
  • 问题与方法:论文把搜索 reasoning 过程表示成离散 evidence facts 的累积:从 observations 抽取 structured facts,放入 fact store,再按语义等价 fact cluster 在 group rollouts 上估计 Bayesian posterior utility,最后转成 dense step rewards。17
  • 结果与证据:NQ、TriviaQA、PopQA、HotpotQA、2Wiki、MuSiQue 和 Bamboogle 七个 benchmark 上,Qwen2.5-7B FactAgent 平均 EM 为 51.2,E-GRPO 为 45.8,VinePPO 为 45.9;七项 EM 分别为 46.3、69.4、46.7、44.6、51.5、19.4、44.0。冷启动 SFT 平均 EM 为 32.3,SFT+RL 为 49.5;rollout 4/6/8 时 EM 为 48.5/51.2/51.4,平均 21.1 秒/题。训练使用 8×A100,评测使用 4×A100;训练 seed、置信区间和显著性检验未报告。18
  • 局限与关系:fact store 的错误会直接污染 reward。对播客研究 agent,适合把每个检索事实、来源、时间和中间判断纳入 credit assignment,但必须把事实抽取器和奖励模型分别验收。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

14. DualStake: Dual-Path Confidence Calibration in Deep Research Agents

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。19
  • 问题与方法:DualStake 把置信度拆成 evidence path 和 answer path,提出 Evidence Confidence(E-Conf)与 Answer Confidence 的双路径诊断。证据路径回答“来源是否足够支持”,答案路径回答“模型是否愿意这样作答”。19
  • 结果与证据:论文将 E-Conf 描述为比 Answer Confidence 更强的不确定性信号,含义是它在作者的检索后风险识别设置中更能提示证据不足;摘要没有报告用于定义“更强”的具体 calibration 或 discrimination 指标,也没有给出完整 benchmark、置信度曲线、成本或语音条件下的漂移。19
  • 局限与关系:它提供的是文本 QA 证据链线索。播客事实核查 agent 可以在脚本生成前根据 E-Conf 触发补搜或转人工,而不是用成稿的流畅度代替证据稳定性。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

15. EDGE: Error Dependency Graph-Guided Multi-Error Attribution in Multi-Agent LLM Systems

  • 作者/时间:Virginia Tech 团队;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。20
  • 问题与方法:EDGE 从 observed error events 构建 Error Dependency Graph,用 counterfactual rollout 验证 causal subset,再用 two-stage LLM-as-judge 做归因。它把多个错误之间的依赖和干预纳入轨迹分析。20
  • 结果与证据:在 TRAIL、MAST 和 Who&When prompts 上,多数 model/setting 的 category-level multi-error attribution 提升。摘要没有给出逐设置数值、人工标注规模与反事实 rollout 成本。20
  • 局限与关系:多错误归因仍依赖 judge 和构造出的反事实。播客流水线可以用它区分 ASR 错误、事实检索错误、脚本规划错误和 TTS 渲染错误的传播关系,避免把最后一句错读全部归给模型。
  • 结论:精读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

16. Explore Before Committing: Hypothesis-Guided Search for Deep Research Agents

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。21
  • 问题与方法:HypoSearch 针对单一 evolving trajectory 在早期方向错误后自我强化的问题,先生成轻量 hypotheses,再做有界独立分支搜索,比较 branch-level evidence 后再 commit。pilot SFT 用行为信号筛选紧凑训练轨迹。21
  • 结果与证据:四个 deep-research benchmark、三种 backbone 中,Qwen3.5-122B 在 BC-small 上从 46.7 提升到 60.0,同时使用的工具调用少于 5 条独立分支轨迹的预算。这里的“5”按分支轨迹计,不是工具调用次数。摘要没有给出其他 benchmark 的完整结果、分支预算和证据质量标注。21
  • 局限与关系:分支搜索带来额外调用成本,pilot SFT 也尚未构成完整长期学习验证。播客研究 agent 可以先列互斥假设,再分别找证据,降低选题和事实核查的确认偏误。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

17. One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning

  • 作者/时间:复旦大学、东南大学、上海交通大学团队;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。22
  • 问题与方法:AnySearch 先在 curriculum RL 中注入显式 budget state 和结构化 reasoning scaffold,再移除 scaffold,在自适应采样预算下训练。复合 reward 同时考虑 answer accuracy 与 budget efficiency,改动发生在训练策略和轨迹预算。22
  • 结果与证据:七个 general/multi-hop QA benchmark 上,模型跨预算优于 baseline,并泛化到未见约束;摘要没有给出每个预算点的曲线、训练成本、重复运行和完整提升幅度。22
  • 局限与关系:预算感知策略适合播客脚本研究的“少搜、深搜、转人工”决策,但应把辅助模型调用、工具重调用、任务成功和整轨时间分别记账。
  • 结论:精读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

四、自进化与知识更新

自进化最容易被一个高分误导。需要分开问:谁在改变,谁在打分,谁被留在最终 checkpoint,held-out 是否改善,系统是否只是学会了搜索或迎合 verifier。

18. ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning

  • 作者/时间:Fanrui Zhang、Ruixue Ding、Qiang Zhang、Xi Chen、Boli Chen、Shihang Wang、Qiuchen Wang、Hongmin Zhan、Jinxin Bian 等;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。23
  • 问题与方法:ARISE-RL 用 Generator/Solver rubric-mediated co-evolution:Generator 从真实工具观察生成中等难度任务与 rubric,Solver 用细粒度 rubric satisfaction 学习;RG-SED 只有在 memory 带来经验 reward 提升时才蒸馏。方法同时改动任务生成、过程奖励和经验记忆。23
  • 结果与证据:ECR-Bench 覆盖 single-tool deep research 和 multi-tool travel planning,摘要报告所有 benchmark 上稳定 SOTA。当前摘要证据没有给出具体分数、baseline 表、seed 数量、frozen base/best/final checkpoint、held-out 曲线和回滚阈值。23
  • 局限与关系:rubric 让过程反馈变得可计算,但“稳定 SOTA”仍需要完整实验表和独立重复来支撑。它对频道目标的价值是提供一个可检验的自进化闭环:任务难度、rubric 质量、solver 学习、memory 蒸馏和外部盲测必须拆成五个验收点。
  • 结论:精读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

19. Beneath the Diff: Diagnosing and Mitigating Algorithmic Mode Collapse in Code-Level Autonomous Research Loops

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-08-31 提交,公众号栏目于 2026-09-02 发布。24
  • 问题与方法:代码级 autonomous research loop 让 LLM 提议训练管线修改、执行并保留提升 in-loop 指标的编辑。论文发现表面编辑多样性保持,semantic/mechanism diversity 却塌缩;DAPS 通过类别覆盖重加权、持久编辑记忆和验证门修复。三层协议隔离 in-loop、audit 和 blind 指标。24
  • 结果与证据:semantic cluster decay 降低 69.1%,blind/audited relative faithfulness 的相对变化为 +83.7%/+81.6%,这里的数字是相对变化,不是百分点。论文同时称 in-loop 优化速度保持;摘要没有给出该速度指标的定义或数值。摘要还没有披露完整任务、模型和样本规模;relative faithfulness 是该循环定义的指标,不能直接换写成真实研究质量。24
  • 局限与关系:这是本批最直接的 reward hacking 警报之一。播客自动选题或脚本迭代可以把未被循环访问的事实、引用完整性和听者评测设为 blind audit,避免自进化只优化内部评分器。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

20. Synthetic Worlds for Temporal Evaluation and Knowledge Updating in LLMs

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-08-31 提交,公众号栏目于 2026-09-02 发布。25
  • 问题与方法:ParallelEvents 生成虚构但连贯的未来世界和事件轨迹,以避开真实语料污染,同时保留时间一致性;Synapse 用生成数据做 mid-training 与 instruction tuning,测试参数化知识的写入和更新。25
  • 结果与证据:摘要报告 Synapse 在一个未明确命名的指标上相对既有方法提升 14.23%;摘要没有明确该指标的口径和比较 baseline,因此这不能直接写成无条件的性能提升。当前摘要还没有给出旧知识保持、冲突消解、训练成本和遗忘曲线。25
  • 局限与关系:虚构世界可控制,真实播客知识还要面对来源时效、错误传播和说话人归属。它适合启发节目人物、事件和时间线的更新测试,但不能直接证明真实音频知识更新有效。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

21. From Base Rollouts to RL Reasoning: A Budgeted Search Perspective

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。26
  • 问题与方法:UDF 把 token sampling、beam/tree search 和 sequence resampling 放进共同的 budgeted operating space,用 pass@k、self-consistency、best-of-N 和 first-finish success 比较 paired Base/RL checkpoints,并提出 BOPTR:N_Base≈αN_RL^β。BOPTR 表示 Base 与 RL rollout budget 之间的经验对应关系,αβ 是按 benchmark 和 cohort 拟合的参数,不是理论常数。26
  • 结果与证据:Qwen2.5-7B 的 transfer error 为 3.41 个百分点,95% CI 为 [2.32, 5.53];三 seed 结果为 3.07±0.39 个百分点。扩展到 10 个模型、4 个家族时为 3.28–4.87 个百分点,未拟合 benchmark 为 5.03 个百分点。26
  • 局限与关系:作者把结论限定为 recipe/cohort 的行为诊断,而非参数级等价性证据,实验也未覆盖真实工具轨迹。它提醒研发团队:播客脚本 agent 的多候选采样、重排和预算曲线,应与“模型是否学会新能力”分开。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

22. Autoresearch for Marketplace Catalogs: From Legacy Forms to AI-Native Matching

  • 作者/时间:Thumbtack 团队;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。27
  • 问题与方法:生产环境中的 autoresearch loop 按 occupation 独立执行 propose–evaluate–keep;6-rubric LLM judge 加 7-critic persona panel,另用 parity-mapping 将 legacy form Q&A 映射到新 taxonomy。27
  • 结果与证据:系统自 2026 年 4 月起覆盖 132 个 occupations。摘要给出生产覆盖和评估结构,未给每轮改动的成功率、人工 QA 抽检比例、held-out 结果与回滚记录。27
  • 局限与关系:生产部署说明 harness 与人工接口的重要性,尚不足以证明自进化算法本身带来稳定能力提升。它适合与 ARISE-RL、Beneath the Diff 对照:一个重真实循环,一个重训练闭环,一个重独立审计。
  • 结论:值得扫读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

23. Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。28
  • 问题与方法:论文用 metamorphic testing 生成保持数学意义的等价答案变体,审计 verifier 而非 model。四个 verifier 共 307,420 个 verdicts,按 answer category 分解 false negatives。28
  • 结果与证据:self-validation 在同一输入上为 53.8%–95.2%,差距 41.3 个百分点;同一题库中的等价答案变体,在两种 verifier 配置下有 49.9% 的 paired verdict 不一致;默认 LaTeX 配置下 93.0% in-contract failures 集中在空格/标点;numeric cascade 在 10^4 阈值处把 off-by-one 错误接受率从 0% 跳到 100%。28
  • 局限与关系:数学 verifier 的错误比例不能直接迁移到音频 judge。可迁移的是测试方法:对播客事实、引用、格式和 TTS 文本奖励做语义等价改写、数字变体、标点变体与 ASR 噪声测试。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

24. EvoSCM: Scientific Belief Revision Through Causal Model Evolution and Experimentation

  • 作者/时间:中山大学、清华大学团队;arXiv v1 于 2026-09-02 提交,公众号栏目于 2026-09-02 发布。29
  • 问题与方法:EvoSCM 维护 competing structural causal model hypotheses,循环执行 abduction、discriminative intervention、falsifiable prediction、experiment、error-derived correction 和 deductive validation。29
  • 结果与证据:在 DiscoverPhysics 上,摘要报告 EvoSCM 比 baseline 更准确,也更有效利用实验交互;具体准确率、交互次数、重复运行和模型清单尚未在摘要中报告。29
  • 局限与关系:可修订、可证伪的 belief state 与自由文本假设有清楚区别。对研究型播客 agent,这条线可以落实为“候选解释—区分性证据—保留/退役”的状态,而不是把一版脚本观点永久写进记忆。
  • 结论:值得扫读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

五、TTS 文本入口与音频评测边界

本批音频线的结论需要分层看:TTS-friendly 文本属于生成入口;codec 负责语音表示;生成器归因负责来源审计;音乐属性评测负责验证“自动指标是否贴近人评”;ASR 与副语言论文属于上游理解。它们回答的题目不同。

25. Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。30
  • 问题与方法:论文把 TTS-friendly generation 定义为 preference alignment,构建 CORA 与 Recipe 两个成对偏好数据集,比较 FaST 和多种 alignment baseline。目标是让 LLM 在生成文本时处理数字、标点、句长、歧义和口语可听性。30
  • 结果与证据:CORA 与 Recipe 各使用 5 个 train/validation/test splits,平均 over 5 folds;CORA validation/test 各 81 条,Recipe 各 100 条。FaST 通常处于 TTS-friendliness/helpfulness Pareto frontier,10-sample 训练时优势更明显,100-sample 时 SFT 具有竞争力。CORA 第一 split 的 MUSHRA 听测抽取 20 个问题,Pocket TTS、100M、alba voice、24 kHz mono、CPU,最终 Prolific QC 为 N=14;heuristic 与 80 个 utterance-system pairs 的 MUSHRA 均值 Spearman ρ=.84、p≪.001,FaST/DPO 各为 .74,Prompting 为 .54,Oracle 为 .13。每个 approach 的五折平均不是五次独立训练的统计保证。31
  • 局限与关系:论文输出的是 TTS-friendly 文本,不是语音波形;FaST 可能生成更长文本,长篇播客、多语言和 end-to-end speech LLM 尚未验证。官方主代码、数据和指标为 tts-friendly-gen,PolyNorm 的英文示例重实现使用 ml-speech-polynorm-bench。对播客脚本最直接的迁移是把文本规范化放到 TTS 之前,并同时保留文本可读性、ASR 可懂度、说话人保持和听者判断。32
  • 结论:精读;本批最直接的 TTS 迁移项。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

26. BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。33
  • 问题与方法:BiMTokenizer 是约 1.1 kbps 的单塔 speech codec,采用双向 Mamba/状态空间 backbone、Residual Spherical Leech Quantization,并用冻结的 Whisper-small 或 SenseVoice-small 作为 semantic teacher,配合 Vocos vocoder。33
  • 结果与证据:Seed-TTS-Eval 的 test-en 为 WER 1.87%、SIM 0.59、UTMOS 4.11;test-zh 为 WER 1.72%、SIM 0.65、UTMOS 3.30。与 Spark-TTS 的中文结果相比,Spark-TTS 的 WER 1.20% 更低、SIM 0.67 更高。官方 README 还报告 test-clean 的参数量 253M、14.82G MACs、RTF 0.007。3435
  • 局限与关系:双向 backbone 依赖未来帧,当前结果不能直接当作流式方案;196,560-entry codebook 也会扩大自回归 TTS 的预测空间。论文没有把主观 MOS、长播客段落质量或完整 TTS 质量基准作为系统结论。它适合提供 WER+SIM+UTMOS 的多指标参考。
  • 结论:值得扫读;TTS 高迁移价值近邻。
  • 入口语音与音频学术速递[9.2] · arXiv 原文 · 官方代码

27. Perceptible or Not? Diagnosing Passive Fingerprints for Speech Deepfake Attribution

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。36
  • 问题与方法:PIPDP 研究语音生成器留下的被动指纹,测试 residual energy、reproducibility、saliency,以及 phase、high-frequency dithering、envelope smoothing、bit-depth dither 和 band notch 等感知透明扰动。实验覆盖 10 个 speech generators、25,000 条合成 utterances、3 个 attribution detectors,并在 VCTK 与 ESD 上做闭集 10-way attribution。36
  • 结果与证据:中等 bit-depth dither(b=10)使 WavLM-AASIST accuracy drop 29.9%,w2v-bert-MLP drop 48.2%;同时 ΔDNSMOS 为 0.205、STOI 为 0.9909,transparent ratio 为 94.4%。20 人听测 40 条 utterances;Fleiss κ 为 0.82,衡量听者对“扰动是否可感知”这一标签的一致性。36
  • 局限与关系:闭集归因、VCTK/ESD 和 10 个生成器限制了外推;论文没有提供完整 TTS 质量基准、真实播客混音条件、MOS 或系统级用户效用。它可迁移到合成语音来源审计,却不能代替自然度、可懂度和说话人相似度评测。
  • 结论:值得扫读;TTS 评估近邻。
  • 入口语音与音频学术速递[9.2] · arXiv 原文

28. On the Human and Computer Alignment of Attribute-Based Music Matches

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。37
  • 问题与方法:MATCHA 用 300 个 triplets、83 位音乐专家和 1,105 条属性级判断,比较 melody、harmony、rhythm、voice、timbre 五种属性的人评与计算指标对齐。样本包括 150 个 human-composed 与 150 个 AI-generated triplets,AI 部分含 Stable Audio Open 与 AI-Media。37
  • 结果与证据:melody agreement 超过 85%、κ 约 0.60;case-level agreement 平均 77.3%(SD 12.4%)。AS subset 指 Stable Audio Open 生成的 120 个 triplets;该子集的计算指标与人类属性判断之间的 Kendall τ 为 −0.11–0.21,多数不显著。这里的 Kendall τ 衡量计算指标排序与人评排序的对齐程度;不同指标在不同属性上互补,未出现覆盖全部属性的单一指标。37
  • 局限与关系:音乐属性体系不能代替 WER、SIM 或 TTS MOS,也不能替代播客的事实与叙事评估。可迁移的部分是“属性分解+多人判断+逐属性检验自动指标”,例如把内容清晰、韵律、音色、背景混音和伪影拆开测。
  • 结论:值得扫读;生成音频感知评测近邻。
  • 入口语音与音频学术速递[9.2] · arXiv 原文 · 官方代码与演示

29. Topic Matching in the Wild: Benchmark and Lessons from Real-World ASR Transcripts

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-08-27 提交,公众号栏目于 2026-09-02 发布。38
  • 问题与方法:论文从真实 contact-center phone conversations 构造人工标注的 topic–utterance judgments,比较 regex、zero-shot sentence embedding 和 Gemini LLM matcher,也比较 keyphrase 与 natural-language description 两种 topic 表示。输入具有口语重复、缺少标点和 ASR 错误。38
  • 结果与证据:摘要称 lightweight LLM 加 natural-language descriptions 在 topic–utterance 匹配效果上表现最好;具体绝对分数、噪声分层结果和实时延迟仍未报告。这里的“最好”只指匹配效果的相对比较。38
  • 局限与关系:联络中心短 utterance 与长播客段落分布不同。它仍可直接启发章节主题检测、广告/品牌提及和实时 coaching card,但迁移实验需要重新控制长上下文、说话人和跨语言条件。
  • 结论:邻近跟踪。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

30. Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。39
  • 问题与方法:研究 Whisper-large-v2、Qwen2-Audio-7B-Instruct、Qwen2.5-Omni-7B 和 Chroma-4B,在 Expresso 的 4 名说话人、7 种 speaking styles 上用 CKA、LOSO linear probing、open-ended tone prediction 和 content-prosody leakage ratio 分析副语言信息。39
  • 结果与证据:late-encoder probing 指在编码器后段表征上训练线性探测器,其准确率约为 82%–85%;tone accuracy 为 19.7%–53.7%,chance 为 14.29%;总体 Omni 为 53.7%,Qwen2-Audio 为 19.7%,Chroma 为 22.6%。content-driven leakage 在 Qwen2-Audio 为 97.7%、Chroma 为 84.4%、Omni 为 27.2%。论文用 NMI(normalized mutual information,归一化互信息)刻画内容与风格表征的共享信息;较高的 content-driven leakage 表示探测结果更可能由文本内容而非独立的副语言风格信号驱动。39
  • 局限与关系:四名说话人和单一 speaking-style 设置限制人口泛化;NMI leakage 也受文本熵影响。论文测的是语音理解中的副语言表征,不能当作 TTS 风格可控性、自然度或播客连贯性结果。它适合提醒评测者把内容保持、韵律控制和模型是否使用副语言信号分开。
  • 结论:邻近跟踪。
  • 入口语音与音频学术速递[9.2] · arXiv 原文

其余直接命中:值得扫读

以下五篇补齐本批直接命中清单。它们分别落在研究 agent harness、自动化发现、上下文编译、技能实际使用和参数知识审计;结果字段继续保留指标口径与证据边界。

31. Dr. Claw: An AI Scientist Workspace for Vibe Research

  • 作者/时间:作者团队与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。40
  • 研究问题与方法:Dr. Claw 在现有命令行 coding-agent executor 外包裹可控、可审计、human-in-the-loop workspace,用 persistent state objects、skill library 和 multi-executor coordination 把规划、执行、写作连成可恢复轨迹。改动位置是 harness 与研究工作流,模型权重保持在同一 backend 对照中。40
  • 结果、证据与局限:与同 backend 的 bare CLI agent 对比,摘要报告 research completeness 更高并保留审计过程;完整分数、任务数量、独立重复和人工介入成本未报告。官方仓库为 OpenLAIR/dr-claw,许可为 AGPL-3.0。4041
  • 与目标研究线的关系:它提供研究 agent 的状态对象、技能库和审计轨迹基线;播客研究 agent 可以把选题、证据卡、音频任务和发布状态变成可恢复对象。
  • 结论:值得扫读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

32. Agentic Empirical Asset Pricing: Methodological Foundations

  • 作者/时间:Yingjian Pan 等;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。42
  • 研究问题与方法:AEAP 定义 agent 自主完成 empirical asset-pricing discovery 的范式,提出 reference architecture、discovered-factor evaluation standard 和 discovery-system out-of-sample backtest。SEADS 与 5 个 reimplemented baselines 在 2 个 US equity panels 上比较,并以 rolling re-execution 检查过程可靠性。42
  • 结果、证据与局限:作者指出单一 metric 不能稳定排序 discovery system;摘要没有给出完整效果量、面板细节、重复运行分布或交易成本。证据支持“过程重现性应进入评估”,尚不足以给出系统排名。42
  • 与目标研究线的关系:播客研究 agent 也应同时报告发现质量、来源重放、时间外验证和成本,而非只展示一篇最终稿。
  • 结论:值得扫读。
  • 入口人工智能学术速递[9.2] · arXiv 原文

33. Compile, Don't Memorize: A Context Compilation Architecture (CCA) for In-Context Learning

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。43
  • 研究问题与方法:CCA 把 prose context 编译成 typed IR,固定 rules、output_spec、available_tools、data_profile,再接 executable verifiers 和 violation-gated correction loop。它改的是上下文 harness 与校验协议。43
  • 结果、证据与局限:CL-bench 含 1,899 tasks、4 个 open base models;vanilla→CCA 的 overall pass rate 为 Kimi 15.4%→21.4%、GLM 16.1%→21.2%、DeepSeek 15.0%→17.7%、Qwen3 11.9%→12.4%。LongBench-v2 上 CCA 53.88 低于 vanilla 57.85,adaptive router 为 60.24;CCA full wall-clock 约为 vanilla 1.6 倍。主结果使用 paired McNemar,全文未见多 seed 独立重复或主结果置信区间。4344
  • 与目标研究线的关系:长程播客研究/制作 agent 可以先编译节目规范、版权禁区、音频工具和引用格式,再执行并校验;规则密集任务的收益与整体低通过率必须同时保留。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

34. Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。45
  • 研究问题与方法:论文提出 Retrieval-Invoked Actual-Use Effect(RAE),只在 agent 实际检索 skill 的任务上比较 matched skill-enabled 与 skill-disabled execution,并把失败链拆成检索、返回技能、理解/grounding/synthesis 和 final format。45
  • 结果、证据与局限:评估 17 个 LLM、MBPP+、HumanEval+ 和 Math500。Math500 上 Llama-3.3-70B 的 aggregate lift 为 +14.2 个百分点,RAE 为 −39.4 个百分点;Gemini-2.5-Flash-lite 为 +13.2 与 −11.0 个百分点。MBPP+ 的 DeepSeek-V3.2 三个 partition seeds 为 −9.1/−15.4/−23.1;这些 seeds 是数据划分重复,不是多次训练。20,000 paired multinomial bootstrap 和 exact McNemar 支持敏感性分析,训练重复与部署成本未报告。45
  • 与目标研究线的关系:播客制作 agent 调用转录、事实核查、发音和版权技能时,应做同任务有/无技能的反事实对照,单独记录技能解释和最终合成是否真的受益。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

35. LLMPEDIA: Browsing, Verifying, and Comparing the Parametric Encyclopedic Knowledge of LLMs

  • 作者/时间:作者与机构以 arXiv v1 页面为准;arXiv v1 于 2026-09-01 提交,公众号栏目于 2026-09-02 发布。46
  • 研究问题与方法:LLMPEDIA 从 GPT-5-mini、DeepSeek-V3.2、Llama-3.3-70B 三个模型家族无 retrieval 递归生成约 1.3M articles,抽取 atomic claims,再与 Wikipedia/curated web stack 审计支持、反驳或 insufficient,提供 claim-level 和跨模型浏览视图。46
  • 结果、证据与局限:均匀随机样本的 true rate 为 68.4%;论文把它与 MMLU 报告的高于 90% 的结果作口径对照,差距超过 21 个百分点,但两者的样本、标签和任务定义不同,不能当作同一 benchmark 分数的直接差值。30.5% claims 被归为 insufficient。审计依赖 Wikipedia/web stack,摘要未报告每模型细分、时效漂移和播客知识更新结果。46
  • 与目标研究线的关系:研究 agent 可把每个播客断言绑定来源、时间、模型差异和 insufficient 状态,形成可回放的 claim ledger;参数知识与外部证据必须分开。
  • 结论:精读。
  • 入口自然语言处理学术速递[9.2] · arXiv 原文

研发验收检查表

状态与记忆

  • 是否把状态保持、检索命中、引用正确、失效遵守、冲突处理和删除后重答分开测?
  • 是否能从每个长期事实回到事件、时间、来源和版本?
  • 压缩或事件合并后,是否保留跨段关系,而不是只保留孤立句子?
  • 前瞻性任务是否有可验证的触发、完成、取消和过期状态?

工具与环境

  • 是否分别记录动作类别选择、工具执行结果、最终交付和副作用?
  • 是否在 action-commit 前检查权限、provenance、目标对象和不可逆程度?
  • 工具、插件或 prompt 改动后,依赖清理、版本回滚和异步状态是否仍正确?
  • 是否在真实时序环境中记录延迟反馈、恢复成本、token 和整轨墙钟时间?

轨迹与证据

  • 是否有 silent fault 注入,能识别“结果碰巧正确、过程已经错误”的轨迹?
  • 是否给中间事实、来源和步骤分配可解释的效用,而不是把全部 reward 压到最终答案?
  • 是否把 evidence confidence 与 answer confidence 分开?
  • 是否保留多个假设分支,并在 commit 前比较独立证据?
  • 错误归因是否使用反事实或干预,而不是让最终 judge 猜一个 root cause?

自进化

  • 是否同时保留 frozen base、best checkpoint、final checkpoint 和 held-out 结果?
  • 是否预先固定随机种子、重复次数、回滚阈值和停止条件?
  • 是否把模型权重、harness、技能库、记忆、轨迹表示和 verifier 的变化逐项消融?
  • 是否检查 semantic/mechanism diversity、失败转成功和成功转失败,而非只看 self-judge 或 in-loop reward?
  • 是否为 verifier 做语义等价改写、数字/标点变体和未被循环访问的盲测?

TTS 与长音频

  • 文本端是否分别记录数字/标点规范化、句长、歧义、TTS→ASR、WER、SIM、UTMOS/MOS 和听者判断?
  • TTS 生成是否区分整段再合成与局部编辑,并记录 Refiner、迭代上限、延迟和调用成本?
  • 长播客是否分开测输入长度、事实定位、事实理解、跨段推理和最终用户行动?
  • 音频质量是否同时包含自动指标、主观听感、说话人保持、表达控制、生成器取证和调用率?
  • 是否设置“无生成调用”对照,证明音频调用本身带来的增益?

精选原文阅读顺序

第一组先读长程可靠性与记忆:
  1. Long-Horizon State Tracking
  2. Making Prospective Memory SLM-Shaped
  3. Invalidation Contracts
  4. EM²Mem
  5. ClinTraceBench
第二组再读工具边界、轨迹和自进化:
  1. OpenAgentFlow
  2. Control-Data Flow Separation
  3. Calibration is the Bottleneck
  4. trajectory-judge
  5. Dense Process Supervision
  6. DualStake
  7. Explore Before Committing
  8. ARISE-RL
  9. Beneath the Diff
  10. From Base Rollouts to RL Reasoning
  11. Where the Verifier Fails
第三组处理 TTS 文本入口和音频迁移:
  1. Ready to Speak
  2. BiMTokenizer
  3. PIPDP
  4. MATCHA
  5. Topic Matching in the Wild
  6. Heard but Not Heeded
以下 22 篇是从 30 篇直接命中与 5 篇邻近项中挑出的精选阅读顺序,不构成 35 篇论文的全量排名。其余 11 篇直接命中仍按正文中的“精读”或“值得扫读”结论安排阅读:
本批最值得带回工程实验的判断有三条:第一,先定位长程失败发生在状态、动作、轨迹、交付还是副作用;第二,自进化先证明盲测和 held-out 改善,再讨论是否学到了新机制;第三,TTS 与播客评测要把文本、语音、听感、来源审计和最终行动分开。

References

  1. 1
  2. 2
  3. 3
  4. 4
  5. 5
  6. 6
  7. 7
  8. 8
  9. 9
  10. 10
  11. 11
  12. 12
  13. 13
  14. 14
  15. 15
  16. 16
  17. 17
  18. 18
  19. 19
  20. 20
    EDGE arXiv v1

    arxiv.org

  21. 21
  22. 22
  23. 23
  24. 24
  25. 25
  26. 26
  27. 27
  28. 28
  29. 29
  30. 30
  31. 31
  32. 32
  33. 33
  34. 34
  35. 35
  36. 36
  37. 37
  38. 38
  39. 39
  40. 40
  41. 41
  42. 42
  43. 43
  44. 44
  45. 45
  46. 46

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel