
8月31日论文雷达:上下文开始主动管理,音频调用开始接受审计
本期从主动上下文、程序性记忆和多轮交互一路追到生成式音频调用审计,帮助读者按证据强弱决定哪些原文先读、哪些结果值得复验。
8 月 31 日:从主动上下文到音频调用审计
本期候选来自 2026 年 8 月 31 日的 自然语言处理学术速递 与 语音与音频学术速递。论文入口、实验数字和局限以各论文的 arXiv 原文为准;栏目条目只决定候选是否进入本期。
本期收录 18 篇:13 篇直接命中,5 篇邻近跟踪。直接命中集中在长程上下文管理、外部记忆、工具调用可靠性、多轮用户仿真、技能与轨迹训练,以及生成式音频调用和跨语言韵律。音频栏目共有 7 篇候选,其中 6 篇达到本期收录门槛;收录项落在 TTS/语音模型评估、语音增强、音频质量和音频表征几个层面。播客生成与播客评估在这 7 篇候选中为空。
“精读”表示论文的问题、方法和证据都值得优先打开原文;“值得扫读”表示结论有用,但实验范围或方法贡献更窄;“邻近跟踪”表示论文落在本频道目标线旁边,迁移接口清楚,直接结论需要留在它自己的任务范围内。本频道目标线包括大模型长程任务训练与评估、轨迹学习与自进化、TTS 生成与评估,以及播客生成与评估。
| 阅读层级 | 论文 | 先看什么 |
|---|---|---|
| 直接命中·精读(8 篇) | 2608.28476、2608.27924、2608.28439、2608.28378、2608.28405、2608.27729、2608.28478、2608.27661 | 主动上下文、程序性记忆、调度级观测、多轮仿真、种子稳定性、完整回忆与生成前路由 |
| 直接命中·值得扫读(5 篇) | 2608.27505、2608.28458、2608.27672、2608.27848、2608.27817 | 准则引导 RL、局部故障修复、分阶段轨迹训练、跨语言韵律、生成式音频调用的边际价值 |
| 邻近·值得跟踪(5 篇) | 2608.27925、2608.28493、2608.28472、2608.27698、2608.28127 | 证据召回与答案质量、低功耗语音处理、OOD 音频损失、处理表征与评测迁移 |
下文的数字尽量保留原论文的指标和比较对象;每个结果仍只在它所属的模型、数据集和实验条件内成立。不同论文的
Accuracy、F1、MOS、WER、VSTOI 或 judge 分数之间不构成统一排行榜。先把“改了什么”分开
本批最容易混在一起的论文,实际改动位置相差很大。ContextPilot 改训练时的上下文管理工具与 RL 信用分配;Agent Memory 与 Entity-Memory Graph Retrieval 改外部记忆表示或检索;ElephantBench 测参数记忆能否完整保留互相冲突的说法;PersonaForge、CultureConverse 改多轮交互 harness 与用户仿真;Acquire, Repair, Preserve 与 First Make It Playable 改小模型的训练配方;Below the Noise Floor 改多种子评测;Fidelity Is Not Enough 改运行时观测;Knowing Before Answering 改生成前路由。123
音频两篇直接命中也处在不同层:Is Prosody Lost in Translation? 给表达性语音翻译和 TTS 的韵律迁移提供观察性证据,Auditing Generative Audio Calls 则把转写、音频编码器和生成式音频调用放进同一套受控消融。四篇邻近论文分别改去噪模型、采样表示、可微损失和音频变换嵌入。456 读者做复现实验时,先记录“动了哪一层”,再比较结果。
长程上下文、记忆与可靠性
长程方案至少要拆成五个问题:内容何时进入记忆,驱逐后能否找回,压缩是否保真,写入是否去重,以及经验有没有内化进参数。本批论文各自覆盖其中一两项,单一“记忆准确率”无法代替这张清单。ContextPilot、Agent Memory、ElephantBench 和 Entity-Memory Graph Retrieval 分别提供了上下文编辑、行为记忆、参数记忆完整性和证据召回的样例。1
- ContextPilot 把上下文编辑动作变成可训练的决策:计划、长期记忆读写、摘要、压缩、折叠历史和软卸载都成为工具;细粒度 RL 用上下文与熵变化估计灵敏度,按 snapshot 分配信用,再用 GRPO 更新。它同时改变了工具层和训练层,模型架构保持原样。
- What Makes Agent Memory Useful for Reliable Unanswerable Question Handling? 把记忆带来的收益拆成“决策指导”和“轨迹塑造”,并比较描述型、规则型与程序型记忆。这个问题直接对应记忆准入之后如何影响拒答和查证。
- ElephantBench 测闭卷参数记忆能否同时回忆同一长尾知识点的两个冲突版本。最强模型的“完整回忆”与“至少回忆一个版本”之间存在很大差距,评测者应把两者分开。
- Knowing Before Answering 在生成前从 hidden state 解码 Answer、Refuse、Conflict 三种状态。它把“相关记忆是否把推理带偏”转成可插入 agent harness 的路由闸门。
- Entity-Memory Graph Retrieval 只对证据召回做出稳定改善,最终答案 F1 没有得到对应支持。这个边界恰好提醒读者区分“找到了证据”和“答案因此变好”。
轨迹、技能、自进化与工具观测
本批的训练类论文可以按经验落点排列:PersonaForge 与 CultureConverse 先改变交互数据和用户反馈;Acquire, Repair, Preserve 与 First Make It Playable 改局部监督与成功轨迹的使用方式;A Survey on Rubric-Guided Reinforcement Learning for Language Models 提供准则和奖励设计的地图。Fidelity Is Not Enough 把失败从结果值追溯到工具调度记录,Below the Noise Floor 则说明一次运行无法发现小模型蒸馏的双峰崩溃。2
这些工作的共同读法是:长程完成度、失败复现、过程奖励、候选选择和成本必须分开记账。技能数量增加、平均输出变短或一次 pass@1 提升,都不足以单独说明系统已经形成可迁移能力。
直接命中:重点精读
ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL(2608.28476)
- 作者与来源:Zhuoshi Pan、Qizhi Pei、Junru Lu、Honglin Lin、H. Vicky Zhao、Di Yin、Xing Sun,来自清华大学、上海人工智能实验室和腾讯 Youtu Lab;arXiv v1 提交于 2026 年 8 月 28 日,论文标注录用 EMNLP 2026 Main Track。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.28476。
- 研究问题与方法(改动层):长程任务的工作上下文会持续增长。ContextPilot 扩展工具集,加入
plan、memorize/readMemory、summarizeContext、compressContext和foldHistory等动作;训练时用上下文与熵变化的灵敏度分数做 partial rollout 分支采样,再在 snapshot 级别分配信用,使用 GRPO 优化。改动层是 harness 工具与 RL 训练,模型架构没有变化。1 - 数据、流程与评测:长上下文问答的 SFT 数据来自 NovelQA PublicDomain 与 NarrativeQA 训练集,RL 使用 LongBench-v2 训练集;深度搜索实验使用 OpenSeeker 11K 样本。实验覆盖 Qwen3-8B/14B、Gemma4-E4B-it、WebSailor-7B 和 WebExplorer-8B,使用 verl;每个 query 最多 128 个 snapshot,推理预算约为 30K 输入和 2K 输出。评测包含 NovelQA Copyright、∞Bench En.MC、LongMemEval-S、BrowseComp+、GAIA、BrowseComp、BrowseComp-ZH 与 xBench-DeepSearch;多选题使用精确匹配,其余任务使用 LLM judge,每种方法运行 3 次。1
- 关键结果:在长上下文四个基准(NovelQA Copyright、∞Bench En.MC、LongMemEval-S、BrowseComp+)的平均准确率上,8B 的 ContextPilot-RL 为 69.40,StateLM-RL 为 65.85;14B 的对应数字为 72.20 和 70.11。在论文报告的对应骨干和上述四基准平均口径中,RL 相对对应 SFT 的平均提升为 3.62 个百分点;BrowseComp+ 的提升为 5.34 个百分点。在 Qwen3.5-397B-A17B 的工具消融中,原始工具、加入规划、加入软卸载、再加入长期记忆的平均分依次为 77.89、80.29、83.08、87.16;BrowseComp+ 从 63.49 升至 80.96。WebExplorer-8B 每轮输入约 30K 且线性增长,ContextPilot-8B 稳定在约 8–10K。1
- 证据强弱与复现条件:证据强。论文覆盖多个骨干和任务,报告 3 次运行的均值与标准差,并给出工具消融、代码仓库 Tencent/ContextPilot、项目页 和 模型集 入口。SFT 依赖人工编排的 harness 规则与教师模型;每轨迹的 snapshot 数和预算有限;BrowseComp+ 使用固定语料,不能替代联网搜索复现。工具消融使用闭源 Qwen3.5-397B-A17B,复现者需要把这项结果与开放模型实验分开记录。1
- 与目标线的关系与结论:这篇论文把“什么时候压缩、为什么保留、哪次编辑起作用”变成可学习动作,直接连接长程任务训练、记忆工具和轨迹信用分配。结论:精读。 原文优先看 snapshot-level credit assignment、工具消融和 token 曲线,再判断收益来自工具设计还是 RL。
What Makes Agent Memory Useful for Reliable Unanswerable Question Handling?(2608.27924)
- 作者与来源:Chuanyuan Tan、Junjie Yu、Yuxin Wang、Yining Zheng、Xipeng Qiu、Wenliang Chen,来自苏州大学、苏州城市学院、复旦大学和上海人工智能实验室;arXiv v1 提交于 2026 年 8 月 28 日。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.27924。
- 研究问题与方法(改动层):论文询问外部记忆是否能改善无答案问题处理,以及哪一种记忆内容更有效。统一的 agentic RAG 框架比较 Expel、MemEvolve、AWM 和 AgentKB;作者把记忆的作用拆成决策指导与轨迹塑造,再按描述、规则和程序三类内容做受控消融。改动层是外部记忆表示、检索和复用。7
- 数据、流程与评测:ReAct agent 使用 Wikipedia API,最多运行 10 轮。KUQ、UAQFact 与 RefuNQ 各有 400 个平衡测试样本,前两个数据集各用 200 个训练样本建记忆库;每次最多检索 2 条记忆。指标包括可回答问题精确匹配的
Acc、LLM judge 评估无答案可接受率的AR,以及JS=0.7·Acc+0.3·AR;基座是 DeepSeek-V3.2 与 Qwen3-235B-A22B-Instruct-2507,每个 query 运行 3 次。7 - 关键结果:在 DeepSeek-V3.2 上,记忆带来的平均变化为 ΔAR +11.27、ΔAcc −2.14、ΔJS +1.88 个百分点;在 Qwen3-235B 上为 +2.93、−2.54、−0.90 个百分点。增益主要落在更谨慎的无答案处理,而非可回答问题的准确率。论文在 KUQ 的一组配置中报告,程序型
workflow记忆达到 JS 53.37,无记忆为 41.55;compact trajectory+workflow组合达到 56.07。原文没有标出这组三个分数对应的基座模型。论文还报告跨模型复用时 AWM 的 JS 为 46.53,比该实验的无记忆基线高 4.98 个百分点;记忆迁移方向原文未报告。7 - 证据强弱与复现条件:证据中强。论文有受控内容消融、3 次运行和人工验证,但正文没有报告显著性检验。实验只覆盖两个基座、三个数据集、单一 Wikipedia 环境,记忆库规模为 200 个样本;作者将决策指导与轨迹塑造的拆分作为功能证据,尚未建立严格因果分解。代码入口为 MemUAQ。7
- 与目标线的关系与结论:论文把“存更多原始轨迹”与“保存可复用行为规则”分开,直接服务记忆内容设计和可靠性评测。结论:精读。 原文优先看程序型记忆的构成,以及 AR 上升、Acc 下降并存时如何解释系统行为。
Fidelity Is Not Enough: Dispatch-Level Instrumentation for Agentic Datasheet Extraction(2608.28439)
- 作者与来源:Qing Ye、Meng-Hsuan Lin,英飞凌科技;arXiv v1 提交于 2026 年 8 月 28 日,论文标注录用 EMNLP 2026 Industry Track。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.28439。
- 研究问题与方法(改动层):数据表提取只看保真度时,模型可能在工具被禁用后仍然生成看似合理的答案。论文记录每次工具调用的 dispatch 轨迹,用规则分类失败原因,并用“调用过哪些工具”检测静默失败;一个通过实物测量验证因果关系的独立装置作为 oracle(原文称“causality chamber”)。改动层是运行时可观测性和评测协议,模型权重保持不变。8
- 数据、流程与评测:内部 agentic 基准包含前三个组件的 25 条手工主张和第四个组件的 12 条主张,共 37 条;三套已部署模型栈完成 207 次干净且保真通过的提取,另有 50 个刻意植入的“扣留工具”故障。三套模型栈的具体名称原文未报告。检测器只检查工具调用记录,不检查提取值本身。8
- 关键结果:在 207 次干净提取上,检测器出现 0 次误报;在 50 个植入故障上恢复 50/50。结构化输出约束曾静默禁用工具调用,模型继续作答并伪造源文本,保真度仍判为通过,而 dispatch 轨迹暴露了故障。论文也明确说明,调度级规则对“工具已经调用但答案错误”的检测能力尚未测量。8
- 证据强弱与复现条件:证据中等。真实部署经验和构造故障形成了清楚的警示,但基准属于内部手工构建,样本量较小,因果舱只验证 37 条主张中的 2 条;代码情况原文未报告具体可访问链接。读者应把“构造性召回”与自然故障下的召回分开。
- 与目标线的关系与结论:这篇论文给工具调用可靠性提供了最小 instrumentation 单元:把“结果看起来对”与“系统按约定调用了工具”并列记录。结论:精读。 原文优先看静默禁用工具的故障链,再把 dispatch 日志加入自己的 agent harness。
PersonaForge: Realistic Multi-Turn User Simulation for Agentic Systems(2608.28378)
- 作者与来源:Hanglong Lv、Dawei Zhu、Lei Li、Bowen Ye、Huaqiu Liu、Yifan Song、Bofei Gao、Weimin Xiong、Jinhao Dong、Chenhong He、Lingpeng Kong、Qi Liu、Tong Yang、Fuli Luo,来自北京大学、小米 LLM-Core、香港大学和中国人民大学;arXiv v1 提交于 2026 年 8 月 28 日。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.28378。
- 研究问题与方法(改动层):真实 agent 交互经常包含多轮追问、纠偏和重新指定目标,而训练数据常把用户请求压成单轮完整查询。PersonaForge 用职业、MBTI、技术熟练度和知识背景组成四维人物空间,用 SOUL 行为控制提示和 connected memory 模板约束用户行为,再从真实种子查询反推人物画像。改动层是交互数据合成和评测 harness。2
- 数据、流程与评测:作者分析 16K 条真实会话,其中 SWE-chat 和 computer-use 各占 25%,内部日志占 50%;训练语料含 6.3K 会话、约 43 万条消息,平均 9.3 个用户轮次。PersonaForge-Bench 包含 138 个任务、20 多个专业域和中英双语;每项实验做 3 次,用户模拟器为 Claude Opus 4.6,判官为 DeepSeek-V4-Pro,人工验证得到 κ=0.79、r=0.84。全参数 SFT 使用 5 个 epoch、学习率 5e-5、128K 上下文和 2,550 个 A100 GPU 小时。2
- 关键结果:Qwen3.5-27B 的综合分从 76.2 升到 80.3,提升 4.1 个百分点;任务完成提升 6.0 个百分点,响应质量提升 6.8 个百分点。MiMo-V2-Flash 从 60.4 升到 76.1,任务完成提升 22.0 个百分点。在效率指标上,MiMo 的交互轮次减少 20.7%,工具调用减少 9.2%,
web_fetch减少 54.2%;留出的 Claw-Eval 任务上,MiMo 从 59.0 升到 69.1。这些结果来自 3 次独立试验,论文报告了显著性检验。2 - 证据强弱与复现条件:证据强。受控消融、显著性检验和外部任务迁移共同支持“多轮仿真比简单回放更能覆盖纠偏行为”的判断。50% 内部日志不可复现,用户模拟器和判官是闭源模型;论文提到 LoRA 复现设置,但本期没有把它当作全量训练等价物。
- 与目标线的关系与结论:多轮用户仿真是长程 agent 训练中 harness 与数据之间的接口,也能补足过程奖励的反馈来源。结论:精读。 原文优先看人物控制、真实回放基线和留出任务迁移,确认收益究竟来自交互长度还是更丰富的用户纠偏。
CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia(2608.28405)
- 作者与来源:Bryan Chen Zhengyu Tan 等 33 人,来自新加坡科技设计大学、A*STAR、EPFL、微软亚洲研究院、成均馆大学、文莱大学、南洋理工大学等机构;arXiv v1 提交于 2026 年 8 月 28 日,论文标注 EMNLP 2026。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.28405。
- 研究问题与方法(改动层):文化适配助手需要在多轮实际求助中处理身份、语境和隐含约束。CultureConverse 覆盖东亚和东南亚 10 个地区、58 个群体身份与 7 个领域,为每个 episode 设定用户、任务和评分交互,并发布可扩展的多语言模拟与评测 harness。改动层是 harness 和评测协议。9
- 数据、流程与评测:数据集包含 14,610 个评测 episode、274,295 个 oracle 引导对话,以及 27,860 条用于微调的高质量样本;实验评估 18 个模型。作者把交互效率、工具恰当性、任务完成和响应质量作为四个评分维度,并把域内微调迁移到文化多选题与安全分类基准。9
- 关键结果:论文报告,在 18 个模型的比较中 GPT-5 mini 获得最高助人质量;人工标注实验支持评测框架作为人工判断代理。具体分数、比较范围内的完整排序和“助人质量”的数值定义原文未报告。论文还报告微调后域内助人表现和域外文化多选题/安全分类表现均有提升。9
- 证据强弱与复现条件:证据中强。数据规模、harness 和人工验证构成较完整的工程证据;区域范围集中在东亚与东南亚,仿真用户也不等于真实文化交互,评测模型多为闭源。复现者需要把“可运行的 episode 设计”与“GPT-5 mini 在单一基准的排名”分开。
- 与目标线的关系与结论:它与 PersonaForge 互补:PersonaForge 主要控制通用用户属性,CultureConverse 主要控制文化身份和场景约束。结论:精读。 重点读双 split、gold-mode 对话和 episode 评分如何防止模型只靠单轮事实记忆过关。
Below the Noise Floor: Bimodal Seed Collapse and Distinct Failure Modes in Small-Model Knowledge Distillation(2608.27729)
- 作者与来源:Dipto Sumit、Sakib Ul Haque、Farig Sadeque,BRAC University;arXiv v1 提交于 2026 年 8 月 27 日。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.27729。
- 研究问题与方法(改动层):论文检验小模型知识蒸馏的微小增益能否跨随机种子保持。任务是从固定 API 目录中选出正确函数,作者比较 8 种蒸馏变体与监督交叉熵,并把错误分成函数选择错误和输出截断。改动层是训练诊断与评测协议。3
- 数据、流程与评测:医疗 API 路由基准包含 740 个实例;学生模型是 1.5B Qwen2.5-Instruct,教师是 20B MoE,候选函数数为 2–4。实验使用 QLoRA、Acc、Macro-F1 和改写一致性
PC,关键配置运行 3–6 个种子;单次运行使用 RTX A6000,约 35–50 分钟。3 - 关键结果:逐种子的标准差达到 2.8–48.7 个百分点,足以覆盖许多小于 5 个百分点的蒸馏增益。7 种蒸馏方法中,3 种出现双峰崩溃;例如
ce_KD的 5 个种子得分包含 31.5%、48.7%、62.2%、81.1%、82.0%。progressive_kd为 82.5±2.8,rank_kd为 80.9±3.9,在观测种子中保持稳定。一个reasoning_kd种子把单个 CJK 字符 U+622A 当作 EOS 替代,111 条预测中有 107 条变成None。3 - 证据强弱与复现条件:证据强。所有配置遵循同一协议,多种子和受控 split 对照足以支撑“单种子评估会漏掉核心失败模式”的判断;实验仍局限于单一医疗 API 任务、单一师生组合和至多 4 个候选函数。代码情况原文未报告具体链接,
PC在小样本上也可能有较大噪声。 - 与目标线的关系与结论:工具路由是 agent 行动链的前置环节;这篇论文把“平均分上升”与“尾部种子崩溃”放在同一张验收表里。结论:精读。 任何轨迹蒸馏、工具调用或自进化训练都应先复跑多种子,再讨论几个百分点的收益。
Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge(2608.28478)
- 作者与来源:Zhuoshi Pan、Junru Lu、Yan Qian、H. Vicky Zhao、Di Yin、Xing Sun,来自腾讯 Youtu Lab、华威大学和清华大学;arXiv v1 提交于 2026 年 8 月 28 日。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.28478。
- 研究问题与方法(改动层):闭卷模型可能记住一个长尾事实,却遗漏同一事实的另一种已被验证说法。ElephantBench 从低曝光语料聚类知识点,用实体配对和冲突边生成候选题,再经网络验证 agent 与人工审核形成 1,094 道题;评测区分完整回忆
C、部分回忆P、失败F和完整率K=C/(C+P)。改动层是参数记忆的诊断基准。10 - 数据、流程与评测:基准覆盖 32 个模型,其中 26 个开源模型和 6 个专有模型;默认打开推理,评分使用 GPT-5.6-Sol。构建过程保留文档、权威来源和人工审核链,作者还发布了 GitHub 代码、项目页 与 数据集。10
- 关键结果:完整回忆率最高的是 Kimi-K3,为 52.38%;Gemini-3.1-Pro 为 50.37%,GPT-5.5 为 50.18%。这些头部模型的失败回忆率只有约 2.19%–2.65%,说明模型多数时候能想起至少一个版本,却经常漏掉另一个。Qwen3.5 从 2B 到 397B 时,完整回忆率从 1.65% 升到 32.27%,部分回忆率从 17.00% 升到 59.23%;规模变大带来的回忆增长仍有很大部分停留在“不完整”。10
- 证据强弱与复现条件:证据强,基准构建链可审计,模型覆盖面也较广;论文仍处于 under review,评分依赖闭源 judge,题目来自公共信息语料的比例为 39.4%,闭卷设置也没有测量检索增强。暴露不对称与模型回忆之间的关系属于相关性证据。
- 与目标线的关系与结论:它为参数内化提供了“至少记住一个版本”和“完整记住全部版本”两把尺子,能与外部 Agent Memory 形成内外记忆对照。结论:精读。 重点读题目构建、
C/P/F/K的定义和闭卷/检索增强边界。
Knowing Before Answering: Decoding Language Models for Reliable RAG(2608.27661)
- 作者与来源:Syed Mahbubul Huq、Christopher Child、Tillman Weyde、Pranava Madhyastha,来自伦敦城市大学与艾伦·图灵研究所;arXiv v1 提交于 2026 年 8 月 27 日,论文标注录用 COLM 2026。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.27661。
- 研究问题与方法(改动层):检索证据不足或互相冲突时,模型是否能在生成前选择回答、拒答或标记冲突。论文在单层 hidden state 上训练轻量逻辑回归路由器,扫描各层选择最佳层,并比较 attention 与 MLP 特征;推理时不增加 token。改动层是推理期可靠性和 RAG harness,不改模型权重。11
- 数据、流程与评测:TriviaQA、HotpotQA 和 NQ 各构成 797 个三元组,共 2,391 道题和 7,173 个带标签实例;Gemini 2.5 Pro 生成反事实实体以控制参数泄漏,BM25 提供干扰文档。数据按 70/10/20 划分,覆盖 16 个 90M–32B 的语言模型;指标包括 Accuracy、Macro-F1、假作答率
FAR,并用 10,000 次 bootstrap 计算区间。11 - 关键结果:在受控三分类基准上,Qwen3.5-9B/27B 的最高路由准确率达到 0.91;部分 Qwen3.5 配置的 FAR 为 0.06–0.08。提示基线大多接近三分类随机水平 0.33。最优 hidden-state 路由相对最强提示基线最多降低 75% 的 FAR;零样本迁移到 RAGTruth 的准确率为 0.84–0.92。三分类与二分类准确率分别为 0.829 和 0.832,但三分类 Macro-F1 为 0.829 对 0.811,FAR 为 0.104 对 0.127。11
- 证据强弱与复现条件:证据强,跨模型、泄漏审计、bootstrap 和 hidden-state patching 共同支撑路由信号的存在。基准主要是受控合成诊断,路由器需要逐模型训练;长上下文、多文档和 question-first 提示会引入分布变化。代码入口为 Knowing-Before-Answering。11
- 与目标线的关系与结论:它与 Agent Memory 的 UAQ 处理、Fidelity 的工具轨迹检测构成三个不同位置的可靠性闸门:生成前判断、行动中观测、行动后验收。结论:精读。 原文优先看三分类为何比二分类更能控制假作答,以及模型专属路由器的维护成本。
直接命中:值得扫读
A Survey on Rubric-Guided Reinforcement Learning for Language Models(2608.27505)
- 作者与来源:Zifei Shan、Fangning Shao,腾讯微信;arXiv v1 提交于 2026 年 8 月 27 日,论文标注录用 Findings of EMNLP 2026。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.27505。
- 研究问题与方法(改动层):综述把结构化准则放进贝叶斯先验—后验视角,沿轴线整理 Constitutional AI、实例级 rubric、过程级监督、自进化 rubric 以及 agentic 和多模态扩展,并讨论粒度、语义漂移与奖励黑客。它提供分类框架,属于方法地图层,论文自身没有新实验。12
- 数据、流程与评测:论文是综述,实验数据、训练流程、评测基准和统计指标均为原文未报告。其价值在于给 ContextPilot 一类过程奖励、以及自进化系统中的准则更新提供共同术语。
- 关键结果:论文没有可以与实验论文并列的性能数字。证据强弱为综述证据;不同工作对 rubric 的定义并不统一,分类边界依赖既有文献。12
- 证据强弱与复现条件:复现目标是复核分类所引用的原始工作,而非运行一套新算法。对自进化论文,读者应沿“准则形成—奖励计算—策略更新—冻结控制组”逐项回到被综述论文。
- 与目标线的关系与结论:它为自进化 rubric、过程监督和 GRPO 奖励设计提供坐标。结论:值得扫读。 适合作为本期训练类论文的索引,不应把综述分类当作实证增益。
Acquire, Repair, Preserve: A Diagnosis-Guided Post-Training Recipe for Small-Model Dialogue Game Agents(2608.28458)
- 作者与来源:Nan Li,乌得勒支大学;arXiv v1 提交于 2026 年 8 月 28 日,论文属于 LM Playschool Workshop @ EMNLP 2026。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.28458。
- 研究问题与方法(改动层):2B 对话游戏 agent 的失败常落在局部决策,例如重复猜测、格式错误或违反刚看到的反馈。配方分三步:先用 SFT 获得广泛游戏参与,再用可机械验证的 turn-local 偏好对修复单一游戏族的错误,最后保留游戏外能力。改动层是训练配方与局部轨迹监督。13
- 数据、流程与评测:实验在 LM Playschool Challenge 的 Qwen3.5-2B 上进行,使用官方最终评测、
clemscore、statscore、域内/域外游戏和静态基准。训练数据、每阶段样本量、运行次数与算力细节,原文未报告;论文列出的模型卡为 Qwen3.5-2B-playpen-playornotplay。 - 关键结果:官方最终评测的
clemscore从 10.67 升至 38.92,封闭域内从 13.41 升至 41.17;静态聚合性能为 44.14,基线为 44.24。域外clemscore为 7.88,收益集中在目标游戏族的未见变体。13 - 证据强弱与复现条件:证据中等,官方挑战评测给出了清楚的端点比较,但实验只有一个 2B 模型,域外迁移较弱,
clemscore的口径依赖挑战赛。代码情况除论文列出的模型卡外,原文未报告具体代码仓库链接。 - 与目标线的关系与结论:它把“先获得可玩性、再定位局部故障、最后保护通用能力”落成可复现配方。结论:值得扫读。 适合与下一篇放在同一组,比较 turn-local 修复和分阶段轨迹 SFT 的分工。
First Make It Playable, Then Make It Good: Staged Interaction Learning for Small Dialogue-Game Agents(2608.27672)
- 作者与来源:Syed Mahbubul Huq、Pranava Madhyastha,来自伦敦城市大学和艾伦·图灵研究所;arXiv v1 提交于 2026 年 8 月 27 日,属于 LMP Challenge(EMNLP 2026 Workshop)。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.27672。
- 研究问题与方法(改动层):论文先用 Playpen 成功轨迹做 SFT,取得可玩性;再加入加权 turn-level SFT 和 teacher-guided SFT,让训练更关注决策质量。教师只修格式并评估样例,不生成新的 gold 动作。改动层是成功轨迹筛选、局部监督和教师使用方式。14
- 数据、流程与评测:微调 Qwen3.5-2B 得到 Qwen-GuidePlay-2B,评测使用 Playpen 公开验证集的
clemscore、statscore和官方挑战赛结果,并与 replay-repair、hard-example mining 比较。训练样本量、运行次数与算力细节原文未报告。 - 关键结果:公开 Playpen 验证集的
clemscore为 57.12,statscore为 42.68;Qwen-GuidePlay-2B 在官方挑战赛参赛系统中取得第二高的clemscore delta,约为 +36;该排名的完整参赛范围和第一名数值原文未报告。论文报告完整轨迹模仿更有利于可玩性,turn-level 和教师引导通常改善决策与总分,而 replay-repair 与困难样本挖掘没有帮助。14 - 证据强弱与复现条件:证据中等,挑战赛官方结果支持方向性判断,但实验集中在 Playpen 和单一 2B 模型,没有显著性检验。教师的作用边界很窄,读者应避免把它理解为教师生成完整行动轨迹。
- 与目标线的关系与结论:这篇论文和 Acquire, Repair, Preserve 共同说明训练数据选择可能比更复杂的算法更先影响小模型 agent。结论:值得扫读。 两篇原文适合对读成功轨迹、局部修复、域外迁移和静态能力保持。
Is Prosody Lost in Translation? Fine-Grained Cross-Lingual Prosody Similarity Across Languages(2608.27848)
- 作者与来源:Haopeng Xie、Ismail Rasim Ulgen、Sofia Son、Berrak Sisman、Philipp Koehn,约翰斯·霍普金斯大学 CLSP;arXiv v1 提交于 2026 年 8 月 28 日,论文标注录用 EMNLP 2026 Findings。候选来自 语音与音频学术速递条目,原文入口为 arXiv:2608.27848。
- 研究问题与方法(改动层):研究者测量源语和目标语音的音高、能量和时间特征是否跨语言相关。论文没有训练 TTS,而是对表达性语音翻译/韵律迁移的上游前提做大规模观察分析;改动层是韵律数据与分析协议。4
- 数据、流程与评测:数据来自专业配音影视语音,覆盖 DE–EN、EN–ES 和 EN–FR;过滤后分别有 16,335、16,939、15,957 句,时长约 36.7、37.9、35.7 小时。流程使用 whisper_timestamped、FastAlign、pYAAPT 和 librosa,句级 Spearman 相关以 episode-clustered bootstrap 给出 95% 区间,并与打乱基线比较。4
- 关键结果:音高相关分别为 0.229 [0.223, 0.236]、0.241 [0.235, 0.247]、0.246 [0.239, 0.253],对应打乱基线为 0.007、0.005、0.010;能量相关分别为 0.183、0.174、0.176,打乱基线为 0.043、0.030、0.026。配对检验的
p<10^-80;把三种语言对的句级相关系数逐组相减,音高相关比能量相关高 0.046–0.070;音素数相关约为 0.871–0.885,时长相关约为 0.884–0.891。4 - 证据强弱与复现条件:证据中强。样本规模、过滤流程和统计检验完整,但语料来自配音而非真实翻译,音频资源受授权限制,分析没有直接评估生成系统;停顿、节奏、音质和声调语言也在范围之外。分析流水线计划公开,具体链接原文未报告。
- 与目标线的关系与结论:跨语言部分共享的韵律结构为表达性 S2ST/TTS 的韵律建模提供数据依据,但相关性本身不能替代生成质量评测。结论:值得扫读。 重点看 §3 的对齐误差和 §4 的 POS(词性)消融,再决定哪些韵律特征值得进入生成训练。
Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluation(2608.27817)
- 作者与来源:Mengzhe Geng,加拿大国家研究委员会;arXiv v1 提交于 2026 年 8 月 28 日。候选来自 语音与音频学术速递条目,原文入口为 arXiv:2608.27817。
- 研究问题与方法(改动层):在已知闭集任务里,波形优于转写只能说明音频信息有用,不能单独说明生成式音频调用是必要的。论文让选择器在转写、CLAP/AST/WavLM 编码器证据和 Qwen2-Audio、Qwen2.5-Omni、MOSS-Audio 等生成模型之间选择,再做去掉全部生成动作的配对消融。改动层是评测协议和调用策略。5
- 数据、流程与评测:主基准是 Dynamic-SUPERB VocalSound,包含 6 类非语言人声;holdout 有 240 个样本,随机基线为 0.167。外部检查包含 ESC-50 Animals、AudioBench 情感 PQA 和 LibriSpeech-TestClean 的 speech-text matching。作者使用 10 个种子、10K bootstrap 配对区间、McNemar 精确检验与 Holm 校正,并把调用耗时单独计入。5
- 关键结果:VocalSound holdout 上,转写准确率为 0.296;Qwen2.5-Omni、Qwen2-Audio、MOSS-Audio 分别为 0.883、0.838、0.808。有监督的无生成调用探针中,CLAP 为 0.850、WavLM-base+ 为 0.854、CLAP–WavLM 联合 ridge 为 0.896。带生成动作的选择器为 0.925,调用率 12.5%;配对无调用选择器为 0.921,差值 0.004,95% CI [−0.025, 0.033],区间包含零。无调用选择器耗时 11.3 秒,全选择器耗时 16.9 秒,其中生成调用约 5.6 秒。5
- 证据强弱与复现条件:证据强。控制变量、配对统计、多数据集和成本核算共同支撑“闭集任务中编码器可能已经足够”的条件性判断。研究继承 ASR、编码器和 LLM 在口音、方言和低资源语言上的偏差,也没有评估开放对话质量、指令遵循或复杂音频推理;VocalSound 的固定分割被重复使用。
- 与目标线的关系与结论:这篇论文直接服务 TTS/语音模型评估的调用边界:转写分数、音频表征、生成模型调用和最终任务应分别报告。结论:值得扫读。 原文优先看 0.925 对 0.921 的配对区间,再把“音频—文本增益”和“生成调用必要性”写成两个实验问题。
邻近但值得跟踪
Entity-Memory Graph Retrieval Improves Evidence Coverage in Long-Conversation Question Answering(2608.27925)
- 作者与来源:Shumao Sun,清华大学;arXiv v1 提交于 2026 年 8 月 28 日。候选来自 自然语言处理学术速递条目,原文入口为 arXiv:2608.27925。
- 研究问题与方法(改动层):论文把对话轮次作为记忆节点,用共享实体连接重复提及,用时间边恢复一跳事件线,再做稠密回填。匹配的稠密基线共享记忆、查询向量、上下文预算、作答协议和评测器,主要隔离图结构对证据召回的影响。改动层是记忆表示与检索。
- 数据、流程与评测:实验使用 LoCoMo 的 10 段对话和 1,986 个问题,官方证据召回的
top-k从 5 扫到 50,并使用 GPT-3.5 与 DeepSeek 两种抽取器。15 - 关键结果:
top-k=25时,官方证据召回率从 79.7468% 升到 84.4842%,提升约 4.74 个百分点;优势在top-k=5–50范围保持。匹配截止点没有支持最终答案 F1 差异,嵌入鲁棒性实验也显示 F1 无差异而召回对嵌入敏感。15 - 证据强弱与复现条件:证据中等。对照设计清楚,但实验只有 LoCoMo,一个数据集不足以说明跨场景泛化;作者明确写出召回增益、答案 F1、模型等价性和跨数据集泛化之间的边界,代码情况原文未报告具体链接。
- 与目标线的关系与结论:图结构适合解决实体、时间线和证据找回,当前结果主要落在“找得到”这一层。结论:邻近跟踪。 迁移到长程 agent 前,先增加“相关记忆是否把答案带偏”和“检索后是否完成行动”的终点指标。
Low-Power End-to-End Cochlear Implant Speech Denoising with Spiking Neural Networks(2608.28493)
- 作者与来源:Ludovic Boulanger、Sean U. N. Wood,舍布鲁克大学;arXiv v1 提交于 2026 年 8 月 28 日,论文标注 ICASSP 2026,并给出 DOI。候选来自 语音与音频学术速递条目,原文入口为 arXiv:2608.28493。
- 研究问题与方法(改动层):Spiking Deep ACE 用 ParaLIF-Threshold 神经元替代 ANN,在人工耳蜗端到端完成语音增强和 ACE 编码;改动层是音频前端与边缘资源,而非 TTS 或播客生成。
- 数据、流程与评测:训练使用约 10 小时、28 位说话人的 CSTR 噪声语音,覆盖 0/5/10/15 dB SNR,按说话人 80/20 划分;测试在 ICRA static 与 ICRA babble 噪声的 −5/0/5/10 dB 条件下进行。指标为电极图域 SNRi、VSTOI 和 CMOS 45nm 能耗模型。6
- 关键结果:合并两类 ICRA 噪声后,Spiking Deep ACE 的 VSTOI 为 56%、SNRi 为 6.0 dB、估算能耗为 372 μJ/s;Deep ACE 为 57%、6.1 dB 和 2461 μJ/s。论文逐个 SNR 报告的 VSTOI 差异不超过 2 个百分点,SNRi 各情形平均差小于 0.5 dB;按该能耗模型,两者能耗比约为 6.6:1。6
- 证据强弱与复现条件:证据中强。模型重训、数据和指标对照完整,代码入口为 spiking-deep-ace;能耗是 CMOS 分析模型,没有包含内存搬运,芯片实测、听者主观评测和真实部署结果在原文未报告。
- 与目标线的关系与结论:它与 TTS/播客生成的直接接口较远,但对低功耗语音前端、音频质量指标和端侧语音 agent 有迁移价值。结论:邻近跟踪。 复用时保留 VSTOI/SNRi 与能耗模型的口径,避免把估算值写成硬件实测。
Multirate State Space Models for End-to-End Processing of Pulse Density Modulated Speech Signals(2608.28472)
- 作者与来源:Ludovic Boulanger、Sean U. N. Wood,舍布鲁克大学;arXiv v1 提交于 2026 年 8 月 28 日。候选来自 语音与音频学术速递条目,原文入口为 arXiv:2608.28472。
- 研究问题与方法(改动层):论文让状态空间模型直接处理单比特 PDM 流,使用连续时间参数化获得对调制和采样率更稳定的表示,再下采样到固定处理速率;训练阶段只使用 16 kHz PCM,部署测试覆盖多种 PDM 采样率。改动层是语音前端表示与边缘处理流程。
- 数据、流程与评测:关键词识别使用 Google Speech Commands 的 35 类、105,829 句和 2,618 位说话人;语音增强使用 VoiceBank+DEMAND。PDM 测试由二阶单比特 ΣΔ 调制器在 OSR 8–128 合成;指标为 KWS 准确率、PESQ 和 STOI。16
- 关键结果:2 MHz PDM 上,最佳 KWS 配置达到 93.72%,PCM 基线为 93.53%;512 kHz 低功耗档为 92.66%。语音增强最佳配置为 PESQ 3.24、STOI 93%,轻量配置为 PESQ 3.08、STOI 93%;论文以百分数报告 STOI。2 MHz PDM 经过编码后,下游处理速率可降到 31.25 Hz,下采样因子最高达 65,536。16
- 证据强弱与复现条件:证据中强。OSR 扫描、窗口与隐藏维度消融、PCM 到 PDM 的泛化实验较完整,代码入口为 ssm-speech-processing。PDM 量化噪声依赖增强近似,尚未在 FPGA 或嵌入式平台实测;KWS 的数据划分与常见 Speech Commands v2 划分不同。
- 与目标线的关系与结论:它对端侧唤醒、音频输入成本和语音 agent 的前端延迟有迁移价值。结论:邻近跟踪。 研究播客或 TTS 时,真正可迁移的是“输入表示—延迟—下游终点”的分账方式,不是 PDM 结果本身。
Evaluating Loss Functions in Differentiable Out-of-Domain Sound-Matching with Partial Parameter Distance(2608.27698)
- 作者与来源:Amir Salimi、Daniel Penner、Kalvin Eng、Abram Hindle、Osmar R. Zaïane,阿尔伯塔大学;arXiv v1 提交于 2026 年 8 月 27 日。候选来自 语音与音频学术速递条目,原文入口为 arXiv:2608.27698。
- 研究问题与方法(改动层):标准参数损失要求目标和合成器共享参数空间。部分参数距离
PPD只对两者共享的关键参数计算差异,并用盲听检查自动排序是否对应听感;改动层是可微音频合成的损失与评估方法。 - 数据、流程与评测:实验包含 6 个域外场景和 1 个域内场景,覆盖带通、3 个调幅和 3 个 pitch-bending chirplet;每种损失每个场景至少做 300 次独立试验。四种损失为
SIMSE_Spec、L1_Spec、JTFS与DTW_Envelope,听感评估由 4 位作者完成,每种损失每场景 40 对比较。17 - 关键结果:7 个场景中有 5 个场景的 PPD 与盲听在最优损失上达成一致;两处不一致均发生在调幅载频重叠场景。
SIMSE_Spec最适合滤波器截止频率恢复,DTW_Envelope在 3 个调幅场景的 PPD 中均排名第一,JTFS在平滑音高轨迹场景中同时获得 PPD 和听感第一。合并评分者的 ICC3k 为 0.86,留一评分者后平均秩相关为 0.98。17 - 证据强弱与复现条件:证据中强。受控合成器、大量试验和盲听验证支持“损失与合成任务耦合”;听者只有 4 位作者,关键参数选择带有主观性,所有损失共用一套优化器和学习率,真实录音、高维参数空间和非梯度搜索的结果在原文未报告。复现代码计划发布,具体链接原文未报告。
- 与目标线的关系与结论:它对 TTS 音质损失、时频表征和自动评估的迁移价值在方法层,不能直接当作 TTS 或播客实验。结论:邻近跟踪。 重点带走“先定义合成器共享参数,再用小型听测验证自动指标”的评测顺序。
Exploring the Design Space of Representation Learning for Audio Transformations(2608.28127)
- 作者与来源:Sungho Lee、Marco Martínez-Ramírez、Junghyun Koo、Wei-Hsiang Liao、Kyogu Lee、Yuki Mitsufuji,来自 Sony AI 等机构;arXiv v1 提交于 2026 年 8 月 28 日,论文标注录用 ISMIR 2026。候选来自 语音与音频学术速递条目,原文入口为 arXiv:2608.28127。
- 研究问题与方法(改动层):音频效果器表征究竟应该编码处理本身,还是保留处理后的音频内容。统一框架使用处理一致性、描述对齐和等变性三个目标,产出变换嵌入
zT与处理音频嵌入zy;改动层是音频表征训练和下游评测。 - 数据、流程与评测:模型冻结 Stable Audio Open 编码器,只训练 4 层、1024 维的 Transformer 适配器。处理库覆盖 EQ、滤波、动态、失真、混响、延迟和调制,链长为 1–8;训练数据来自 MedleyDB、MoisesDB 和 Mixing Secrets stems,测试使用 MUSDB 子集和 67 个 Linux 音频插件。评测包含 20-way 检索、处理链/参数估计、源分类和跨乐器风格迁移。18
- 关键结果:平均检索准确率上,联合目标
L_T+L_P为 61.1%,全组合为 60.4%;AFx-Rep、Fx-Encoder++、Fx-Encoder、CLAP、MERT、VGGish 和 PANN 分别为 45.2%、36.0%、29.1%、21.7%、20.3%、20.1% 和 17.3%。全组合的链估计 IoU、精确率和 macro-F1 分别为 53.8%、18.1% 和 60.9%;跨乐器风格迁移中,zT的 MRSTFT 为 0.647±0.018,zy为 0.720±0.021,zT的差异检验p<0.001。18 - 证据强弱与复现条件:证据强。目标消融、多个下游任务和公开基线形成了清楚的比较,代码入口为 SonyResearch/RLAT。训练目标权重只在 0/1 组合中选择,源音频多样性、效果描述可得性和插件覆盖会影响泛化;语音合成与播客的音质评估结果在原文未报告。
- 与目标线的关系与结论:论文给出了音频质量评估表征的迁移线索:距离型任务偏好处理导向的
zT,探针型任务偏好信息更丰富的zy。结论:邻近跟踪。 复用时先定义“听感距离”还是“属性探针”,再选嵌入,不要用单一表征承担两类终点。
研发检查表
对长程 agent 训练的验收
- 先写清改动层。 实验记录应标明收益来自模型权重、训练配方、轨迹表示、harness/环境、技能/wiki、query-time memory 还是评测协议。ContextPilot 的工具消融不能替代 RL 对照,程序性记忆的结果也不能直接当作参数内化。
- 把记忆生命周期拆开。 分别测内容准入、驱逐后的找回、压缩保真、写入去重、相关记忆带来的偏差和参数内化。ElephantBench 的
C/P/F/K提醒评测者把“想起一个版本”和“完整想起全部版本”分开。 - 给错误留恢复机会。 评测工具调用时并列记录 teacher-forced 与 free-running 上下文、dispatch 轨迹、恢复率和副作用。Fidelity 的 50 个构造故障可以作为起点,但自然故障下的“调用了工具仍答错”仍需独立测量。
- 把一次成功和重复成功分开。 Below the Noise Floor 的多种子双峰说明,单次运行成功率(
pass@1)、单次训练端点或一次最佳轨迹都不足以支撑稳定性结论。每个自进化更新至少要报告重复完成、回归任务、成本和失败样本。 - 区分形成、复用和迁移。 PersonaForge 的多轮数据合成、CultureConverse 的 episode harness、Acquire/Repair/Preserve 的局部修复和 First Make It Playable 的成功轨迹,各自解决不同问题。技能变多、wiki 变长或轨迹变短,都需要经过独立验证集和跨任务测试。
- 把 judge 当作测量设备。 记录 judge 是否看到 ground truth、是否存在过度依赖答案格式的路径,并保留人工抽检。一个总分应拆成工具选择、参数结构、行动顺序、任务完成和副作用检查。
对 TTS、语音 agent 与音频评测的验收
- 先问音频在哪一层起作用。 音频生成、音频质量评估和语音理解分别记录。跨语言韵律论文测的是迁移前提,Auditing Generative Audio Calls 测的是生成调用边际价值,Spiking Deep ACE 与多速率 SSM 测的是端侧前端。
- 把指标对应到终点。
WER/CER回答转写,MOS回答主观听感,韵律相关回答表达特征是否保留,自动质量指标回答某个代理目标,pass@1、数据库终态或用户判断回答最终行动。当前批次的 TTS 生成质量与播客生成/评估结果仍为空,原文未报告的信息不要补成数字。 - 对生成式调用做无调用控制。 报告转写、冻结音频编码器、生成式音频模型和最终选择器四个条件,连同调用率、延迟、成本和置信区间。0.925 对 0.921 的区间包含零时,结论应写成条件性边际价值。
- 长音频接地要分环节。 对播客或长语音任务,至少分别测输入上限、事实定位、事实理解、跨段推理、说话人交接和最终交付;长音频评测中的链式截断思路可以迁移为协议设计,但当前批次没有播客实验。
- 听感与自动指标要配对。 OOD 音频损失论文显示 PPD 与听测在 7 个场景中只在 5 个场景上选出同一最优损失。TTS 评估应报告听者数量、盲评方式、置信区间和自动指标与听感的对应关系。
本期明确缺口
- 本期音频栏目收到的 7 篇候选中有 6 篇收录;这 7 篇候选的播客生成与播客评估直接命中为空。通用播客链路的 TTS 生成/评估结果也为空。语音和音频近邻仍提供了前端、质量指标和表征方面的迁移线索。
- 本期精读论文的实验细节较完整;扫读项中有些定量结果只在摘要层面出现,读者进行复现决策时应回到 arXiv 原文表格。文章把这类范围写成“原文未报告”,没有用推测补齐条件。
- 两篇公众号速递属于栏目级聚合;栏目文章提供候选归属,arXiv 链接提供逐篇原文入口。代码仓库、项目页和数据页只在论文明确列出时附上。
References
- 1
- 2PersonaForge 与 CultureConverse 原文
arxiv.org
- 3
- 4Is Prosody Lost in Translation 原文
arxiv.org
- 5Auditing Generative Audio Calls 原文
arxiv.org
- 6四篇音频邻近论文原文
arxiv.org
- 7Agent Memory arXiv HTML 原文
arxiv.org
- 8Fidelity Is Not Enough arXiv 原文
arxiv.org
- 9CultureConverse arXiv 原文
arxiv.org
- 10ElephantBench arXiv HTML 原文
arxiv.org
- 11
- 12Rubric-Guided RL arXiv 原文
arxiv.org
- 13Acquire Repair Preserve arXiv 原文
arxiv.org
- 14First Make It Playable arXiv 原文
arxiv.org
- 15Entity-Memory Graph Retrieval 设置
arxiv.org
- 16Multirate SSM 设置
arxiv.org
- 17PPD 设置与听测
arxiv.org
- 18Audio Transformations 设置
arxiv.org
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- 规则、环境、记忆与声线:9 月 4 日 31 篇论文里的长程 agent 与 TTS 评测
- 长轨迹先变成状态,评测再把成本停在中途:9 月 3 日 19 篇论文雷达
- 工具边界、证据回返与 TTS 文本对齐:9.2 论文雷达
- 后果归因、可审计记忆、自进化负结果与闭环 TTS:9.1 论文雷达(26 篇)
- 8月28日论文雷达:经验开始进入状态、技能与权重,语音智能体把训练闭环跑起来
- 8月27日论文雷达:把“完成”拆成轨迹、交付与成本,音频生成仍缺席
- 8月26日论文雷达:20篇直接命中、3篇邻近,harness演化、轨迹训练与唯一一篇TTS
- 8月25日论文雷达:16篇直接命中、1篇邻近,先把上下文、技能与重复可靠性拆开
