
8月10日论文雷达:21篇直接命中、3篇邻近,先看三种信用分配
从8月10日三栏145篇中筛出21篇直接命中、3篇邻近工作,重点比较三种长程信用分配、自进化门控与混合音频评测的证据和复现代价。
8 月 10 日的三个跟踪栏目共收录 145 篇论文:人工智能 88 篇、自然语言处理 51 篇、语音与音频 6 篇。123 本期留下 21 篇直接命中、3 篇邻近跟踪。入选门槛不是标题里出现「agent」「memory」或「audio」,而是论文必须改变长程训练、轨迹归因、自进化、TTS/音频生成评测中的一个具体判断;邻近项还要能说清可迁移的机制。
这一批最值得先看的,不是又多了多少套 agent 框架,而是三篇信用分配工作把同一个稀疏终局奖励回溯到三种不同粒度:动作与 Token、经验图上的状态转移、代码差分。它们的收益、附加成本和适用边界并不相同。456
如果只读 8 篇
「证据完成度」是本期的阅读判断:高,表示原文给出清楚的对照、消融、复现入口或数据;中,表示量化结果较完整,但开放资源或外推边界仍缺一块。它不是对论文质量的终审。
| 顺序 | 论文 | 先读什么 | 证据完成度 | 入口 |
|---|---|---|---|---|
| 1 | The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents | 先校准「长程、长上下文、长期记忆」三者的边界,再看为何训练与评测都转向过程信号 | 中 | 公众号 NLP 栏目 · arXiv |
| 2 | How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning | 动作信用守恒、Token 内分配,以及为此付出的额外 rollout 成本 | 高 | 公众号 AI 栏目 · arXiv |
| 3 | Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents | 不训练 critic,直接从经验 rollout 图构造 Bellman 信用;置信门何时拒绝局部信号 | 高 | 公众号 AI 栏目 · arXiv |
| 4 | DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training | 为什么一整个代码 diff 仍然太粗,以及连续子差分(sub-diff)怎样分组并回投到 Token | 高 | 公众号 AI 栏目 · arXiv |
| 5 | Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework | 1,351 条轨迹如何标主归因与归因链;简单归因方法在长距离设置下掉得多快 | 高 | 公众号 AI 栏目 · arXiv |
| 6 | WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader | 奖励器如何等到决定性状态再判定,而不是看到成功提示就提前给分 | 高 | 公众号 AI 栏目 · arXiv |
| 7 | SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent | 诊断—重跑—回滚闭环,以及用留一审计删掉无用技能单元 | 高 | 公众号 AI 栏目 · arXiv |
| 8 | MMAG: A Multi-Control Mixed Audio Generation Benchmark | 混合音频不能只看清晰度:说话人、语义、音质与时间控制彼此拉扯 | 高 | 公众号语音与音频栏目 · arXiv |
先把「长程」说准
The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents
团队 / 版本: Mingguang Chen、Licheng Wang、Bo Qu;2026 年 8 月 7 日 v1。7
这篇综述把长程定义为任务需要连续多少次决策、动作或环境交互;长上下文是单次前向可处理多少 Token;长期记忆则是信息能否跨步骤或会话持续存在。三者可以同时出现,也可以彼此独立。7
作者先用 8 组 arXiv 检索得到 1,939 个去重候选,再用主题规则、聚类与信号门过滤掉 520 篇,另以 19 组定向查询补入 128 篇,最终整理 1,547 篇 2024—2026 年的论文。六类框架覆盖规划、记忆、执行恢复、训练、评测、基础与安全;第二条轴线区分 horizon 由当前上下文、任务内外部状态还是跨任务持久状态承载。7
最有用的判断是:horizon 变长后,单一终局成败越来越难定位是哪一步出了问题,所以训练侧制造动作级、步骤级信用,评测侧制造轨迹级诊断。但这仍是综述归纳,不是统一实验。语料由单一标注者分类,规则检索不覆盖非英语和未公开的工业实践,作者抽检后估计边界误分仍约为 1/20。7 结论:精读框架与语料方法,不把「过程信号更密」误读成已被统一因果实验验证。
三种信用分配,拆的是三个不同对象
| 方法 | 信用原子 | 依赖什么额外结构 | 主要结果 | 代价与边界 |
|---|---|---|---|---|
| FACTOR | 轨迹 → 动作 → 动作内 Token | 可恢复 checkpoint、额外 continuation、teacher-student likelihood gap | Qwen2.5-7B 上,ALFWorld / WebShop / ScienceWorld 为 92.0 / 82.4 / 48.9,比复现的 SERL 高 2.2 / 2.4 / 4.2 个百分点 | 环境交互约 3.5 倍、墙钟时间 1.25 倍;不适合无法恢复状态的环境 4 |
| Gated-BEPO | 经验图中的状态转移 | 同一观测状态要出现至少两个不同后继,才能打开置信门 | Visual Sokoban 成功率 80.0±3.2%,GRPO 为 67.1±4.7%,GiGPO 为 76.9±2.7%;语言环境也保持增益 | 信用计算仅 0.361 秒/更新,对比其余训练约 225.7 秒;相同观测可能对应不同隐藏状态,方法只能缓解别名 5 |
| DiDPO | 代码差分中的连续子差分 | 跨 rollout 的相似片段聚成锚点(anchor),再按片段长度和重复次数计算可分组分数(groupability score) | Qwen2.5-Coder-7B 的标准代码基准均值 48.4,GiGPO 为 44.2;竞赛级基准均值 10.7,GiGPO 为 5.9 | 训练开销约增加 2.3%,推理不分组;局部信用受 sub-diff 匹配偏差和分组规模限制 6 |
FACTOR:先问「这一步该得多少」,再问「该分给哪些 Token」
团队 / 版本: Lichao Ma 等;2026 年 8 月 7 日 v1。4
FACTOR 用 checkpoint 校准的 TD residual 给动作分信用,使动作信用沿轨迹求和后严格回到轨迹优势;再用看到环境反馈的教师与学生之间的似然差,把每个动作的信用分到已生成 Token。每个动作内部的权重保持非负、均值为 1,避免 Token 级符号翻转;action-mean loss 也去掉了长回复天然占更大权重的问题。4
消融里,去掉 TD action credit 后,三个环境分别下降 2.1、1.9、3.5 个百分点;去掉 hindsight token allocation,WebShop 与 ScienceWorld 再降 1.6、2.1 个百分点。相同超参数无需重调便迁移到 Qwen2.5-14B 与 Llama-3.1-8B,但主要收益来自动作级 TD 信用,Token 分配是补充项。论文没有给出独立 GitHub 入口,只说明补充代码含数据划分清单。结论:精读;若环境不能恢复中间状态,先不要照搬。4
Gated-BEPO:没有分支证据,就别硬造步骤信用
团队 / 版本: Hongxi Yan、Ziyue Huang、Shichao Fan、Qingjie Liu;2026 年 8 月 7 日 v1。5
Gated-BEPO 把相同观测合并为经验图节点,用均值 Bellman fixed point 算节点价值,再沿原轨迹以 GAE 累积 TD residual。置信门只在一个状态至少出现两个不同后继时接入步骤信用,否则退回 episode-level 信用。5
WebShop 消融从 outcome-only 的 62.50±1.99%成功率,加入 fixed-point credit 后到 66.41±3.38%,再加 gate 到 73.83±2.30%,完整方法为 75.91±2.71%。只要求重复访问、不要求不同后继时,成功率仍是 62.50±1.91%。这组结果支持「分支才提供局部可比证据」,但 raw observation 无法恢复隐藏 Markov 状态,均值备份可能把不同真实状态混在一起。作者已开放代码仓库。结论:精读;尤其适合检查自己的轨迹图是否真有可比较分支。5
DiDPO:代码动作里还藏着多个独立编辑
团队 / 版本: Xucong Wang 等;2026 年 8 月 7 日 v1。6
DiDPO 不把一轮 coding action 当成最小单元,而是把 diff 枚举成连续子差分;相似子差分聚成锚点,再以片段长度和重复次数判断能否形成可靠分组。局部优势与 episode-level 优势合并后回投到 response Token,不训练额外 critic,也不增加环境 rollout。6
去掉 episode-level 优势后,APPS / OJBench 从 31.3 / 8.0 跌到 10.4 / 3.8;去掉 diff-level 优势为 23.8 / 5.7;不切 sub-diff 为 25.0 / 4.4。它证明「整块 diff 太粗」在这组代码任务上确实有损失,但结论不能直接迁移到没有可对齐结构的通用工具调用。官方开放了verl-code。结论:精读;做 coding agent RL 时先读它,原因是额外成本更低、信用单元也更贴近代码结构;FACTOR 留给可恢复状态的通用环境。6
归因基准补上了「成功了,但为什么」
Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework
团队 / 版本: Jing Chen、Yang Sun、Li Zhang、Lin Xu、Jie Shi;2026 年 8 月 7 日 v1。8
这里的轨迹归因,是把最终动作回溯到哪一段指令、推理、工具调用、观测或记忆。论文把 AgentDojo、Agent3Sigma Stage 与 Canary 的异构轨迹统一成有序组件。1,351 条轨迹中,409 条是任务对齐动作、532 条是不安全动作、410 条是安全拒绝;每条标一个主归因组件,不安全轨迹还可标攻击链和执行链。8
两个基线都暴露出距离问题。以 task-aligned action 为例,leave-one-out 在相邻归因上的 Hit@1 为 1.000,长距离归因只有 0.120;所有目标合并后,整体 Hit@1 为 0.537。执行链比攻击链容易恢复,例如 AgentDojo 上 leave-one-out 的执行链 Recall@3 为 0.804,攻击链只有 0.233。8
标注由 LLM 辅助,再做结构与语义验证;论文没有报告传统双人独立标注的一致性。当前也只到组件级,三组 benchmark family 与两个简单基线都不足以代表真实部署。8 项目已开放数据与标注资源。结论:精读;它更像诊断仪器,而不是新的训练算法。
自进化最怕把评测器也一起骗过
WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader
团队 / 版本: Boshui Chen、Huiping Liu、Shaolei Zhang;2026 年 8 月 6 日 v1。9
WebGrader 先把网站需求变成 Flow Contract,也就是一份列明前置条件、交互序列、目标动作、证据检查点、后置条件和必看观测的可执行检查单。浏览器随后收集截图、DOM、响应、URL、网络事件和存储状态。一次「成功」toast 不够;如果目标动作后的表格、持久状态或跨页面结果没有改变,判定仍是失败。9
评测器的自进化发生在策略训练前。残差按规划、grounding、证据、判决四类归因,候选 verifier skill 只在独立验证页提升且不回退时进入 SkillGraph,随后冻结为 RL 奖励。WebGen-Bench 有 101 个需求、647 个人工功能用例;8B 策略的功能成功率为 52.01%,matched appearance-plus-script reward 为 44.13%,差 7.88 个百分点,而外观分只差 0.02。9
深度 4 以上流程、数据绑定、搜索/过滤/排序仍是集中失败区。评测器进化只用 100 个应用的合成单故障变体,迁移到更开放的网站需求还要再验证。9 代码与数据已在官方仓库公开。结论:精读;可迁移点不是网页生成,而是「先固定可执行证据合同,再让奖励器进化」。
SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent
团队 / 版本: Mingxuan Zheng 等;2026 年 8 月 7 日 v1。10
SkillProx 前向阶段根据失败轨迹诊断并编辑 skill,同一批任务立即重跑;hard accuracy 与 mean cell accuracy 任一回退就回滚,拒绝原因进入下一轮诊断。后向阶段把 skill 拆成可审计单元,用固定验证集做 leave-one-out utility audit,再验证门控删除、降级或合并低效单元。10
在 Qwen3.5-4B、Qwen3.5-27B、Qwen3.6-27B 与 SpreadsheetBench / WikiTQ / HiTab 上,平均准确率比最强 gradient-based baseline 高 3.0 个百分点。Qwen3.6-27B 的 SpreadsheetBench 消融中,完整方法 54.5±0.5,去掉诊断闭环为 53.0±1.0,去掉 Prox 为 52.0±1.0。10
代价不轻:若有 n 个知识单元、处理 M 个候选,每次都跑完整验证集,任务执行量是 O((n+M)|V|)。同一验证集反复参与留一审计和门控,也可能被逐渐适配;作者把 utility 称为候选证据,而非严格因果效应。10 代码已公开。结论:精读;它把「删掉什么」从普通文本编辑提升成独立优化步骤。
生成式音频:先把四种能力拆开测
MMAG: A Multi-Control Mixed Audio Generation Benchmark
团队 / 版本: Zihao Zheng 等;2026 年 8 月 7 日 v1。11
MMAG 从 AudioCaps、VGGSound、MECAT 测试集构建 3,974 条人工核验的 10 秒混合音频;其中 691 条带 2—5 秒声音提示,约 1,828 条带细粒度时间边界。标注覆盖说话内容与身份、音乐属性、声音事件和时间关系,最终抽检通过率约 90%。11
指标刻意分开:FD/KL/IS 看分布,WER 与 UTMOSv2 看语音,CLAP 与 AnyAudio-Judge 看语义,SPK-SIM 看声音克隆,SpeechF1 / SoundF1 看时间控制。结果没有总冠军:Ming-Omni-TTS 的 WER 和声音相似度强,但常漏掉音乐与音效;Dasheng-AudioGen 的分布与语义指标强,语音清晰度较弱;LTX-2 在主集较均衡。时间戳子集上,表现最好的 AuDirector 也只有 SpeechF1 0.72、SoundF1 0.57,而且牺牲保真度。11
基准只覆盖 10 秒、单说话人英语,音乐与音效类别也不平衡;当前音频 judge 对细粒度时间约束还不够敏感。11 项目页已开放。结论:精读;做播客生成评测时,至少要把语音可懂度、说话人一致性、混音语义和时间控制分开,不能再压成单一总分。
Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing
团队 / 版本: Iftach Shoham 等;2026 年 8 月 5 日 v1。12
候选入口: 公众号语音与音频栏目 · arXiv
SIEDD 用分层 codec Token 做离散扩散。HiCoDD 按 RVQ 从粗到细逐个生成 codebook:已完成的低层 codebook 作为干净声学上下文,只对当前层和目标片段扩散;音素条件、局部 classifier-free guidance 与时长预测分别处理文本遵循、边界连续和可变时长编辑。12
RealEdit 上,SIEDD 的编辑 WER 为 0.121、说话人 SIM 为 0.98、MCD 为 270.0;VoiceCraft 分别为 0.124、0.97、392.25,SSR-Speech 为 0.146、0.97、308.3。UTMOS 为 3.44,低于直接重合成的 MMS TTS baseline 4.11,也略低于两种编辑基线。训练用 2 张 RTX A6000 跑 55 万步、约一周;推理要 512 个去噪步。12
长缺口与多缺口下性能仍会下降,时长预测、采样速度、多语言和长编辑都未解决。12 官方代码与配置已开放。结论:精读;它命中的是局部语音重写,不是端到端播客生成,研发价值在保留说话人、韵律和录音条件的编辑链路。
其余 12 篇直接命中:按研发问题扫读
记忆与长程训练
| 论文 | 问题 / 方法 | 结果、证据与局限 | 判断与入口 |
|---|---|---|---|
| Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory | Taeil Kim 等,8 月 7 日 v1。把成功教师轨迹拆成 workflow、subtask、function 三层记忆;前两层主动注入,function 在工具错误时检索 | GPT-5-mini 教 4 个 4B—8B 学生;AppWorld / BFCL V3 / ToolSandbox 平均提升 27.2 / 11.2 / 3.4 个百分点。Subtask memory 贡献最大;未给官方代码,教师成本与兼容性仍是变量 13 | 扫读。 公众号 AI · arXiv |
| MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents | Zhisheng Chen 等,8 月 7 日 v1。持久 event stream 不直接喂给策略;view policy 按任务选择关系、证据范围、结果条件和粒度,再渲染临时工作记忆 | 摘要报告长程具身与网页基准均提升,轨迹越长收益越大、Token 更少,view policy 可跨 VLM 迁移;原文摘要未给绝对分数和开放仓库 14 | 扫读。 公众号 AI · arXiv |
| MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents | Zhiyuan Liu 等,8 月 7 日 v1。记忆压缩会让教师在学生从未访问的重写状态上评分;方法重建每次调用的原始 Token 位置与因果可见性,再打包蒸馏 | 匹配对照中 F1 比 persistent-history teacher scoring 高 7.0%;MemOPD-3B 比 PPO 最高相对提升 416.2%,packing 让 actor 计算最高加速 1.63 倍。大相对值缺少绝对基线,需读表 15 | 扫读,训练实现优先。 公众号 AI · arXiv · 代码 |
| TEPA: Revoking Stale Memories for Conflict-Robust Language Agents | Yan Zhou 等,8 月 7 日 v1。把记忆有效性设为显式状态;同一 key 出现新冲突证据时撤销旧 precedent,但保留撤销历史供审计 | 受控反转 50 个 seeds 中 TEPA 为 0.950,append-only 与 last-write-wins 都是 0.210,无记忆 0.309;真实文件漂移复现同方向。多跳与超长上下文仍卡在检索链和上下文选择 16 | 扫读。 公众号 AI · arXiv |
| MemWM: Memory-Augmented Text-Based World Model | Yujun Wang 等,8 月 7 日 v1。用转移规则、状态缓存和难预测事实组成 world memory;SSF 检查下一状态是否保住任务事实,再给冻结策略提供 task skill 与逐步纠错 | 对比 SFT,SSF 最高相对提升 206.3%;ALFWorld、WebShop、ScienceWorld 的任务成功率最高相对提升 65.4%。摘要没有绝对值、显著性和代码入口 17 | 扫读。 公众号 AI · arXiv |
技能、系统自进化与评测
| 论文 | 问题 / 方法 | 结果、证据与局限 | 判断与入口 |
|---|---|---|---|
| BONSAI: Evolvability-Guided Tree Search over Skills | Yash Priya Shastri 等,8 月 7 日 v1。用 Monte Carlo 树搜索技能文本;选择分数同时看当前 fitness 与突变邻域还能否持续产出好变体 | 冻结 30B agent、三个基准均值上,比无技能高 23.13 个百分点,比预算匹配的 GEPA / SkillOpt 高 3.87 / 3.97 个百分点。摘要未列基准名和开放仓库 18 | 扫读。 公众号 AI · arXiv |
| ADIAS: Automated Design of Interactive Agentic Systems | Lekang Jiang 等,8 月 3 日 v1。把跨轮修复进度存成带身份、生命周期、证据与干预结果的 issue state,下一轮围绕未解 issue 改完整 agent 代码 | 五个交互基准平均比最强基线高 25.2%;移除持久 issue state 或改回 candidate-centric revision,最多下降 40.7%。摘要未列基准名、绝对分数和代码 19 | 扫读。 公众号 AI · arXiv |
| The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows | Junbo Li 等,8 月 7 日 v1。ReASearch 让同一工具代理自行决定评估、诊断、编辑、验证与重启,并用持久记忆跨长程调整搜索策略 | 14 个任务上,相对领域专用强基线提升 2%—40%,但不同任务指标不能横排,摘要也未给代码与逐任务成本 20 | 扫读。 公众号 AI · arXiv |
| EMAS: Stabilizing Multi-Agent System Evolution through Evidence-Guided Revision | Chao Fei 等,8 月 7 日 v1。把 trace 变成带操作与目标的结构化诊断;同一诊断跨样本重复后才提修订,paired validation 通过后才改拓扑或 prompt | 四基准、两模型的 8 组设置中 6 组最佳或并列;MBPP + Qwen3.6-27B 从 55.09%到 89.12%,每任务 Token 降 62.2%。摘要未给代码与完整演化成本 21 | 扫读。 公众号 AI · arXiv |
| SkillEval: Decomposing Agent Skill Quality into Interpretable Signals | Jiahui Han 等,8 月 7 日 v1。从受控正负技能对学习固定、可检查的隐藏表示方向,分别打分不同技能属性,并据此做定向修订 | 摘要称分数与下游任务表现接近,修订后目标属性和通过率都提高;未报告关键绝对数值、外部模型迁移和代码,当前更像早期诊断器 22 | 扫读。 公众号 AI · arXiv |
| An End-to-End Agent Auditing Engine | Haoning Wang 等,8 月 7 日 v1。A²E 以 Agent Task Protocol 接入不同 harness,Monitor 捕获标准化执行轨迹,再按效率、工具、规划、恢复等维度评估 | 原文报告 model-harness 组合随任务类型明显变化,没有单一组合全胜;摘要未给样本规模和具体分数,证据要读全文补齐 23 | 扫读。 公众号 AI · arXiv · 代码 |
| WebRider: Persona-Conditioned Intent Controllers for Live-Web Assistance | Zhi Li 等,8 月 7 日 v1。把目标、约束、证据义务、答案形式和任务内 persona 写成 intent contract;顶层守合同,中层把意图变成受保护动作,工具层执行 | RiderBench 有 4,096 个合同、42 个网站。强控制器完成 99.2%任务,却只有 38.8%完整遵守约束;说明终局完成率会掩盖路径违约 24 | 扫读,评测优先。 公众号 AI · arXiv · 数据 |
3 篇邻近但值得跟踪
| 论文 | 与目标研究线的连接点 | 证据与限制 | 结论 / 入口 |
|---|---|---|---|
| Explicit, Not Longer: What Makes Epistemic Stance Survive Memory Compression | Alex Kwon,8 月 7 日 v1。直接研究记忆压缩会不会丢掉「可能、未证实、拒绝」这类认知立场,可迁移到 agent memory schema 设计 | 60 条 claim、7 种语域中,labelled field 比括号旁注高约 15 个百分点;Haiku 预注册复现实验为+15.6 个百分点,人工标注 κ=0.75。不同模型对「完整句」机制不一致,作者只主张「显式化,不是加长」 25 | 邻近跟踪。 公众号 NLP · arXiv · 代码与逐试验数据 |
| PHASE-Tree: Modeling Character-State Evolution in Long-Horizon Role-Playing Dialogue | Bo Tang 等,8 月 7 日 v1。不可变 identity root + 可变 persona/session/moment 层,是一种可寻址、局部更新的长程状态表示;LongEvoRoleBench 也把跨 episode 演化与场景内跟踪拆开测 | 4 个长对话与 4 个短对话语料;文本版在外部基线的 12/12 数据集—指标单元领先。200 条盲评中人类与 GPT-4.1 judge 的 Pearson r=0.65;角色扮演指标未必迁移到工具 agent 26 | 邻近跟踪。 公众号 NLP · arXiv |
| ResidencyRL: Reinforcement Learning in Simulated Clinical Environments | Valentin Liévin 等,8 月 7 日 v1。最多 60 轮对话、8 次工具调用,把诊断、管理、沟通、文档和安全写入结构化奖励,是长程多目标 RL 的任务域实例 | 对抗条件诊断准确率 88.0% 对 81.0%,漏掉红旗的比例降 31%;盲评临床医生 87.6%偏好训练后 agent。仍需真实工作流前瞻验证,不能把模拟收益当临床效用 27 | 邻近跟踪。 公众号 AI · arXiv |
研发判断落点
- 信用分配先按环境结构选方法。 能恢复状态、愿意付额外 rollout 成本,FACTOR 能把信用守恒到动作和 Token;同一状态有多分支但不想训练 critic,Gated-BEPO 更省;代码任务已有天然 diff 结构,DiDPO 的信用原子最贴近动作语义。三者不能只按最终成功率横排。456
- 自进化必须把接受门槛写成独立对象。 WebGrader 冻结进化后的奖励器,SkillProx 用同批重跑、回滚和固定验证集门控,EMAS 要求诊断跨样本重复并做成对验证。共同点不是「让 LLM 反思」,而是每次改动都要留下可拒绝的证据。91021
- 记忆研究正在从「存什么」转向「以什么状态交给下一步」。 MemPrism 改视图,MemOPD 修复教师评分时的状态对齐,TEPA 管记忆有效期,Explicit Stance 检查压缩后限定语是否还活着。持久化本身不等于可用,更不等于仍然正确。14151625
- 音频总分该拆掉。 MMAG 已经显示语音清晰、声音一致、语义覆盖、混音保真和时间控制会互相拉扯;SIEDD 则提醒局部编辑还要单独看 WER、说话人保持、频谱与韵律连续、采样成本。做播客生成评估时,先公布分项和失败样例,再谈一个汇总分。1112
音频栏另外 4 篇分别落在语音增强、文本到 MIDI 的机理解释、盘索里调式分类和跨文化文本到音乐描述;都不处理 TTS、播客生成或对应评测,因此不纳入。3
References
- 1人工智能学术速递 8.10
mp.weixin.qq.com
- 2自然语言处理学术速递 8.10
mp.weixin.qq.com
- 3语音与音频学术速递 8.10
mp.weixin.qq.com
- 4
- 5
- 6
- 7
- 8
- 9
- 10
- 11
- 12
- 13
- 14
- 15
- 16
- 17
- 18
- 19
- 20
- 21
- 22
- 23An End-to-End Agent Auditing Engine
arxiv.org
- 24
- 25
- 26
- 27
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
