
8月26日论文雷达:20篇直接命中、3篇邻近,harness演化、轨迹训练与唯一一篇TTS
本期收录20篇直接命中与3篇邻近论文,重点拆解长程智能体的记忆和harness演化、轨迹训练、评测效度,以及本批唯一的直接TTS工作。
8 月 26 日的“人工智能学术速递”和“自然语言处理学术速递”共收录 170 篇论文:前者 117 篇,后者 53 篇。本期逐条核对全部 170 篇。候选只来自人工智能学术速递[8.26]与自然语言处理学术速递[8.26]。12
其中,20 篇论文直接落在长程智能体训练与评测、轨迹学习与自进化、TTS 或播客生成与评测这些主线上,归入“直接命中”;另有 3 篇邻近跟踪,论文主题在这些主线之外,但方法或评测思想可以迁移。排序依次看相关性、机制新意、证据强度、复现条件与研发影响,排在前面的论文值得先读原文。
音频覆盖很薄:本批只有一篇直接 TTS 论文 FireRedAudio,播客生成与播客评测均为 0 篇。
阅读优先级
表里的数值只在各论文自己的实验口径内成立。跨论文可比较的是改动对象、控制组、统计证据和复现门槛,而不是不同基准上的绝对分数。
机制地图:先看究竟改了什么
本批最集中的方向是 harness 与轨迹。第一篇论文提出的 Recuris 只改经验记忆、工作记忆、调用策略和 checker;StarHarness 把 prompt、工具接口、技能、MCP provider、子智能体和 agent loop 全部放进搜索空间;VideoHarness-RSI 再把范围缩到长视频的可执行上下文构造程序。三篇都冻结基础模型,所说的“自我改进”发生在模型外。3417
权重更新路线内部也有明显差别。CAFE 让同一个模型轮流充当搜索 agent 与 critic;AHEAD 保留 GRPO 的更新方向,只重新分配失败轨迹里不同 token 的惩罚强度;Joint Optimization of Tool Creation and Use 提出的 SMITH 在一个策略里混合工具创建和调用任务;SPO++ 修正异步 RL 的样本测度;OPDSearch+ 先用冻结教师对学生自己的在线轨迹做前向 KL 蒸馏,再接 RL。5681119
轨迹也有三种用途。BrowserForge 把轨迹当训练数据;Automata 把多条轨迹压成确定性状态机;The Handoff Tax 把轨迹视为接棒模型要继承的信息。三条路线分别回答“从哪里学”“怎样表示”“交给谁继续”。121316
评测论文提醒研发团队把“可检索”“会使用”“一次通过”“重复可靠”“资源安全”和“裁判有效”分开。MemUse 直接拆开检索与自然整合;AnTrap 加入运行时异常;PeakBench 拆开逻辑规划与物理调度;A Judge Should Know What Changed 则检查裁判是否真的对目标构念敏感。9202124
八篇重点精读
1. Recursive Experiential–Working Memory Evolution for Long-Horizon Agent Harnesses
问题与方法。 Recuris 针对长任务里状态被历史遮蔽、技能调用逐渐错位的问题。任务内的 Working Memory 记录目标状态、证据和 blocker;checker 只接受观察结果支持的状态更新;跨任务的固定 Meta-Agent 根据结构化轨迹,把失败定位到经验记忆、工作记忆规格、调用策略或 checker,再提交局部补丁。基础模型、工具、Meta-Agent 和验证门始终冻结,整个过程没有权重更新。3
结果与证据。 论文完成的 37 个模型-基准对里有 35 个提高。τ2-Retail 上,GPT-5.6 Sol 从 58.33% 到 76.10%,增益 17.76 个百分点,95% CI 为
[+11.84,+23.90];Claude Opus 5 从 72.37% 到 87.94%,增益 15.57 个百分点,区间为 [+10.96,+20.39]。按任务固有长度分成四组后,每组都有增益,最短一组为 17.0 个百分点,最长一组为 44.7 个百分点。结构化轨迹把故障定位准确率从 13.0% 提到 64.8%。3复现与局限。 论文使用 τ2-Bench、SkillFlow 和 Terminal-Bench 2.1,并报告 10,000 次任务重采样 bootstrap、McNemar 精确检验和重跑带宽。Terminal-Bench 的 4 次重试把解决率从 34.5% 推到 58.6%,测试时适配只再加 2.3 个百分点,
p=0.774;这部分证据支持“预算有效”,尚未支持“适配有效”。SkillFlow 缺少留出任务划分,美元成本也未报告。3关系与结论。 这篇论文把“自进化”限定到可验证、可回滚的记忆控制层,控制组和统计报告也最完整。结论:精读。
2. StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments
入口。 arXiv:2608.24804v1,Esakkivel Esakkiraja 等,ServiceNow、Mila、Université de Montréal;公众号条目,arXiv 原文,官方代码。
问题与方法。 StarHarness 把整个外部 harness 当作可执行程序来演化。GPT-5.4 proposer 读取当前代码和搜索任务轨迹,修改 prompt、工具接口、skills、MCP provider、子智能体结构或循环配置;validator 做作用域、导入与冒烟检查;隐藏的 selection tasks 决定是否接受补丁;holdout tasks 只用于最终评测。模型权重保持冻结。4
结果与证据。 GPT-5.4 在 ITBench 从 40.0% 到 75.0%,EnterpriseOps-Gym 从 23.3% 到 43.7%,AutomationBench 的目标得分(target score)从 57.1% 到 83.2%。留出任务分别提高 31.7、15.1 和 29.3 个百分点;冻结后的 harness 迁移给 GPT-5.4-mini、GPT-5.5 与多款 Qwen 模型时也保持增益。每任务估算 API 成本下降 17%–53%。4
复现与局限。 论文公开代码,并披露三个基准的任务规模、接受补丁数和成本。主结果属于成对描述性比较,原文未报告置信区间或显著性检验。AutomationBench 使用的 Finance-100 与基准默认设置不同;用于比较的提示优化基线 GEPA 还同时改变了多项系统设置。4
关系与结论。 StarHarness 适合回答“模型冻结后,系统层还有多少可搜索空间”。结论:精读。
3. CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
问题与方法。 CAFE 让同一个共享参数模型交替扮演搜索 agent 和 critic。在线 RL 学习何时请求反馈以及怎样使用反馈;rollout-derived preference optimization 用最新在线轨迹更新 critic。初始化阶段,管线保留基础 agent 失败轨迹的错误前缀,Kimi-K2.5 定位最早出错的轮次,管线再在该处插入反馈并接上能得到正确答案的续写。5
结果与证据。 Qwen2.5-7B-Instruct 在七个 SearchQA 基准平均得到 52.5 EM、60.7 F1,较最强 RL 基线高 2.1 EM、1.3 F1。答案级幻觉率从 GRPO 的 17.63% 降到 12.60%。单侧更新最终进入平台期,交替更新继续提高,这组消融直接支撑“共演化”主张。5
复现与局限。 在线 RL 使用 8 张 A100,约两天。论文覆盖七个 QA 基准与 BrowseComp-Plus,并给出组件、训练调度和 cross-play 分析;随机种子、多次运行方差、代码链接与完整训练成本均未报告。5
关系与结论。 CAFE 真正改变 agent 与 critic 的权重和数据分布,适合作为参数级自进化样本。结论:精读。
4. AHEAD: Adaptive Hindsight with Environment-Augmented Distillation for Agentic RL
问题与方法。 AHEAD 处理轨迹级奖励把同一个 advantage 广播给所有 token 的问题。失败轨迹中的所有步骤都获得环境反馈;Claude Opus 4.7 分析器只给识别出的错误步骤增加纠错提示。模型分别在原始上下文与加入这些特权信息的上下文下计算 token 概率,两者的对数概率差再用于重加权 GRPO advantage。重加权始终保留 advantage 的正负号,环境结果仍决定更新方向。6
结果与证据。 Qwen2.5-7B 在 ALFWorld 达到 94.5%,GRPO 为 81.2%;WebShop 成功率增益 11.0 个百分点。1.7B 模型的 ALFWorld 增益更大,从 46.1% 到 67.2%。去掉纠错提示会损失 7.0–14.1 个百分点,去掉环境反馈会损失 4.7–7.8 个百分点。6
复现与局限。 三种模型规模都训练 150 步,使用 8×H100;失败轨迹额外调用闭源分析器,推理期取消这部分开销。论文覆盖 ALFWorld、WebShop 与七个搜索问答集,原文未报告种子、置信区间与代码。6
关系与结论。 这篇论文最有价值的部分是“环境反馈管全部步骤,LLM 纠错只管错误步骤”的信号分工。结论:精读。
5. SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents
问题与方法。 SkillForge 给技能调用加上结构化标签,使每次调用都进入轨迹。GRPO 学习环境动作和“何时调用哪个技能”;外部教师 Qwen3-Max 从成功、失败和成败对比轨迹里写出新技能,并根据使用次数与成功率决定保留或修订。技能文本来自教师,RL 直接学习的是调用决策。7
结果与证据。 在相同骨干下,ALFWorld 为 93.6% 对 SkillRL 的 89.9%,WebShop 成功率为 83.0% 对 72.7%,AppWorld 的 SGC 得分为 14.3 对 5.36。去掉显式调用、技能库、多路径归纳或有效性跟踪都会退化。4B 模型演化出的技能库还能直接提升 30B 模型。7
复现与局限。 4B/7B 训练使用 8×H20,30B 使用 16×H20;技能相关开销低于 10%。论文未报告随机种子、方差、代码与数据链接,复现还依赖闭源教师和 Qwen3-Embedding-0.6B 检索器。7
关系与结论。 SkillForge 适合研究技能形成、显式调用和环境证据之间的闭环。若把它概括成“技能由 RL 写出”,就会误解教师与 RL 的分工。结论:精读。
6. Joint Optimization of Tool Creation and Use for Large Language Model Agents
入口。 arXiv:2608.24571v1,Zhi Rui Tam 等,Appier AI Research 与 National Taiwan University;方法名 SMITH;公众号条目,arXiv 原文,官方代码。
问题与方法。 SMITH 在一个策略里按 1:1 混合 build 与 use 任务。build 根据四个问答样例写 Python 函数和 JSON schema;use 只看 schema,从含干扰项的工具池里选择并调用工具。创建出来的 schema 若连同一个策略都调用失败,训练奖励会直接惩罚它。8
结果与证据。 Qwen3-4B 在 held-out Reasoning-Gym 上达到 79.8±1.6,TabMWP-Hard 为 40.4,GQA 为 42.6。GQA 的最高分仍属于用 GPT-4.1 蒸馏的 LATM 56.0;SMITH 的价值在于同骨干迁移:训练中没有使用表格或视觉数据,策略仍能迁移到这两类任务。多项基线给出种子化重评,作者还公开修正了会抬低基线的评分 bug。8
复现与局限。 单张 RTX 6000 Pro 可完成训练,每个会话需 36–72 小时,代码与项目页已给出。当前工具形态限于一个 Python 函数和一个 JSON schema;并行工具调用与多工具联合生成尚未出现。8
关系与结论。 SMITH 把“工具是否好用”改成“创建者能否亲自调用”的闭环,复现条件也较透明。结论:精读。
7. MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation
入口。 arXiv:2608.24189v1,Ryuichi Sumida、Koji Inoue、Tatsuya Kawahara,京都大学,EMNLP 2026 Main Conference;公众号条目,arXiv 原文,代码与数据。
问题与方法。 40 名用户与 GPT-4.1-mini 日记伴侣进行了 4 个月随机化部署,共 1,872 个会话、21,575 轮。七种记忆条件在用户内轮换。MemUse 从真实对话里抽取 72 个记忆时刻和 316 个事实题,同时测 Direct QA、自然回复里的事实引用,以及 Direct QA 答案是否真的进入自然回复。9
结果与证据。 现有基准式 Direct QA 随记忆容量从 19.7% 升到 70.1%,会话满意度基本不变。固定模型和上下文后,LC-100%(把全部历史轮次放入长上下文)的 Direct QA 为 78.8%,自然回复引用率只有 7.9%;207 个配对题中,两者 Spearman
ρ=-0.009。检索正确与自然整合在这组实验里几乎没有关系。9复现与局限。 数据、代码、裁判 prompt 与 negative 集均已发布。自然整合与满意度的
ρ=0.29, p=.046 属观察性关联;Bonferroni 阈值为 0.0083,用户内置换检验为 p=.23。样本中 92.5% 为女性,场景是 AI 日记伴侣。9关系与结论。 这篇论文迫使长期记忆评测从“问得到”转向“该用时会用”,与生产中的自然对话最接近。结论:精读。
8. FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation
问题与方法。 FireRedAudio 在共享 Qwen3.5-9B 上设置两条连续输入通路。理解通路由 Whisper-large-v3 初始化的 Audio Encoder 提供紧凑特征;生成通路用 24 kHz 的 RedAE 保存可重建细节,再由 flow-matching DiT 生成 latent。五阶段训练依次完成 adapter 对齐、encoder 适配、统一中训、多任务后训和最长 1 小时的长上下文扩展。10
结果与证据。 Seed-TTS-Eval 上,中文 CER 0.83、英文 WER 1.56,平均内容错误 1.20%;平均说话人相似度为 0.71,低于 Seed-TTS 的 0.78、DiTAR-1B 与 CosyVoice3 的 0.75。InstructTTSEval 的中英六类任务全部第一,但这些分数由 Gemini 2.5 Pro 自动裁判。10
复现与局限。 代码、权重、Demo 已发布。论文披露约 180B、390B、990B、511B、591B token 的五阶段数据量,GPU 数、GPU 时和总训练成本未报告。TTS 证据由内容错误率、说话人相似度和 LLM 裁判构成;MOS 与人类听测未报告。10
关系与结论。 这是本批唯一直接命中 TTS 生成的论文。它最值得核验的是“解耦连续表示”能否同时保住理解与生成,而非一张综合榜单。结论:精读。
十二篇值得扫读
训练信号与在线轨迹
SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL(2608.24870)。 Kai Ruan 等,中国人民大学、中科院、Duke;公众号条目,arXiv 原文。论文用 action-token 测度归一化修正长短轨迹权重错配,再按策略事件而非返回顺序维护 prompt 级记忆。0.8B ALFWorld 的曲线面积从 0.532 到 0.722,差值
+19.00±8.95 个百分点;归一化配对消融为 +10.70±3.98。小模型、有限训练预算与无代码降低了复现强度。它直接命中异步 agentic RL,值得扫读。11OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning(2608.24310)。 Qinglin Ye 等,中科院、澳门大学、武汉大学等;公众号条目,arXiv 原文。3B 学生先在自己的实时检索轨迹上接受冻结 14B 教师的逐 token 前向 KL 蒸馏,再用 GRPO 微调。七个 QA 基准平均 EM 为 0.4402;相对最强 3B 基线,HotpotQA 提高 13.1%,2WikiMultihopQA 提高 8.5%。论文给出训练稳定性和目标函数消融,代码与完整算力未报告。它把轨迹蒸馏与 RL 的分工写得清楚,值得扫读。19
轨迹数据与程序表示
BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes(2608.24848)。 Fei Tang 等,浙江大学与腾讯;公众号条目,arXiv 原文。并行浏览器沙箱、Proposer–Solver 与规则/模型清洗管线生成 203,238 条轨迹,每条来自不同网站。Qwen3.5-4B 在 Online-Mind2Web 的成功率从 25.66% 到 33.33%。100 条失败样本中,重复点击、回退和滚动合计 71%,说明下一个瓶颈是动作后反馈与自我监控。数据规模直接命中轨迹学习,值得扫读。16
Automata from Agent Traces: Failure and Next-Step Prediction(2608.23670)。 Seonglae Cho 等,Holistic AI、PUC-Rio、UCL;公众号条目,arXiv 原文。论文用确定性、无训练超参的过程挖掘方法,把轨迹合并成 7–43 个状态的 FSM。12 个数据集 held-out replay fitness 至少 0.997,失败预测 AUROC 最高 0.94,next-step 预测在 8/8 数据集超过 AWM。FSM 只保留观察轨迹的 directly-follows 闭包,无法代表 agent 的生成语言。它提供了轨迹压缩与在线监控的轻量基线,值得扫读。12
Metan: Recursive Self-Improvement through Emergent Depth(2608.24735)。 Zae Myung Kim 等,University of Minnesota 与 Seoul National University;公众号条目,arXiv 原文,官方代码。固定元操作反复读取前层轨迹与代码,写出更深的策略前处理和 helper 库;演化 archive 在层链之间搜索。Gemma 条件下,Metan 的 archive-best 在 CO-Bench 为
0.851±0.014,对照方法 OpenEvolve 为 0.814±0.022;GPT-5.2 条件下,Metan 在 ARC-AGI-2 得到 0.331±0.010。递归和 archive 搜索共同贡献增益,最佳深度通常为 3–6 层。它直接命中递归自进化,值得扫读。18Harness、交接与状态传输
VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models(2608.24302)。 Guoyang Xu、Hao Chen,腾讯;公众号条目,arXiv 原文。论文冻结 Qwen3-VL-8B,把 Write–Read–Pack 上下文构造程序交给 propose–execute–evaluate–retain 外环搜索。LVBench 的 Uniform-40 留出准确率为 36.3%,手工 AKS 为 46.5%;搜索从两个起点都继续提升,选出的 harness 冻结后再测。选择依据是 dev 点估计,部分上下文日志无法重建,文献基线也只是统一接口下的结构适配。它清楚隔离了 harness 与模型能力,值得扫读。17
ReproAgent: Contract-Guided Paper-to-Code Reproduction(2608.24291)。 Xue Hu 等,北航、上海交大、北大等,EMNLP 2026 Findings;公众号条目,arXiv 原文,官方代码。Prepare–Plan–Generate–Repair 四阶段共享一份实现合约,把论文明确要求实现的内容和参考仓库证据绑定到文件级任务。Gemini-3-Flash 同骨干对照为 39.7 对 30.5;移除 reference evidence 或 implementation requirements 后分别降到 21.6 和 25.6。20 篇论文、每个设置一次运行,统计检验未报告;外部系统预算不同。它是长流程规格记忆的工程样本,值得扫读。22
The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents(2608.24358)。 Roy Ganz 等,AWS Agentic AI;公众号条目,arXiv 原文。论文在 SWE-bench Verified 上跨两组模型家族、两个切换方向、七个切换点和四种交接接口,完成 58,000 次运行。低能力模型升级到高能力模型时,接棒模型读取完整轨迹后,只能追回两种模型原有质量差距的不到一半;压缩或删除低能力轨迹通常更好。高能力模型降档时,保留原轨迹反而有帮助。研究范围集中在编码 agent 与两组商用模型,但交接方向与信息量的交互对长程 agent 很实用。结论:值得扫读。13
When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows(2608.24569)。 Yiheng Sun 等,深圳大学;公众号条目,arXiv 原文。1,296 个受控 episode 把停止状态、未决前提、权限和 fallback 四个字段从上游交给下游。常规 handoff 压缩使状态失活率达到 100%,禁止动作率 54.2%;恢复四字段后两者均回到 0。配对风险差、task-cluster bootstrap 与盲审面板让证据很扎实;任务族仍是合成企业场景,代码未报告。它直接回答交接摘要怎样丢掉操作约束,值得扫读。14
Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows(2608.24842)。 Miao Liu、Zhizhe Liu,Boston College 与 Columbia Business School;公众号条目,arXiv 原文。论文在 12 家公司的受控披露上,把无关上下文从 2K 拉到 128K。Qwen3.5-9B 中,一段风险披露对卖出概率的影响从 3.2 个百分点降到实验噪声附近,128K 时仍能在 12/12 公司中正确检索。generic chunk-and-summarize 会丢掉目标披露,决策前的定向结构化重述把 128K 影响恢复到 8.5 个百分点。论文自称初步稿,复现包计划后续发布。它连接长上下文、工作流和终点行为,值得扫读。15
运行时与资源评测
Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap(2608.24099)。 Guo Gan 等,浙江大学、Yale、国科大、同济;公众号条目,arXiv 原文。236 个 Android 任务加入四层十类动态异常,评测 16 个 GUI 模型。Claude Sonnet 4.6 的 Pass@3 成功率从 74.2% 降到 66.5%。用含异常的环境做 GRPO 后,模型在单步状态或动作陷阱上的成功率提高约 8–11 个百分点,深层死锁和循环增益低于 3 个百分点。主结果无显著性检验,代码在提交时仍标为即将发布。它把“运行中恢复”从一次成功率里拆出来,值得扫读。20
PeakBench: Benchmarking Resource-Aware Tool Invocation in LLM Agents(2608.24509)。 Zhi-Kai Chen 等,南京大学;公众号条目,arXiv 原文,官方代码。约 1.2K 个 MCP 工具组成 300 个可执行工作流,评测把依赖恢复和给定 oracle 结构后的资源调度拆开。GPT-5 的依赖规划最佳之一,资源调度仍接近较弱规划者;加入资源画像后,多数模型同时降低延迟和容量违规。人工审计约 100 个工作流,94% 与最优结构一致;统计检验未报告。它适合补上“工具会调用之后,能否安全并发”这层,值得扫读。21
三篇邻近跟踪
Memory Is Not Always Needed: Characterizing Conditional Memory in Scientific Reasoning(2608.23982)。 Zhen Bi 等,湖州师范学院、阿里巴巴、Bota Biosciences、浙江大学;公众号条目,arXiv 原文。外部 router 决定是否启用记忆,内部 router 决定在 Transformer 哪一层、prefill 或 decoding 阶段以多大强度注入。在按错误类型和预测稳定性分出的不同任务子集里,记忆的影响会改变方向:部分子集提高 2–5 个百分点,另一些子集反而下降;整体增益多为 0.01–0.05,显著性检验、独立泛化与代码未报告。连接点在“长期记忆也需要准入和注入位置”,任务本身是科学推理。结论:邻近跟踪。23
A Judge Should Know What Changed: Construct Validity for LLM-as-a-Judge Evaluation(2608.24419)。 Jianlin Chen 等,华南理工与澳门大学;公众号条目,arXiv 原文。论文把 judge 效度拆成不变性 S 和构念敏感性 R。七个 judge 在匹配
S≥0.90 时平均 S=0.945,R=0.319;公开偏好数据的表面预测器能复现 55–67% 标签。三名人类标注、预注册门槛、bootstrap 和置换检验支撑很强。摘要提到的“准确性压力产生相反响应”在正文中标为预测。连接点是 agent 与 TTS 自动评测必须验证裁判真正感知了目标变化。结论:邻近跟踪。24Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight(2608.24314)。 Anupam Purwar 等,Sprinklr AI;公众号条目,arXiv 原文。242 段真实语音智能体对话由三名标注者和 GPT-4.1/GPT-5 按十项指标评分。Retail 的跨指标相关为
r=0.912/0.943,Telecom 的 GPT-4.1 只有 r=0.295, p=.408;安全与恢复指标偏差最大。当前裁判主要看转录文本,停顿、打断、重叠说话和 barge-in 留待未来音频评测。连接点在指标级校准与人工复核,论文没有评 TTS 或播客生成质量。结论:邻近跟踪。25研发检查表
- 先标改动层。 权重、训练信号、轨迹数据、技能文本、harness、交接工件与评测协议要分开记录。基础模型冻结时,增益应归给系统层。
- 把冻结控制组写完整。 比较是否固定模型、任务划分、工具、重试预算、上下文预算和 judge;任何一项变化都会改变解释。
- 状态和轨迹分开保存。 当前任务状态、历史证据、工作区副作用与原始轨迹承担不同作用。交接测试要同时试完整轨迹、结构化摘要、只保留状态,以及 fresh restart。
- 成功率之外测重复可靠。 至少同时报告 pass@1、固定预算下的重复完成、成功转失败回归、持久状态和副作用检查。
- 自动裁判先做构念测试。 给 judge 一组只改格式的样本,再给一组只改目标质量的样本。前者测不变性,后者测敏感性。
- 成本要拆阶段。 教师调用、rollout、验证门、搜索、重试、推理时额外 token 与人类复核分别记账。总成功率无法说明增益来自学习还是预算。
- 复现条件写到可执行。 代码、数据、许可证、模型版本、硬件、种子、训练时长、外部闭源依赖和发布状态都要进入评审表;原文未报告的项目保留“未报告”。
- 音频指标按链路分层。 TTS 至少分内容错误、说话人相似度、主观自然度、表达控制和最终用户判断。自动 ASR、内部表征或 LLM 裁判只覆盖其中一层。
本批最值得带回研发流程的判断很具体:长程 agent 的提升常常来自模型外的记忆、harness 和交接设计;训练论文之间的差别在于谁写信号、谁改权重、谁承担闭源依赖;音频线目前只有 FireRedAudio 能支持生成侧判断,播客方向继续等待合格候选。
References
- 1人工智能学术速递 8.26
mp.weixin.qq.com
- 2自然语言处理学术速递 8.26
mp.weixin.qq.com
- 3
- 4StarHarness
arxiv.org
- 5CAFE
arxiv.org
- 6AHEAD
arxiv.org
- 7SkillForge
arxiv.org
- 8
- 9MemUse
arxiv.org
- 10FireRedAudio
arxiv.org
- 11SPO++
arxiv.org
- 12Automata from Agent Traces
arxiv.org
- 13The Handoff Tax
arxiv.org
- 14When Must Becomes Maybe
arxiv.org
- 15Reading Is Not Using
arxiv.org
- 16BrowserForge
arxiv.org
- 17VideoHarness-RSI
arxiv.org
- 18Metan
arxiv.org
- 19OPDSearch+
arxiv.org
- 20AnTrap
arxiv.org
- 21PeakBench
arxiv.org
- 22ReproAgent
arxiv.org
- 23Memory Is Not Always Needed
arxiv.org
- 24A Judge Should Know What Changed
arxiv.org
- 25
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
