
8月21日论文雷达:8篇直接命中、10篇邻近,先把自进化的增益、状态与可靠性拆开看
本期把8篇直接命中与10篇邻近论文放在同一张比较表上,重点解释自进化增益如何审计、记忆如何跟踪演化状态,以及可靠性与音频评测为何不能只看一次成功或单一自动指标。
这批真正值得先读的,不是「又有几篇方法把分数推高了」,而是三件更具体的事:自进化的增益能不能对着零假设站住,记忆有没有跟上世界状态,评测能不能把一次成功和可靠完成分开。8 月 21 日三个允许栏目共收来 114 篇候选;本文收录 8 篇直接命中、10 篇邻近跟踪。严格意义上的 TTS 生成或播客生成论文,本批没有达到直接命中门槛,音频部分因此只保留语音助手评测、音频模型诊断,以及一个可迁移到语音生成的编解码工作。
先决定读什么
| 优先级 | 先读这些 | 读它们要回答的问题 |
|---|---|---|
| 精读 | SAPO、StateMem、Phantom Gains、Thinkingbox | 长程训练如何分配信用,记忆如何追踪被改写的状态,所谓自我改进如何排除测量伪影,可靠性如何落到最终状态 |
| 值得扫读 | AI4AI-Bench、Task-CoEvolve、TMI、Hear2Act | 自进化究竟改了什么,验证集能否随 harness 一起变化,轨迹怎样变成可审计任务模型,语音线索怎样进入行动 |
| 邻近跟踪 | EnvHarness、Learning When to Think、MemTrapBench、Remember, Verify, or Ask?、Break It Down, Pass It On、BPS、SWE-bench Science、ASR Benchmark Optimization、Fourier is Frontier | 把环境、计算预算、技能形成、技能选择、基准反作弊和音频保真度中的机制迁回主线 |
表里的「直接命中」指论文自身就在研究长程智能体训练/评估、轨迹学习、自进化或语音交互评测;「邻近跟踪」不是「也许有点像」,而是论文给出了能迁移的机制。比如 Fourier is Frontier 不是 TTS,仍然值得看,是因为它把音频保真度拆成频率、相位、空间线索和主观评分,而不是因为标题里有 audio。
候选从哪里来,哪些边界不能混
本期候选只来自 人工智能学术速递[8.21]、自然语言处理学术速递[8.21] 和 语音与音频学术速递[8.21]。公众号条目负责确定候选归属,论文原文负责核验方法和结果;没有用 arXiv 搜索另行扩池。
公众号这批条目的发布时间是北京时间 8 月 21 日 12:31:43。个别论文的 arXiv v1 日期早于栏目日期,本文照实标注,不把「今天被栏目收录」偷换成「今天才提交」。例如 Represented but Ignored 的 v1 页面显示为 6 月 12 日;它保留在本期,是因为它确实出现在 8 月 21 日 NLP 栏目中,但不应被当成 8 月 21 日新提交。
一、直接命中:训练和自进化先过三道审计
这组论文看似都在「让智能体变强」,实际改动对象完全不同:SAPO 改策略优化,AI4AI-Bench 测训练算法设计,Phantom Gains 审计增益是否存在,Task-CoEvolve 改验证任务选择。把它们压成一个「RL 有效」结论,会丢掉最有用的差异。
1. SAPO:把长程信用分配放回同一条自回归主干
SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning 处理的是 critic-free、组相对方法在长程交互里的三个问题:没有显式价值泛化和时间信用分配,复杂任务中优势估计容易塌缩,多个 rollout 又带来采样开销。它让策略和价值函数共享一个自回归主干,在因果边界处分出策略与价值预测;训练时同时优化 PPO 目标和 on-policy SARSA 辅助目标,再用带 lambda-return 和 batch normalization 的轨迹级 GAE 估计优势。
实验在 ALFWorld、WebShop 上用 Qwen2.5-1.5B/7B 对比 PPO 与 GRPO。论文摘要报告,SAPO 相对 PPO 平均高 15.1 个百分点,相对 GRPO 平均高 12.1 个百分点;每次迭代运行时间比 PPO 少 33.2%,同时不需要独立 critic 模型。这里的证据仍主要是摘要级:没有代码链接,更多任务、更多模型和共享主干在更长训练中的稳定性,原文摘要没有展开。
关系与结论:精读。 它值得先读,不是因为「+15.1」本身,而是因为它把长程 RL 的瓶颈重新写成「价值如何沿自回归边界传回去」。读全文时应重点看 SARSA 辅助目标怎样和策略目标耦合,以及收益是否来自信用分配而不是某个基线实现细节。
2. AI4AI-Bench:自进化不再只看模型把题做对
AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 把递归自改进的对象限定得很清楚:智能体要设计能改进后续 AI 系统的训练算法,而不是只改 prompt、搜数据或调超参。基准冻结 10 个研究仓库和 10 个训练算法家族。每个任务给智能体 4 小时、单块 B300 去改写训练算法,随后从头重跑最多 12 小时,再交给隐藏的固定评估器评分。论文把 10 个不可直接相加的指标映射到统一尺度:0 是无信息模型,0.1 是仓库原有算法,1.0 是任务最优。
在 29 种配置、6 个系统和 10 个任务上,平均分是 0.166,最强系统是 0.250;换句话说,最强系统闭合已有算法到最优值之间的距离还不到五分之一。真正改变学习方式的提交平均得分 0.226,其余提交是 0.126;增加推理努力后,这类提交的比例从 8% 升到 64%,平均分从 0.094 升到 0.196。
证据强弱与局限。 这是一套把「改训练过程」和「改运行过程」分开的测量设计,论文还声明会释放任务套件、评估器和已评分提交。但成本很高:10 个任务各自包含长时间改写和重跑,第三方全面复测的门槛不低;摘要没有给出具体代码 URL,也没有证明这些结果能迁移到别的研究仓库。
关系与结论:值得扫读。 它最有用的地方是给「自进化」补了操作定义:先问智能体有没有改变学习规则,再问分数有没有涨。对于自进化训练线,这个顺序比先看平均成功率更可靠。
3. Phantom Gains:先问「增益」是不是测出来的
Phantom Gains: Auditing Self-Improvement Against a Measured Null 针对的是自我改进论文常用的逐题得失分析:两个带噪声的能力估计做差,很容易把采样、解码和统计口径当成能力变化。作者对 Qwen3-8B 做三轮 rank-32 LoRA 自训练,同时让一个冻结控制组走完全相同的流程,随后列出 7 类会反转结论的测量失效,包括单次贪心解码账本、推理批处理伪影,以及把未训练模型算出 0.280 获取率的扩张统计量。
论文提出逐问题精确检验,再用 pooled baseline 和 FDR 控制替代自然阈值。在它的设置里,外部蒸馏能改善基座模型很少触及的题目,而三种自训练做不到;自训练在基线已经解决的题目上的破坏率也高于实测下限。把方法放到留出复现上,逐题精确检验没有检出伪增益。论文明确给出 代码与评估产物。
证据强弱与局限。 对「没有控制组就不能相信逐题增益」的审计很有力,但实验集中在一个模型和一种 LoRA 自训练设置;作者也提醒,没被模型见过的题目不能单凭这套测试证明什么。它不是在证明所有自进化都无效,而是在要求每个自进化结论先对着 measured null 做一次审计。
关系与结论:精读。 这篇和 AI4AI-Bench 组成一对:前者问「有没有真的改变学习算法」,后者问「报告出来的增益是否只是测量伪影」。研发决策应先把两个问题分开。
4. StateMem:记住旧事实,不等于跟上新状态
Can Agent Memory Systems Track Evolving State? 认为多数记忆基准评估的是 recall,而长程系统真正需要的是 state tracking:事实、约束和决定会在多轮互动中被修订,智能体必须回答当前状态,而不是检索出已被取代的旧状态。论文构建 StateMemBench,包含 234 个多会话场景和两种会话长度设置;closed-pool 评分把答案分成当前状态、被取代状态和其他失败。StateMem 则显式追踪 supersession 与关系依赖,也可以作为轻量 wrapper 套在现有记忆系统上。
作者比较了 RAG、长上下文和多种记忆系统,覆盖 DeepSeek-V4-Flash、Qwen-3.5-9B 以及 6 个记忆/检索后端。在 DeepSeek-V4-Flash 上,当前状态准确率从同骨干最强基线的 0.205 提到 0.363;在 Qwen-3.5-9B 上从 0.149 提到 0.233。wrapper 套在 6 个后端上,提升幅度为 32 到 67 个百分点;长度和成本匹配的对照把其中 15 到 32 个百分点归因于状态结构,而不是额外上下文。
证据强弱与局限。 多后端对照让证据比单一记忆系统更扎实,但 234 个场景仍不大,基准与方法由同一篇论文构建,arXiv 页面没有代码链接。原文摘要没有说明这些状态关系在真实工具环境中会不会遭遇更复杂的写入冲突。
关系与结论:精读。 它把「记忆命中率」换成了更适合长程任务的错误类型:答对了旧事实,仍然可能把当前任务做错。任何轨迹学习或自进化系统,只要会把经验写回记忆,都应该补一项 supersession 评测。
5. Task-CoEvolve:验证任务也要随 harness 改变
Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection 研究的是不更新模型权重、只反复改写 harness 代码的优化流程。固定验证集每轮全量运行,后期会把大量预算花在已经不能区分候选 harness 的任务上。Task-CoEvolve 让任务和 harness 协同演化:重点采样候选 harness 分歧大的能力边界任务,再按采样概率校正全集分数,让不同迭代仍然可比较。
论文在在线文本分类和 Terminal-Bench 2.1 上实验。相对固定子集基线,它保持了全集搜索的最终性能,同时把优化阶段的评估次数减少 80%。论文给出 代码仓库,但研究只有两个实验域;摘要没有给出收益上界或更多环境中的结果。
关系与结论:值得扫读。 它提供一个很实用的迁移点:长程系统的验证集不是永恒不变的背景,而是优化回路的一部分。若模型、harness 或环境在共同演化,评估任务也要保持区分度,否则所谓进步可能只是评测预算的浪费。
来源:公众号·自然语言处理 · arXiv 原文
6. TMI:从交织的操作轨迹中抽出任务模型
Inducing Task Models from Computer-Use Traces 认为自然主义计算机使用轨迹不只是「一步一步怎么点」:人和智能体经常同时推进多个目标,低层鼠标、键盘和截图事件会交织在一起。TMI 先在无约束轨迹中发现潜在任务并解开并发活动,再为每个任务诱导递归目标分解的分层目标模型,以及组织执行的控制流过程模型。
论文用受控的人类与智能体轨迹做内在评测,检查交织任务分组一致性和执行步骤重建;再把诱导出的任务模型转成技能,测试 held-out 任务。任务分组与真值的一致性是 0.974,模型重建了 74.9% 的观测执行步骤;由 TMI 任务模型派生的技能,held-out 任务准确率比最强基线高 30.0%。摘要没有给出代码链接,也没有展开真实开放环境中的轨迹噪声。
关系与结论:值得扫读。 这条路线和把整段成功轨迹直接蒸馏成技能不同:它先把交织轨迹拆成可审计的任务结构,再谈复用。读者若在做轨迹学习,最值得比较的是它的「任务发现—目标分解—控制流」三层是否能解释失败,而不是只看最终技能准确率。
来源:公众号·自然语言处理 · arXiv 原文
7. Thinkingbox:一次成功,为什么不能叫可靠
One Success Isn’t Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows 把评测对象从「回答像不像」换成最终状态有没有正确改变。Thinkingbox 提供隔离的 MCP 兼容工具会话、完整执行轨迹和终端后端状态评估;Thinkingbox-bench 包含 507 个带策略条件的业务工作流,覆盖零售、酒店、车险、数字银行内部 IT,以及咨询 IT/HR 支持等场景。每次尝试都由任务特定的可执行检查拒绝错误、缺失和额外副作用。
最强模型的 pass@1 是 65.36%,但 pass^20 只有 25.25%。很多失败尝试其实干净终止,并完成了部分有效状态变更;这说明回答质量和工具调用质量都不能代理端到端完成。论文明确释放 Thinkingbox 与基准代码。
证据强弱与局限。 状态检查和 507 条工作流让「可靠性」变得可计算,但论文由微软团队主导,摘要没有列出模型明细;业务工作流与研究、音频生产的差异也需要读者自己判断。它的数字不能直接当成所有长程智能体的普遍失败率。
关系与结论:精读。 pass@1 与 pass^20 的落差,正好是长程研发最容易漏掉的字段:单次找到一条成功轨迹,不等于系统能在重复运行中可靠地完成状态迁移。
来源:公众号·自然语言处理 · arXiv 原文
8. Hear2Act:韵律信息必须穿过中间状态,才会影响动作
Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does 评估的不是模型能否转写语音,而是用户没有把顾虑说在词面上时,韵律是否会改变助手下一步怎么做。基准含 480 个 persona-grounded 场景、隐藏的用户顾虑和可客观验证的结局;同一任务分别提供词面明确的反馈和主要靠韵律表达的反馈,再比较 transcript、audio 和 concern-state 三种条件。
在 prosody-mediated 条件下,把 audio 直接加到 transcript 只让平均最优解率从 14.6% 升到 15.3%。模型若先从音频推断顾虑状态,把它转成文本中间表征,再用于下一步动作选择,最优解率升到 39.6%,接近提供真值状态时的 40.7%。两个音频能力 LLM 的具体名称和代码链接,摘要没有报告。
关系与结论:值得扫读。 它对语音助手评测是直接命中,对 TTS 和播客生成则不是:论文测的是听懂韵律后是否行动,而不是生成声音。迁移点很明确——语音生产系统若要评估「表达是否改变了用户行动」,不能只测 ASR 或 MOS,还要把隐含状态和最终动作接起来。
来源:公众号·自然语言处理 · arXiv 原文
9. Represented but Ignored:音频模型可能听到了,却没有用出来
Represented but Ignored: A Causal Account of Prosodic Underuse in Audio-Language Models 的 v1 页面日期是 2026 年 6 月 12 日,但论文被收录在本批 8 月 21 日 NLP 栏目,因此作为本期补读项保留。它用 stage-specific probe ladder 检查 4 个理解型 audio-LLM:韵律信号通常留在音频通路里,在 LLM 后期状态仍可解码,却只部分进入最终回答。隐藏状态干预会按预测方向移动答案分布,多数模型—任务组合中,编辑一个相关层就能把输出推向原本被压制的韵律决策。
但这不是「修好了」的证据。作者明确说,干预带来的是方向性恢复,不是对正确类别的选择性恢复;数据集名、代码链接和更广模型范围,摘要没有报告。
关系与结论:邻近跟踪。 它和 Hear2Act 形成「结果—机制」配对:Hear2Act 说明音频到行动的中间状态有用,Represented but Ignored 追问模型究竟在哪一层把信号丢掉。对 TTS/播客评估来说,至少要把「声音包含了目标线索」和「听者能据此做出目标判断」分开。
来源:公众号·自然语言处理 · arXiv 原文
二、邻近但值得跟踪:把机制迁回研发主线
环境、计算与评测回路
EnvHarness: Awakening Static Worlds for Agent Learning 把静态环境包成可编程插件层,不改底层逻辑却能重塑环境行为;EnvRigger 把策略当黑盒,从执行轨迹诊断弱点,合成针对性的组件,再用新 rollout 验证。四个领域、五个基准上的 held-out 实例最高提升 9.0 点,执行步骤少 9.8%。它与长程自进化的连接点是「策略和环境共同演化」,但论文摘要没有长期闭环实验,也没有报告代码链接。结论:邻近跟踪。公众号·人工智能 · arXiv
Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation 让模型在回答首 token 选择 NoThink、Short 或 Long 三种模式,在 GRPO 中学习路由,不用独立 router;形状奖励提供模式差异,硬 token 上限保持分离。1.5B 模型在 MATH500 上平均响应从 4,796 降到 2,811 token,减少 41%,但准确率 0.796 降到 0.782;GSM8K 上 token 减少 76%,相近长度下准确率高于基线。它对长程系统的迁移点是「先决定是否值得想,再决定怎么想」,但实验规模和跨基准范围有限。结论:邻近跟踪。公众号·人工智能 · arXiv
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use 把记忆评估从「能否检索」推进到「检索到的记忆是否把当前推理带偏」,覆盖 reasoning fixation 和 belief distortion 两类陷阱。两个模型家族、5 个记忆框架的结果显示,所有被评估的记忆策略都低于 no-memory,最强方法也下降超过 10%;AdaptiveMem 在缓解陷阱的同时,保持或提升标准记忆基准表现。论文页面标注 Work in progress,且没有代码链接。它与 StateMem 的连接点是互补:StateMem 防止使用过时状态,MemTrapBench 防止忠实但有害的记忆支配当前推理。结论:邻近跟踪。公众号·人工智能 · arXiv
Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM Agents 研究的是记忆—澄清边界:一条信息应该持久化、只在当前上下文使用、先重新验证,还是问用户。MCB 含 140 个主场景、70 个对照项;两位非作者标注者的一致率是 97.1%,κ=0.962。Claude 与 Qwen 的结果显示,模型更容易验证变化事实,却不愿向用户澄清歧义;few-shot 提示把准确率从 0.557 提到 0.771,但澄清召回仍只有 0.333;策略提示把错误持久化从 0.243 降到 0.100。它的迁移点是把「写入记忆」当成一个需要承担后果的动作,并同时检查文字决定和结构化工具调用。结论:邻近跟踪。公众号·自然语言处理 · arXiv
技能怎样形成,又怎样被选进上下文
Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents 做了受控对照:任务级技能还是子任务级技能,文本格式还是代码格式。任务级技能大多让性能降到 no-memory 以下,子任务级技能平均带来提升;文本技能优于代码技能。论文还提出 specificity × abstractness 的技能效用分数,只看技能和任务描述就能预测迁移效果,不需要再次执行任务。它和 TMI 的互补关系是:TMI 研究怎样从交织轨迹抽出任务模型,本篇提醒任务级压缩可能把无关细节和错误一并带进来。摘要没有列出任务域或代码链接。结论:邻近跟踪。公众号·人工智能 · arXiv
Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees 把技能选择建模成有硬 token 预算的组合优化:目标是最大化单调子模收益,同时扣除上下文惩罚。Best Prefix Selection(BPS)给出首个技能选择双准则保证,在受污染控制的 BigCodeBench 变体上,任务成功率是 0.73,已发布路由器、文本检索器和执行器自带选择落在 0.20–0.52;相比最强已发布路由器,token 少 28%。证据的强处是理论保证,弱处是只有一个基准变体且没有代码链接。它与 Break It Down 前后相接:一个问技能怎样造,一个问有限上下文里选哪些。结论:邻近跟踪。公众号·人工智能 · arXiv
可靠性标准怎样迁移到科学和音频
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? 把仓库级科学软件工程做成 119 项任务、98 个仓库、20 个科学领域的基准,并用 Issue-driven、Expert-exploratory、Engineering-integration 三种范式评测。最强智能体的 pass@1 仍低于 50%;消融显示科学知识不是一律有益:好的指导能约束修复并提高平均性能与 token 效率,差的指导会诱发锚定。它与 Thinkingbox 的连接点是都把「能输出一个像样的答案」换成最终工程结果,并且都要求解释失败机制。结论:邻近跟踪。公众号·自然语言处理 · arXiv
Towards Quantifying Benchmark Optimization in ASR Models 不是 TTS 论文,而是一套很适合迁移到生成式语音评估的反作弊方法。作者针对音频不足以唯一确定参考转写的场景,设计 reference disagreement、masked-number recovery、orthographic switching 三类探针;最高分开源模型在音频矛盾、掩码或有歧义时,仍会逐字输出基准参考片段。低秩线性 steering 或在片段末尾追加音频,可以因果操控这种 benchmark-conditioned 行为。论文没有在摘要中报告具体模型、基准或代码链接。对 TTS/播客评估的连接点是:自动指标高,不等于生成音频在未见内容上忠实;应主动构造「声学证据不足或冲突」的测试。结论:邻近跟踪。公众号·语音与音频 · arXiv
Fourier is Frontier: Frequency-Aware Autoencoding for High-Fidelity Music Reconstruction 提出 ear-VAE2 复频谱自编码器、按频率初始化的 Spec-SnakeBeta,以及按频带修正幅度和相位的 Duplex-Aware Refiner。在 546 首歌曲的 Song Describer Dataset 上,ear-VAE2 在 7 项重建指标中有 5 项取得最佳点估计;Refiner 让 Mel Distance 降低 19.4%,残差输出维度比 Unconstrained Refiner 少约 45%,同时降低谱距离和空间线索误差,并得到专业工程师更高评分。下游生成器使用 ear-VAE2 latent 后,在 12 项自动指标上都得到更好的点估计。
它没有在 TTS 或播客语音上验证,摘要也没有报告置信区间或显著性检验;因此不能写成「TTS 已被证明更好」。它的迁移价值在评测拆分:高频损失、相位一致性、立体声/空间线索和工程师主观评分,应当和单一 Mel 或 ASR 指标并列。结论:邻近跟踪。公众号·语音与音频 · arXiv
三、把这批论文放在同一张研发检查表上
- 先分清改动对象。 SAPO 改模型的策略和值函数,Task-CoEvolve 改 harness,EnvHarness 改环境,BPS 改技能集合,TMI 改轨迹的表示。它们都可能让最终分数上升,但没有一个能替代另一个。
- 给自进化加零假设。 AI4AI-Bench 问是否真的改变了训练算法,Phantom Gains 问增益是否只是测量伪影。没有冻结控制组、留出复现和逐题统计时,不要把「新策略赢了」写成「系统自我改进」。
- 把记忆错误拆成三类。 StateMem 追踪被取代的事实,MemTrapBench 检查相关但有害的记忆,Remember, Verify, or Ask? 检查模型是否在不确定时选择验证或澄清。只报 recall,会把三类错误混在一起。
- 把一次成功和可靠完成分开。 Thinkingbox 的 pass@1 / pass^20 落差提醒我们,重复运行、持久状态和副作用检查应该成为长程基准的一部分。SWE-bench Science 进一步说明,即使加入领域知识,错误指导也可能让系统锚定在表面修复上。
- 给音频质量加上「证据是否真的被使用」这一层。 Hear2Act 测的是韵律能否改变行动,Represented but Ignored 测的是信号是否在模型内部被压制,ASR Benchmark Optimization 测的是公开基准是否被投机,Fourier is Frontier 测的是生成音频的频率和空间保真度。它们共同指向一个边界:转写分数、内部表征、自动质量指标和最终用户判断,不是同一个变量。
本批最值得带回研发流程的结论,不是某一篇论文的单点提升,而是一条排列顺序:先确认状态和轨迹被正确表示,再确认改动对象确实发生了变化,最后用可重复的最终状态和反作弊评测验收。至于 TTS 或播客生成,本期没有足够直接命中的新论文,下一批仍应单独寻找生成方法和面向语音成品的评测,而不是用音频邻近项填补空位。
证据说明:本文数字和方法均以对应 arXiv v1 页面或页面明确链接为准;论文未报告的模型名、数据集、代码、置信区间或跨域结果,文中已直接标注。公众号链接只用于证明候选来自本期三个允许栏目,不承担论文实验结果的核验职责。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- 8月27日论文雷达:把“完成”拆成轨迹、交付与成本,音频生成仍缺席
- 8月26日论文雷达:20篇直接命中、3篇邻近,harness演化、轨迹训练与唯一一篇TTS
- 8月25日论文雷达:16篇直接命中、1篇邻近,先把上下文、技能与重复可靠性拆开
- 8月24日论文雷达:环境先长出来,记忆再决定留下什么,TTS开始按指令表达
- 8月20日论文雷达:10篇直接命中、14篇邻近,先把信用放回选择、环境与评判器
- 8月18—19日论文雷达:20篇直接命中、7篇邻近,先看每一步究竟该负什么责
- 8月17日论文雷达:20篇直接命中、6篇邻近,先看智能体何时该停、回滚与造世界模型
- 8月14日论文雷达:16篇直接命中、12篇邻近,先看轨迹为何不能照搬
