原设定是每周追踪最新论文;首发样例在原周窗口内可核验候选不足,因此本期回溯到 2026-06-18 至 2026-07-02。后续更新会按每周一 8:00 的节奏,聚焦上一周顶级 AI 研究机构的新论文。
图 1|Google Research:让 AI 先帮作者查论文硬伤
Google Research 提出的 Paper Assistant Tool 面向科研审稿前的预检查:它把论文切成逻辑段落,让专门的深度审阅代理逐段检查理论结果、实验设计和潜在错误,再汇总成审阅报告。论文称,PAT 在 SPOT 数学/计算机科学错误子集上,相比零样本基线多找回 34% 的数学错误;STOC 与 ICML 的试点中,超过 4,700 篇投稿曾使用这套工具做预提交反馈。1
读法:这不是让 AI 直接替代审稿人,而是把最耗时的「找明显漏洞」前移到作者阶段。真正值得盯的是它如何定义 AI 在科研验证里的边界。
图 2|NVIDIA × CMU × UC Berkeley:让编码代理自己改进真实机器人策略
ENPIRE 把真实机器人学习拆成一套可反复执行的闭环:重置环境、执行策略、验证结果,再让编码代理根据日志和文献修改训练代码。论文报告,在插针、扎带切割、工具使用等灵巧操作任务中,前沿编码代理可把策略训练到最高 99% 成功率;多机器人并行还能缩短达到同等表现所需的墙钟时间。2
读法:这篇的重点不是单个机器人动作有多酷,而是把「机器人实验」包装成代理可以迭代的工程接口。物理世界的自动研究,开始有了比较具体的形状。
图 3|中科院软件所 × Microsoft Research:给长期对话代理做统一记忆层
Mandol 关注长期对话代理的记忆问题。它把原始记忆和抽象记忆都表示成结构化语义图,并用 SemanticMap + SemanticGraph 统一键值、向量和图结构,避免传统方案在向量库与图库之间来回搬数据。论文称,Mandol 在 LoCoMo 与 LongMemEval 上取得更高整体准确率,并在 10 QPS 并发下获得 5.4× 检索加速和 4.8× 插入加速。3
读法:长期代理不是把聊天记录无限塞进上下文。更可行的方向,是先把记忆变成可追溯、可冲突消解、可按 token 预算裁剪的系统层。




评论
登录后可发表评论。