这三篇论文改的不是同一件事,却都把 AI 塞进了原有工作流里:一篇改数学搜索程序,一篇把人类评测拆成证据树,一篇直接通过成熟的 agent harness 做强化学习。三篇 v1 都在北京时间 8 月 18 日提交,也都有窗口内可核验的 X 原帖;社区热度差距很大,不能把它们混成一个总榜。
1|AlphaEvolve × 矩阵乘法指数
Improving the matrix multiplication exponent with modern optimization and AlphaEvolve 把矩阵乘法指数的已知上界从 ω < 2.371339 改进到 ω < 2.371177。团队重写 combination loss analysis 的非凸优化问题,再用机器学习优化和 AlphaEvolve 改进求解程序;最终上界来自经过检查的数值证书。这个结果属于渐近复杂度,不会直接让今天常用尺寸的矩阵乘法内核提速。1
作者:Emilien Dupont、Marvin Eisenberger、Borislav Kozlovskii、Abbas Mehrabian、Francisco J. R. Ruiz、Abigail See(Google DeepMind);Renfei Zhou(Carnegie Mellon University);Josh Alman(Columbia University);Virginia Vassilevska Williams(MIT);Matej Balog(Google DeepMind)。
截至北京时间 8 月 19 日 08:36,Pushmeet Kohli 的 X 官宣帖显示 2,648 赞、278 转发、53 回复、259,355 浏览;对应 Hacker News 条目显示 6 points、0 comments。23
Loading content card…
2|HarnessEval-W:让评测交出证据树
HarnessEval-W 不给每个世界模型视频套一张固定评分表。系统先理解案例,再把问题拆成目标可见性、最终状态、额外事件等子问题;专门子 agent 调用诊断工具,父 agent 核验证据并汇总得分。在 18 个模型、330 个案例上,它把每次判定保留成可检查的证据树。人类对齐实验覆盖 9 个模型、5,000 次 A/B 判断;意图转换与物理转换两项的模型排序 Spearman 相关分别为 0.93 和 0.87。相关系数衡量模型排序是否接近人类排序,不是单个视频判定准确率。4
全部作者:Weiliang Chen、Haowen Sun、Jun Gao、Jiawei Chi、Hanyang Wang、Qiyu Dai、Yihao Li、Hao Li、Jingnan Gao、Yi-Hsin Hung、Xingzhuo Guo、Shangchen Miao、Zhiyuan Shi、Xiang Li、Fengrui Tian、Weihua Du、Ziqi Huang、Shenyuan Gao、Siqiao Huang、Mingyu Liu、Yifei Li、Shizun Wang、Xi Wang、Tianqi Zhang、Xue Luo、Xiyin Ren、Jinshan Ren、Xiaoyang Shen、Xiaobo Hu、Zhiyang Dou、Mingyu Ding、Yichao Yan、Xinchao Wang、Yizhou Wang、Shilong Liu、Wenzhao Zheng、Yueqi Duan、Yuan Gong、Ziwei Liu、Ming-Yu Liu、Jialong Wu、Jiangran Lyu、Fangfu Liu。论文首页没有列出作者机构。
截至同一时间,DailyPapers 的 X 帖显示 48 赞、13 转发、6 回复、5,978 浏览;本轮没有找到对应 Reddit 或 Hacker News 直接讨论。5
Loading content card…
3|ClawGym II:通过黑盒 harness 做 RL
ClawGym II 把 OpenClaw 和 Claude Code 当作不透明执行器。每个任务在临时沙箱里运行,serving proxy 只在模型边界记录调用;系统再用前缀树恢复共享历史和多轮轨迹,交给 PPO 或 GRPO 更新 Qwen3-30A3B。在 ClawGym-Bench 上,OpenClaw 与 Claude Code 两条训练线的 Pass@1 相对初始策略分别提高 9.98 和 14.81 个百分点;论文还报告 PinchBench 提高 11.71 和 17.28 个百分点。训练任务来自合成数据,终局奖励混合规则验证与 rubric 评分。6
作者:Huatong Song、Fei Bai、Jia Deng、Daixuan Cheng、Wayne Xin Zhao、Ji-Rong Wen(中国人民大学高瓴人工智能学院);Ming Yang、Renyuan Li、Jujie He、Zhange Zhang、Yan Xing、Qi Yun、Xuxing Chen、Danyang Li、Feng Chang、Chuan Hao、Ran Tao、Jian Yang、Bryan Dai、Mingjie Tang(IQuest Research)。
Loading content card…
如果只选一篇精读:想看 AI 如何进入数学发现流程,读 AlphaEvolve;想判断世界模型评测是否可信,读 HarnessEval-W;关心 agent 训练如何贴近最终执行环境,读 ClawGym II。
References
- 1
- 2
- 3Hacker News 讨论条目
news.ycombinator.com
- 4
- 5
- 6
- 7


Comments