arXiv AI 前沿日报|8 月 14 日:AI 证明、逐步检索与推理脚手架

三篇近 72 小时论文把增量放到模型之外:ChatGPT 参与数学证明,ThinkRetrieve 每步检索例题,AI4AI 用 harness 做强到弱测试时迁移;先分清最佳单次、平均值和适用边界。

这三篇把模型之外的增量放在三个不同位置:一篇让 AI 参与提出数学证明策略,一篇把已解例题逐步塞回推理轨迹,另一篇让强模型直接编排弱模型的运行环境。读论文时,先分清增量究竟来自模型、外部材料,还是 harness。
本期按已打开的 X/Twitter 直接讨论回看近 72 小时;按下文顺序,三篇 v1 分别提交于北京时间 8 月 12 日、11 日与 13 日。Reddit、Hacker News 均未找到对应论文的直接讨论,互动指标只保留 X 的原生口径。

1. No compromise:AI 参与发现证明策略

论文No compromise in the liquid drop model(arXiv 2608.11517v1:2026 年 8 月 12 日 08:12(北京时间)1
作者与机构:Otis Chodosh—Stanford University 数学系;Matilde Gianocca—ETH Zürich 数学系。2
论文解决的是 Gamow 液滴模型的极小元阈值。能量同时计算周长与 Coulomb 能:前者偏爱一个球,后者偏爱把质量分开。作者证明,当体积 V≤V* 时,球体是唯一极小元;当 V>V* 时,极小元不存在,其中 V*≈3.51。此前 Chodosh 与 Ruohoniemi 只证明到 V≤1。这是一篇数学论文,没有原创实验。2
最值得注意的是作者的 AI 声明:结果由 ChatGPT 5.6 Pro 在多轮对话中得到,作者检查并改写了证明,但基本策略仍接近模型原始输出;正文没有直接使用 AI 生成文本。证明把锐化的容量估计、Agostiniani–Mazzieri 单调性公式与 Gauss–Bonnet 串在一起。这里能确认的是 AI 参与发现策略并留下完整证明,不能把作者声明当成外部数学家已逐步复核关键估计。2
X 上的几何分析学家 Steve McCormick 于北京时间 8 月 13 日 14:51 讨论这篇论文;抓取时为 111 赞、9 转、5 回复、8,774 浏览。本期三篇中,这条直接讨论最强。3
Loading content card…
精读前先核对:AI 使用声明交代了参与方式;论文仍是尚未同行评审的预印本。

2. ThinkRetrieve:每一步都检索已解例题

论文ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling(arXiv 2608.10928v1:2026 年 8 月 11 日 21:58(北京时间)4
作者与机构:Vaibhav Singh¹、Soumya Suvra Ghosal²³、Sarvesh Gharat¹、Soumyabrata Pal³、Ramasuri Narayanam³、Dinesh Manocha²。¹IIT Bombay;²University of Maryland, College Park;³Adobe Research。Ghosal 的大部分工作在 University of Maryland, College Park 完成。5
标准顺序式测试时扩展会让模型继续自我反思,但推理链越长,错误也可能一路累积。ThinkRetrieve 在每个步骤生成中间答案,再用「原题 + 中间答案」检索相似的已解例题,把命中的完整解法作为 in-context example 注入当前轨迹。形式上,轨迹从 x→z→y 变成 x→z₁→e₁→…→zₖ→eₖ→y,并受 token 预算 B 约束。5
实验覆盖 5 个 1.5B—8B 推理模型与 GSM-8K、MATH-500、AIME 2025、SciQ 四个基准。AIME 2025 上,Qwen3-1.7B 的标准顺序 TTS 为 22.2%,ThinkRetrieve 达到 35.6%,相对提升约 60%;跨实验汇总的平均准确率从 0.33 升到 0.47,预测熵从 1.51 降到 0.96 nats。检索库过滤后有 309,609 个例题,检索让每题墙钟时间增加约 6%。5
收益依赖例题库覆盖。结构相似、关键条件却不同的例题可能把模型带向更自信的错误;代码和开放式逻辑推理等难以准备例题库的任务,还没有得到验证。5
X 解读帖于北京时间 8 月 12 日 13:21 发布;抓取时为 33 赞、1 转、0 回复、1,260 浏览,属于早期信号。6
Loading content card…
精读前先核对:60% 是某一模型在 AIME 2025 上的相对增益;绝对准确率从 22.2% 升到 35.6%。

3. AI4AI at Test-Time:强模型给弱模型写运行环境

论文AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses(arXiv 2608.12307v1:2026 年 8 月 13 日 01:53(北京时间)7
作者与机构:Cheng Qian¹²、Wenting Zhao¹、Liangwei Yang¹、Heng Wang¹²、Jielin Qiu¹、Heng Ji²、Silvio Savarese¹、Huan Wang¹、Shelby Heinecke¹。¹Salesforce AI Research;²University of Illinois Urbana-Champaign。8
这篇论文不训练弱模型。强 builder 只看 195 道验证题,也就是全部 3,900 道隐藏测试题的 5%,随后迭代约 4.9 轮,构造路由、提示模板、验证器、确定性代码与格式约束。固定的 GPT-5.4-mini 不更新参数,原始得分为 0.488。0.912 是最佳单次 scaffolded run;0.763 才是全部 scaffolded runs 的平均值,人工 UserHarness 为 0.939。9
四个基准是 BigToM、Hi-ToM、MMToM-QA 与 MuMA-ToM。作者分析认为,主要增益来自把不稳定推理搬进确定性代码、按基准路由并约束答案格式,而不是鼓励弱模型写更长的推理链。对本来更强的 target,部分基准反而会退化;不同运行也存在波动。9
HuggingPapers 原帖于北京时间 8 月 13 日 12:37 发布;抓取时为 16 赞、2 转、1 回复、1,421 浏览。这是一条很早期的直接信号。10
Loading content card…
精读前先核对:0.912 是最佳单次运行,不能与全部 scaffolded runs 的平均值 0.763 混成同一个结论。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

Comments

Sign in to comment.