本期回看 7 月 11–16 日首次提交、但在 7 月 17–19 日出现具体讨论的论文。提交日与讨论日分开标注,互动量只作直接讨论信号,不跨平台相加。
01|LongStraw:固定 GPU 预算跑过 2M token RL
论文:LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget;首次提交日为 2026 年 7 月 16 日。1
作者与机构:Changhai Zhou(MindLab、复旦大学);Kieran Liu、Yuhua Zhou、Qian Qiao、Jun Gao、Harry Zhang、Irvine Lu、Nolan Ho、Lucian Li、Andrew Lei、Cleon Cheng、Steven Chiang、Yihang Zeng、Di Zhang、Rio Yang、Kaijie Chen、Andrew Chen、Pony Ma(均为 MindLab);Weizhong Zhang、Cheng Jin(均为复旦大学)。2
方法是先对共享 prompt 做无梯度预填充,只保留后续 token 需要的状态,再把 response 分支逐个 replay,让训练图不随长 prompt 一起膨胀。8 张 H20 上,Qwen 路径完成 2.1M positions 的 grouped scoring 与 response backward;group size 从 2 增至 8 时,峰值显存只增加 0.21 GB,压力测试到 4.46M positions。2
边界很重要:论文证明的是 fixed-budget execution capacity,不是完整训练正确性。prompt state 是 detached 的,部分分布式梯度组合尚未完成,因此不能据此宣称已经完成可复现的长上下文 RL 训练。2
7 月 17 日,Mind Lab 的直接帖子称,超长上下文研究不再只是大型实验室的特权;该帖记录为 124 赞、95 收藏、23 转发和 13,457 次浏览。3
Cargando tarjeta de contenido…
02|Harness Handbook:先定位行为,再改 Agent 的代码
论文:Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable;首次提交日为 2026 年 7 月 14 日。4
作者与机构:Ruhan Wang(Tencent HY LLM Frontier、Indiana University);Yucheng Shi、Kishan Panaganti、Haitao Mi、Leoweiliang(均为 Tencent HY LLM Frontier);Zongxia Li(Tencent HY LLM Frontier、University of Maryland, College Park);Zhongzhi Li(Tencent HY LLM Frontier、University of Georgia);Yue Yu、Dongruo Zhou(均为 Indiana University);Junyao Yang(Tencent HY LLM Frontier、National University of Singapore)。5
Handbook 把源码整理成行为视图:静态事实提取后,生成 L1 System Overview、L2 Component Overview、L3 Unit Deep Dive,再用 Behavior-Guided Progressive Disclosure 定位实现位置,修改后重新同步。Codex 的总体胜率从 28.3% 升到 38.3%,Terminus-2 从 26.7% 升到 45.6%;planner token 使用分别下降 12.7% 和 8.6%。5
证据范围是两个开源 harness,每个 30 条修改请求;论文还依赖模型评审计划质量,不能直接外推到所有生产级 Agent 仓库。5
7 月 18 日的直接讨论帖记录为 40 赞、40 收藏、10 条回复、13 次转发和 3,936 次浏览,讨论焦点是复杂 Agent 的行为到代码映射。6
Cargando tarjeta de contenido…
03|ATSInfer:把本地 LLM 推理的调度粒度降到 tensor
论文:Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices;首次提交日为 2026 年 7 月 11 日,7 月 14 日更新到 v2。7
作者与机构:Yangyijian Liu、Hongyi Ye、Mingyang Li、Wu-jun Li,均来自南京大学计算机科学学院;前两位作者共同贡献。8
ATSInfer 把权重放置与传输从 layer / expert 粒度细化到 tensor 粒度,并结合负载感知动态传输和异步 CPU–GPU 协调。在消费级设备、batch size 1 的对比中,相较 llama.cpp,prefill 吞吐最高提升 1.94×,decode 吞吐最高提升 3.29×;外部 GPU+PCIe 负载达到 60% 时,TPOT 增幅降低 38%。8
这项结果主要服务低并发本地推理,论文没有把服务器高并发作为目标;MoE 专属的 expert residency / swapping 也未纳入 ATSInfer。8
7 月 19 日,r/LocalLLaMA 的论文讨论帖有 101 分、12 条评论和 98% 的赞成率,评论集中追问代码是否开源,以及 3× 级别的生成速度能否复现。9
Cargando tarjeta de contenido…
互动量是抓取时刻的公开计数,不能当作统一热度分数。论文原文仍是判断方法和实验边界的依据。




Comentar
Inicia sesión para comentar.