1/4

arXiv AI 前沿日报|7 月 23 日:JSON 答案收敛、MoE 省显存与 Qwen3 局部卷积

本期从近 72 小时的直接 X / Reddit 讨论中精选三篇论文,核对方法、关键数据与可见限制,并单独标出弱信号条目。

这期回看 7 月 20–21 日提交、在近 72 小时内出现直接 X / Reddit 讨论的论文。排序看具体原帖信号,不把跨平台互动量相加;弱信号也单独标出来。

01|Structured Output:要求 JSON,答案会变窄吗?

Tapan Parikh(Cornell Tech)测试了 44 个语言模型、31 个开放答案类别,以及 plain chat、JSON、XML、YAML、CSV 等格式。JSON 请求让 field-mean surprisal 从 1.80 降到 1.58 bits,distinct answers 从 52 降到 36,模态答案比例从 41% 升到 64%;31 个类别中有 28 个保持同一个模态答案。JSON 与 XML 出现显著收敛,YAML / CSV 未见同样效应。1
这更像「锐化已有模式」,不是重新排了一遍答案空间。限制也很明确:数据是 OpenRouter 的单一时间点快照,每种格式只测试一种措辞,温度在不同提供方之间未必完全一致。2
社区信号:X 原帖发表于 7 月 23 日 00:01(北京时间),49 赞、7 转发、10 回复、48 收藏、5,830 浏览。2

02|SkewAdam:MoE 显存从哪里省出来?

Nuemaan Malik 的论文没有在 arXiv 页面列出机构。方法把 MoE 参数分成三类:5% 的 dense backbone 保留 float32 动量和分解式二阶矩;95% 的 experts 只保留分解式二阶矩;小于 0.01% 的 router 保留精确二阶矩。3
在 6.78B MoE、约 82M tokens 的受控训练中,optimizer state 从 AdamW 的 50.55 GB 降到 1.29 GB,峰值训练显存从 81.4 GB 降到 31.3 GB;验证集 PPL 为 108.4,AdamW 为 126.8。消融显示,性能主要来自保留 momentum,分层分配的主要收益是省内存。3
Reddit 的 r/MachineLearning 原帖发表于 7 月 22 日 15:04(北京时间),96 分、22 条评论,upvote ratio 为 96.2%。X 上另有一条中文解读,显示 66 浏览、0 赞;本期按 Reddit 讨论信号计入。4 5
边界:模型只有 2 层,训练 token 数较短;SkewAdam 没有做完整学习率 sweep,tier ablation 也只有单 seed。3

03|Convolution for Large Language Models:给 Qwen3 加一点局部视野

作者及机构:Yuchuan Tian(北京大学)、Yingte Shu(北京大学)、Wei He(华为)、Shuo Zhang(华为)、Tianchen Zhao(清华大学)、Chao Xu(北京大学)、Xinghao Chen(华为)、Yunhe Wang(华为)、Hanting Chen(华为)、Yu Wang(清华大学)。6
论文在 Qwen3 Transformer block 的 17 个位置做消融,最优位置是 QKV 投影之后、attention 之前。最终使用残差 depthwise Conv1D、kernel size 3,不加激活和额外归一化;参数增量低于 0.01%。Qwen3-1.7B 在 30B tokens、Qwen3-4B 在 100B tokens 的 7 个基准平均准确率分别提升 1.99 和 3.76 分。6
X 上的论文索引帖发表于 7 月 23 日 00:05(北京时间),1 赞、1 转发、219 浏览,属于弱信号,不应包装成热议。限制是目前只验证 Qwen3 系列,局部机制分析主要基于一个 WSC 案例。7

관련 콘텐츠

댓글

로그인하면 댓글을 작성할 수 있습니다.