多头·回读(MHAR)
0:003:52

[Intro]
深度不是一条线
每层只盯前一站
老路把所有通道
绑在同一张图上
[Verse 1]
Residual stream,跑成一条账
新层读最后状态,旧层藏在和里晃
Attention residual,把历史拉上场
可一个 query 发令,全宽度同方向
每个 subspace 想回不同层
却被一张 softmax 按成同一门
这不是共享,是 forced compromise
宽度越大,越多需求被牺牲在里面
[Chorus]
多头回读,零参拆路
H 个 softmax,各自认深度
多头回读,不给单头让步
一刀 reshape,参数不增,路由分组
多头回读,零参拆路
H 等 KV heads,默认就够稳住
多头回读,别让全宽度同声合唱
每个子空间,自己挑该回哪一层上
[Verse 2]
Query reshape,d 切成 H 组
每组只看自己那片,深度轴上独立下注
一层一层的 source,像 memory 排队
不再拿一张分布,替所有维度配对
H 等一,退化成 single-head 原式
所以这场对照,参数和前向都一致
不是加宽,不是堆算力来作弊
同样 query 总量,差别只在怎么 split
[Verse 3]
一百 M,baseline 三点三三六
MHAR 三点二八七,差零点零四九
三百五十 M,三点二九零往下压
三点二一零,零点零八零把门砸
一 B baseline 三点一七五
MHAR 三点一一一,零点零六三
单头一百 M 还能减零点零三九
三百五十 M 加零点零五五,开始反噬
一 B 加零点一四零,单路由失控
你说共享最简洁?规模一上它先崩
[Chorus]
多头回读,零参拆路
H 个 softmax,各自认深度
多头回读,不给单头让步
一刀 reshape,参数不增,路由分组
多头回读,零参拆路
H 等 KV heads,默认就够稳住
单头把历史压平,多头把分歧留住
宽度越大,越不能用一把尺子量全部
[Bridge]
别把 H 当旋钮,乱拧就能赢
H 等 KV 是拐点,过切反把收益吞
H 等四、八,曲线落在最优区
H 等十六,过度分裂,优势退回去
一 B 的 head deviation 到正负零点二八
跨文本复现零点七七,分歧不是幻觉假
但这只是路由的证据,不是万能的神话
它证明子空间有不同回读,不保证每题开花
[Verse 4]
八 B 中训,zero gate 先封门
开门前 logit 一样,没 loss shock 的伤痕
GSM8K 四七点零到五零点二
GPQA 三一五到三四点六,分别加三点二、三点一
MMLU 六四点三到六四点五,轻微
MATH 原地十九点一,代码也没起飞
Triton 把吞吐拉到零点八八、零点七一、零点五五
省的是路由墙,不是把训练成本变成零吧
[Final Chorus]
多头回读,零参拆路
H 个 softmax,各自认深度
多头回读,单头别再装酷
一 B 加零点一四零,反例已经写入
多头回读,零参拆路
GSM8K、GPQA 把推理增益说清楚
但等墙钟、等计算对 baseline 还没补
这把刀很锋利,别唱成普遍救赎
[Outro]
零参数不等于零成本
深度历史还要重读
论文的狠话留一句
别逼所有子空间读同一幅图