2026-07-19
词表·扩容
原地扩展 BPE 词表,让 Hindi、Vietnamese 和 Thai 少走 token 碎路;这首 rap 也把质量恢复曲线与多语训练的失败边界唱清楚。
每日大模型 Rap
@FC
订阅
词表·扩容
1×
0:00
2:55
这首中文硬核学术 rap 讲 arXiv 2607.15232「In-Place Tokenizer Expansion for Pre-trained LLMs」:论文把原 tokenizer 的 BPE merges 继续扩展,在保留旧 token 的同时为新增 token 提供可追溯的源 token 分解,再用「新增 embedding 先训、全模型多语继续预训」两阶段适配,把 65K 词表升级到 128K。
最抓耳的结果是:相同文本的 token 数,Hindi 约少到原来的 1/2.4,Vietnamese 约少到 1/2.6,Thai 最多约少到 1/4.0;把更大词表的单 token 成本一起算入后,论文估计这些语言的每字符 decode 速度提升约 2.2–3.7 倍。质量恢复曲线也很关键:八个预训练风格 benchmark 的 aggregate 从 source 44.7,经过 zero-shot swap 的 38.9、Stage 1 的 43.7,来到 Stage 2 的 48.3。不过这不是无条件的胜利:Stage 2 需要平衡多语数据,英文偏置的继续预训会让 MATH500 从 61.8 掉到 27.0、MGSM 从 61.2 掉到 28.4,并伴随更严重的重复;论文还报告,原本支持良好的英语、代码等语言在更大词表的单 token 成本下,每字符 decode 可能回退约 9%。
本期论文:
https://arxiv.org/abs/2607.15232
(arXiv 页面显示提交时间为 2026 年 7 月 17 日 01:32,按本频道时区换算;分类为 cs.CL、
cs.AI
、cs.LG)。
歌词
[Intro] 七月的 listing 刚落地,旧词表别装睡 同一句话切太碎,谁在给低资源加税 六五 K 的 byte-level BPE,边界锁死在旧年 今天不重启整台机,原地扩容,换地图上线
[Verse 1] 继续原来的 merge,不拆旧路,不另起炉灶 旧 token 一对一搬家,六三一五一行稳住脚 新 token 有源分解,最长六十四层坐标 不是随机撒 embedding,子词均值先把地基校 复制旧 row,新增 row 取 source 的 mean 不是 sum 把 norm 撑爆,先让表示保持 clean LFM2-8B-A1B,八 B 总,单 token 一点五 B LFM2.5 接过一二八 K,on-device MoE 重新开机
[Pre-Chorus] Stage 1 只练新增 row,身体冻结六百 B Stage 2 全量继续预训,平衡多语四百 B 零样本换表先从四四点七跌到三八点九 四三点七回到 Stage 1,四八点三把源线反超
[Chorus] 词表扩容,不是重训神话,是把碎片重新编队 Hindi 二点四倍,Vietnamese 二点六倍 Thai 四点零倍,token 少了,路才不那么累 算上大词表成本,每字符速度估二点二到三点七倍 词表扩容,旧模型的沉没算力不用全数作废 低资源不该永远被切碎,今天让 token 学会对位
[Verse 2] Global-MMLU 三十九语,四一到四三点七上位 Hindi 加七点六,越南加十一点六,印尼加九点一 Malay 加六点八,这是语言分布,不是万能奖杯 旧语言大体稳住,但每点差异别过度解读噪声边界 六五 K 换一二八 K,M4 和 Snapdragon 都实测过 只看每 token 会变慢,字符级收益要把压缩合并过 英语 code 原来就切得顺,最多约九 percent 退 大词表不是免费午餐,部署目标决定你值不值这回
[Bridge] 警告,警告,别只看 MCQ 的灯牌 Stage 1 全 embedding 一起练,生成会重复、会 loop 坏 Stage 2 偏英语的 mix,MATH500 六一点八跌二七点零 MGSM 六一点二跌二八点四,repetition 八八到四九 MMLU、MMMLU 还能涨,选项会排不等于能生成 多语要平衡,才不会把流畅输出换成假繁荣
[Chorus] 词表扩容,不是重训神话,是把碎片重新编队 Hindi 二点四倍,Vietnamese 二点六倍 Thai 四点零倍,token 少了,路才不那么累 算上大词表成本,每字符速度估二点二到三点七倍 词表扩容,旧模型的沉没算力不用全数作废 低资源不该永远被切碎,今天让 token 学会对位
[Outro] 但这招有边界,得控 merge 和 special token 的钥匙 只验一个 LFM2 家族,继续预训也不是零成本的纸 不是第三方 tokenizer 随手换,不是从零幻觉 保住旧能力,再给欠切分语言一条更短的路,收尾不撤
相似内容
登录后可发表评论。
More from this channel
›
潜态·换轨
2026-07-23
八 token 分岔(W2SPO)
2026-07-22
可说·中枢(J-space)
2026-07-21
漂移·承诺(Polestar)
2026-07-20
分叉·降噪(BPO)
2026-07-18
拆 Z·稳流(GFlowRL)
2026-07-17
语法铁闸(GRID)
2026-07-16
晚塌·定案(DEGS)
2026-07-15
View the full content archive of "每日大模型 Rap"
Explore more channels on Discover