全宽·不降维(AURORA-LM)

全宽·不降维(AURORA-LM)

AURORA-LM 不先压扁能解码的连续表示,而是只收窄噪声输入通道;这首 rap 把全宽 latent、分块扩散与关键实验数字唱清。

0:00 / 3:46
这首歌讲 arXiv:2608.02602《AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling》。arXiv cs.CL 最近列表把它列在 2026 年 8 月 4 日;摘要页记录 v1 提交时间为 2026 年 8 月 4 日 01:59:50(UTC+08:00)。第一作者是 Jiajun Liang,通讯作者是 Chenyang Si,作者来自南京大学 PRLab、南洋理工大学 S-Lab 与帝国理工学院。12
AURORA-LM 把表示构造和分布建模拆开:Query-based Encoder-Decoder 先造出高容量、按前缀排列、能还原 token 的连续 latent;冻结 autoencoder 后,Block-causal Diffusion Transformer 用 flow matching 按块从左到右生成,块内并行去噪。它只压窄 noisy-input pathway,clean latent 仍保持全宽,再用按 latent 宽度校准的噪声分配和 self-trajectory consistency 对齐训练状态与迭代采样。3
数字集中在三条线:OpenWebText 1024-token 自由生成中,130M 版本 Gen-PPL 为 23.56、MAUVE 为 0.890;XSum 摘要的 ROUGE-1/2/L 为 36.6/13.4/28.9。扩到 1.01B 参数、约 1,500 EFLOPs 后,九项任务宏平均 32.6,高于约 1.8B 的 Cola-DLM 的 25.1,且九项逐项更高。论文也给出代价边界:Q=16 的 MAUVE 为 0.816,Q=4 为 0.909,Q=64 为 0.631;压缩 latent 位置会换来效率,却带来质量下降。Gen-PPL 使用外部 GPT-2 Large 评估,实验全部在 Ascend NPU 上,1B 对比采用论文声明的 matched protocol,不能直接当成对所有离散 LLM 的普遍胜利。3
听感延续频道的冷峻 94 BPM drill,适合早高峰通勤时抓住一个反直觉判断:扩散语言模型不必先把能解码的表示压扁;可以让输入通道变窄,同时把 decoder 真正需要的全宽 latent 留住。

歌词

[Intro] 八月四日,cs.CL 列表开门 二六零八零二六零二,扩散不再只认 token 图像音频早进连续空间 AURORA 说,语言也能换接口登场
[Verse 1] 离散格子一格格,词边界像铁栏 旧 embedding 继承旧形,解码和生成两头难 压 latent 让 diffusion 好学,token fidelity 先折半 我不替模型削骨,先造一条能还原的宽道让它自己扛
Query encoder,prefix 一路长 每个 latent 看见的前缀逐步扩张 Query decoder 只读对应 latent 档 一边还原 token,一边排好左到右的航
[Chorus] 全宽,不降维,decoder 要全维 噪声路收窄,clean target 不后退 左到右分块,块里一起推 AURORA,连续 latent 也能把字吐回
全宽,不降维,别给解码器断电 窄的是 noisy input,不是信息的底线 一半是并行,一半守住前缀 把连续空间接上文字,别让 token 独占天
[Verse 2] 先冻住 autoencoder,latent 标准化 flow matching 直线穿噪声,x0 clean 目标不花 D 一千零二十四,bottleneck 一百二十八 窄的是输入通道,不是解码那张底牌
高噪声多给训练量,tan-d 七校准 不是换个 schedule,就能把信号保全 self-conditioning 接上前一步的判断 self-trajectory consistency,让相邻状态别跑偏
Q 四 MAUVE 零点九零九,顺序多却更稳 Q 六十四 零点六三一,平行多但前缀更狠 Q 十六 零点八一六,八段串成合适的门 不是只追并行,条件结构也得留存
[Verse 3] OWT 一千零二十四 token,Gen-PPL 二三点五六 MAUVE 零点八九零,外部 GPT-2 Large 当裁判 ELF-B 二四点一一,二三点五六压过这关 连续 latent 不是概念,是表里的硬仗
XSum R-one 三六点六,R-two 一三点四 R-L 二八点九,三条 ROUGE 都抬起 一百三十 M 的小号先把协议打平 自由生成加条件摘要,双场都能落地
宽度越大,腐蚀后 token 还原越强 保留九成 latent,MAUVE 零点八一只小降 压到八成零点七三,七成零点六七往下晃 容量和算力要交易,论文没有把代价藏
[Bridge] 一 B 一点零一,约一千五百 EFLOPs 扛 对一 B 八的 Cola-DLM,九项 benchmark 摊开账 AURORA Avg 三二点六,Cola 二五点一 九项全线更高,但 matched protocol 不是宇宙宣判
所有实验跑 Ascend NPU,Gen-PPL 由外部模型评 采样步数、block size、设备条件都写进边界 连续语言的证据够硬,别唱成万能神谕 能把字解码回来,才是今天这场真正的反击
[Final Chorus] 全宽,不降维,decoder 要全维 噪声路收窄,clean target 不后退 左到右分块,块里一起推 AURORA,连续 latent 也能把字吐回
全宽,不降维,别给解码器断电 窄的是 noisy input,不是信息的底线 一半是并行,一半守住前缀 把连续空间接上文字,别让 token 独占天
[Outro] 不是压扁语言,才叫 diffusion 能学 先把表示造完整,再让噪声学会妥协 全宽留给解码,窄路留给输入的险 AURORA-LM,连续空间把文字接回现实线

Fuentes de referencia

  1. 1
  2. 2
  3. 3

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado