连证·跃迁

这首中文硬核 rap 讲清 DC-Leap 如何用连续前缀验证和右侧 draft 前视,缓解扩散语言模型并行解码的依赖误差,并把长序列 MBPP 推到 53.19 倍、叠加 KV Cache 达到 105.02 倍。

连证·跃迁
0:003:12
DC-Leap 把扩散语言模型的并行去掩码改成「窗口内并行、窗口间连续验证」:只提交从当前位置开始的最长可信前缀,避开全局条件独立假设带来的联合概率依赖误差(JPDE)。窗口右侧的 draft token 提供前视上下文,让双向注意力不必为速度牺牲结构。
论文收录于 2026 年 7 月 24 日的 arXiv cs.AI 最新 listing,v1 提交时间是 2026 年 5 月 19 日。作者来自哈尔滨工业大学(深圳)、深圳环形区域研究院与华为诺亚方舟实验室,通讯作者为 Zhuotao Tian。1
在 Dream-v0-7B-Instruct 上,DC-Leap 平均加速 4.71 倍;在 LLaDA-1.5 上平均加速 8.29 倍。1024 token 长序列的 LLaDA-1.5 MBPP 实验中,吞吐从基线 7.71 TPS 提到 410.07 TPS,即 53.19 倍;再叠加 KV Cache 达到 809.71 TPS,即 105.02 倍,但分数从 39.40 降到 36.40,速度和质量的交换没有被藏起来。2

歌词

[Intro] 窗口开,噪声退,别让置信度设铁闸 Token 在雾里排队,谁先落地谁说话 不是全局一起赌,不是盲冲到天涯 DC-Leap 把连续前缀,写成今天的打法
[Verse 1] 扩散模型并行抹,理论很快,现实卡 邻 token 同时猜,独立假设埋着炸 一个错会牵一串,JPDE 在背后发话 为了不翻车阈值抬高,低信号全被罚
窗口切开,窗口里并行,窗口之间按序走 从当前位置找最长前缀,连续过线才放手 第一个低置信度出现,后面不跟着乱投 不是把整排 token 一锅端,是把因果链接回喉
[Hook] 连证,连证,最长前缀向前冲 跃迁,跃迁,右侧 draft 给我风 低阈值也能跑,JPDE 被关进笼 窗口内并行,窗口外借未来,双向注意力还在通
连证,连证,别让速度换空洞 跃迁,跃迁,一次 forward 过长空 不是顺序慢慢磨,不是全局赌命中 DC-Leap 把可信的跳跃,接成可验证的路通
[Verse 2] 纯 sequential 看似严,逐 token 提交太慢 每一步都要 forward,长序列直接变成算盘 还把右边上下文丢掉,双向模型被迫单线 所以窗口外留 draft,高置信未来先占位面
Draft 不是答案,不进最终账 它只是 look-ahead,把远处的路照亮 下一轮先 remask,把窗口里的旧稿清场 一次 forward 同看窗口和未来,再算 K 把前缀送上
commit 阈值零点七,draft 阈值零点九八 窗口内只收连续可信,散点预测别来插话 GSM8K 阈值从零点八降到零点六五,四十四点二四到五十七点八四 TPS 增加 准确率没明显掉,速度把保守的门槛撕开吧
[Hook] 连证,连证,最长前缀向前冲 跃迁,跃迁,右侧 draft 给我风 低阈值也能跑,JPDE 被关进笼 窗口内并行,窗口外借未来,双向注意力还在通
[Verse 3] Dream 七 B 平均四点七一倍,旧路三点七七退后 LLaDA-1.5 八点二九倍,别把提升只唱成口号 MBPP 十三点零四倍,代码轨迹开始加速跑 长序列一千零二十四,才是这套刀真正出鞘
基线七点七一 TPS,DC-Leap 四百一十点零七 五十三点一九倍,分数三十九点四零还在这里 KV Cache 叠上去,八百零九点七一继续 一百零五点零二倍很猛,但分数三十六点四零别抹去
窗口越大吞吐越高,精度可能轻轻往下 Draft 阈值压低会伤分,抬高又会让速度落下 这不是无条件的神话,是参数和任务的交换账 把结果唱全,连同代价,才配叫学术 diss 的现场
[Bridge] 低置信不是废料,独立假设才是旧伤 连续约束把依赖接上,未来 draft 把右侧补上 训练不用重跑,像插件插进推理厂 但一百零五倍的鼓点背后,三十六点四零也要亮
[Outro] 窗口开,噪声退,最长前缀继续跃迁 速度可以破墙,分数不能藏在烟 从并行到连续,从现在借未来一眼 DC-Leap 留下的不是快字,是怎么快得可验证、可复现

Related content

  • Sign in to comment.
More from this channel