双焦·绕绳(Jet-Long)

这首中文硬核 rap 讲 arXiv 2607.07740:Jet-Long 用动态双焦 RoPE 把 Qwen3 的上下文零训练推到 128K,在 RULER、PG-19 和 H100 吞吐上都给固定缩放基线一记重拳。

双焦·绕绳(Jet-Long)
0:003:05
本期选自 arXiv 在 2026-07-10 展示的 cs.LG / cs.AI 新论文列表:Haozhan Tang、Zerui Wang、Yuxian Gu、Song Han、Han Cai(NVIDIA)的 Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE。论文提交时间为 2026-07-08,主题是不用微调,把 RoPE 大模型的上下文零训练拉到 128K。
Jet-Long 的 punchline 很硬:本地窗口保留原始 RoPE,远端窗口用动态分组把位置压回预训练范围;KV cache 不重写,prefill 用 inclusion-exclusion 合并三路 attention。论文报告它在 Qwen3-1.7B / 4B / 8B 上,相对最强零训练基线的 RULER 平均准确率分别领先 +4.79 / +2.18 / +2.03 个百分点;H100 上融合 CuTe kernel 后,长上下文 prefill 最高达到 1.39× FA2 吞吐,生成端开销不超过 4%。

歌词

[Intro] 长窗开闸,噪声先退场 原生三十二 K,别把短句烧伤 Jet-Long 上桌,双焦镜对准长巷 RoPE 绳结一拧,旧基线开始慌
[Verse 1] 他们拿固定倍率,硬把位置压扁 短上下文掉色,长上下文断电 一头怕 OOD,一头怕 softmax 扩散 答案躲在中间,被概率雨冲散
本地窗守规矩,原生旋转不换 远端窗另开眼,把坐标折回训练盘 L 不过原窗,f 还是自己本人 L 一冲出边界,G 就抬起闸门
G 等于上取整,L 除预训练窗 f of x 取地板,x 除 G 归航 不是糊成一团,不靠玄学补妆 每个远端角度,都踩回见过的桩
DNTK 还在调 base,YaRN 还在换衣 Self-Extend 固定分组,遇到长度就迟疑 Jet-Long 只问当前 L,多一格不浪费 短时像原模型,长时也不跪
[Hook] 双焦,绕绳,长窗不投降 本地守原味,远端压回训练场 双焦,绕绳,缓存不搬仓 一刀加一刀再减一刀,128K 还在响
[Verse 2] KV cache 不重写,别喊系统停机 键和值待原地,偏移旋转现场出击 query 转 Δq,key 转 Δk 寄存器里补角度,老缓存继续背
prefill 不铺满矩阵,三路 attention 合唱 full remote 拉远景,local base 守近场 local remap 再扣掉,重叠部分别装 LogSumExp 稳住秤,分子分母一起扛
这不是堆参数,也不是再训练一轮 零微调开长窗,把推理轨迹放稳 RAG、代码仓、Agent 工具链越滚越长 Jet-Long 把绳头拽住,别让中段失防
w0 两千零四十八,保护窗先站岗 太小就塌成零点,太大又抢远方 五百一十二到四千,分数差别不猖 部署不用天天调参,工程师少点抓狂
[Hook] 双焦,绕绳,长窗不投降 本地守原味,远端压回训练场 双焦,绕绳,缓存不搬仓 一刀加一刀再减一刀,128K 还在响
[Bridge] Qwen3 一点七、四、八 B,拉到一二八 K RULER 对最强基线,加四点七九先飞 四 B 加二点一八,八 B 加二点零三 PG-19 压低困惑度,长书不再翻船
裸 base 到一二八 K,ppl 直接失控 七十一、一零四、七十九,像警报在轰 Jet-Long 压到十一点四一、九点六二、八点五一 短窗不退,长窗不碎,绳结扣得紧
H100 上 CuTe 合体,prefill 反向超车 最高一点三九倍 FA2,不是纸面花活 生成开销小于四个点,速度没被割喉 边跑边延长,冷光扫过 token 河流
[Final Hook] 双焦,绕绳,别拿长窗糊弄王 位置要归位,证据要回场 双焦,绕绳,Jet-Long 开枪 不用重训也能撑住,128K 的走廊
[Outro] 原窗里像原窗,远窗里不慌张 RoPE 绳结重新系,长上下文继续唱

来源

相似内容

  • 登录后可发表评论。
More from this channel