
LongCat-2.0 正式开源:美团把国产卡推理栈也放出来了
美团 LongCat-2.0 从「将开源」推进到正式开源,同步开放权重入口、GPU/NPU 推理代码和多精度部署路径。文章拆解这次更新相对 6 月 30 日初版发布新增了什么,以及开发者复测时最该盯住哪些部署边界。
6 月 30 日,LongCat-2.0 还是一次「发布并将开源」的模型公告。到了 7 月 12 日,美团把这件事推进到了更硬的一步:权重入口、GitHub 仓库、ModelScope 集合、GPU / NPU 推理代码和多精度部署路径一起放出来。官方公告把它称为「正式开源」,并特别强调这是在五万卡国产算力集群上完成推理的万亿参数模型。1
这次值得单独看,不是因为 LongCat-2.0 的 1.6T 总参数、约 48B 平均激活、1M 上下文这些指标第一次出现。6 月 30 日的发布博客已经讲过这些。2 新信息在于,美团开始把「能训出来」往「别人能部署、能复测、能改推理栈」推进。
先看结论:开源对象不只是模型权重
7 月 12 日公告列出的开放入口有三类:模型权重,GPU / NPU 推理代码,以及 API 平台。权重入口包括 Hugging Face、GitHub 和 ModelScope;推理代码分为 GPU 侧的 SGLang 支持和 NPU 侧的 SGLang-FluentLLM 分支。1
这里的关键不是多放了几个链接,而是开源层级变深了。Hugging Face 模型卡写明,LongCat-2.0 可以在 GPU 和 NPU 平台部署,模型权重采用 MIT License,并提供聊天模板。3 GitHub 仓库也把 README、LICENSE 和部署说明放出来,页面显示主仓库已有公开提交记录。4
对开发者来说,这比单纯宣布 benchmark 更有用。模型能不能进入真实测试清单,取决于三件事:权重是否能拉下来,推理框架是否能跑起来,长上下文和 MoE 路由在自己的硬件上是不是还能稳定。7 月 12 日的公告,至少开始把这三个问题摆到台面上。
国产卡推理代码为什么是主线
LongCat-2.0 之前已经把「国产算力训练」讲得很重:团队称从 2023 年开始探索国产算力,最终在五万卡集群上完成全流程训练与推理;预训练数据超过 30T tokens,训练 MFU 提升 1.5 倍,稳态日吞吐超过 1T tokens/day。2
7 月 12 日的新公告把焦点转向推理。官方说,面对显存、带宽和互联限制,LongCat-2.0 从模型、芯片适配和部署策略三个方向做协同优化。模型层面包括 absorb 计算模式、Indexer 与 MLA prolog 并行处理、KVP 切分 KV-cache,以及让 Dense 和 MoE 分支在物理核心级并行的 ScMoE。1
这段话的含义很具体。万亿 MoE 推理的瓶颈不只是「算得多」,还包括 KV-cache 放不下、专家并行通信慢、长上下文 prefill 太重、decode 阶段单卡显存压力高。官方提到的 KVP 切分、layer-wise KV-cache 传输、Weight Prefetch、Super Kernel 和异步化 Expert-Parallel Load Balancing,都是在减少等待、搬运和负载不均。1
PD 分离部署也值得看。P 指 prefill,负责处理长输入;D 指 decode,负责逐 token 生成。公告说 Prefill 端通过缩小 Expert-Parallel 域和序列并行分担长序列计算压力,Decode 端用 KV-cache 切分和高并行度降低单卡显存占用。1 换成工程语言,就是先把「首 token 等多久」和「后续每个 token 多慢」拆开,再分别压延迟。
LSA、N-gram 和 MOPD,这次被放进部署语境里
LongCat-2.0 的模型侧三件事仍然是 LongCat Sparse Attention、N-gram Embedding 和 MOPD。7 月 12 日公告的不同之处,是把它们和国产卡部署绑定在一起讲。
LSA 面向智能体任务里的长输入。公告说它通过流感知索引、跨层索引和层级化索引,减少碎片化访存和重复索引计算,在保持模型质量的前提下加速百万级长上下文训练与推理。1 这不是一个只服务榜单的模块。代码 Agent 读仓库、看日志、查文档时,长上下文里的大量 token 只是候选信息,模型必须快速找出哪一段值得看。
N-gram Embedding 则是在 MoE 专家之外扩参数。公告称,在 MoE 稀疏度接近 97% 的情况下,把 135B 参数投入 N-gram Embedding 的收益高于继续扩充专家,且该模块占总参数比例控制在 10% 以内。1 这说明 LongCat-2.0 并不只是把专家堆大,而是在 token 级表示上另开一条稀疏参数路径。
MOPD 负责后训练融合。公告说 LongCat-2.0 将专家分成 Agent、推理和交互三类,通过多教师在线蒸馏融合到最终模型中,分别覆盖自主执行、自适应推理和安全对齐等能力。1 这也解释了它为什么一直把 Agentic Coding 放在最前面:代码任务需要会写、会查、会跑、会修,还要能按人类指令交付。
现在能拿到什么,还要验证什么
| 开放入口 | 现在能看到什么 | 还要验证什么 |
|---|---|---|
| Hugging Face 模型卡 | MIT License、GPU / NPU 部署说明、聊天模板、1.6T MoE 与约 48B 激活描述。3 | 权重下载、量化版本和实际显存占用是否足以支撑自己的部署目标。 |
| GitHub 主仓库 | README、许可证、部署入口和模型介绍。4 | README 能否被外部开发者按步骤跑通,尤其是长上下文和工具调用场景。 |
| SGLang-FluentLLM | 基于 SGLang 的推理引擎,公开了 speculative decoding、layer-wise KVCache transfer、Decode Radix Tree Cache 等改动;README 称已在 H800/H20 和 Ascend A2 测试。5 | NPU 分支在不同国产卡、不同驱动和不同并行配置下是否稳定。 |
| SGLang 社区支持 | LongCat 2.0 FP8 支持 PR 已在 7 月 7 日合入 SGLang 主线。6 | FP8 服务的精度、吞吐和兼容性是否能在第三方环境复现。 |
这张表里的最后一列,比官方分数更值得盯。LongCat-2.0 在 SWE-bench Pro、SWE-bench Multilingual、Terminal-Bench 2.1 等任务上的成绩,6 月 30 日已经披露过。2 7 月 12 日之后,问题变成:这些成绩背后的模型和推理栈,能不能在美团之外被跑起来。
怎么判断这次开源的价值
第一,看你是否真的需要 1M 上下文和代码 Agent。LongCat-2.0 的定位不是轻量聊天,也不是只回答单轮问题。它适合被放进仓库迁移、长日志排查、SQL Agent、内部工具自动化这类任务里测试。没有长输入、工具调用和执行反馈,很多架构优势会被闲置。
第二,分开评估模型和系统。LongCat-2.0 的一部分价值来自模型结构,另一部分来自推理栈:PD 分离、KV-cache 切分、专家并行、MTP、多精度部署。只把权重拿到常规框架里跑短任务,未必能测到官方强调的长链路能力。
第三,用自己的硬件复测。公告里最有现实意义的说法,是「盘活更多存量国产算力」。1 这句话不能靠发布稿证明,只能靠外部开发者在不同卡型、不同上下文长度、不同并发压力下复现。
LongCat-2.0 的 7 月 12 日更新,把一个模型发布推进成了部署问题。下一步最该看的不是它还能多刷几个代码榜单,而是第三方能否用公开权重和公开推理代码,在自己的机器上稳定跑完一个真实代码 Agent 任务。
Contenido relacionado
- Inicia sesión para comentar.
