
CatPaw:美团把 LongCat 2.0 从开源模型推到企业 Agent 平台
美团发布 CatPaw 全场景 AI Agent 平台,把 LongCat 2.0 接入移动、PC、云端协作和企业级 Agent 托管,但公开材料仍未给出长任务成功率、成本与人工接管数据。
CatPaw 的新增信息:LongCat 2.0 开始进入工作流
美团这次发布的 CatPaw,不是 LongCat 2.0 的又一个产品入口,而是把模型、终端、工具和企业运维放进同一套 AI Agent 平台。美团官方将它定位为「全场景 AI Agent 平台」,同时提供面向个人的 AI 工作台,以及面向企业的 Agent 开发与托管能力。1
底层模型仍是本月正式开源的 LongCat 2.0:总参数 1.6T,平均激活约 48B,动态激活范围为 33B 到 56B,原生支持 1M 上下文。美团称,该模型在五万张国产算力卡上完成了全流程训练与推理,并开放了 GPU、NPU 推理代码和多精度版本。2
这次更新的观察重点因此发生了变化。LongCat 2.0 开源时,问题是万亿参数模型能否在不同算力上跑起来;CatPaw 发布后,问题变成模型能否持续接任务、使用工具、跨设备执行,并被企业当成一项可管理的基础设施来使用。
三端协作,长任务不再绑定一台电脑
CatPaw 提供移动端 App 和 PC 客户端,任务状态实时同步。手机端适合发起任务、查看进度和确认关键决策,PC 端负责文件操作、浏览器控制和终端命令。云端模式则让任务在本地设备关机或断网后继续运行,官方给出的能力描述是支持 7 × 24 小时运行长程任务和定时任务。1

这套设计解决的是 Agent 使用中的一个具体摩擦:任务启动、深度执行和结果确认往往发生在不同时间、不同设备上。比如,用户可以在手机上交代一个资料整理任务,让云端继续处理,再回到 PC 上检查文件和修改结果。它更接近一个持续运行的工作空间,而不是把聊天窗口从手机复制到电脑。
不过,「持续在线」描述的是平台运行方式,不等于 Agent 可以在所有任务上无人监督。官方文章仍然把自主执行限定在授权范围内,也没有公布长任务的成功率、人工接管频率、失败恢复时间或云端运行成本。这些数据决定了三端协作究竟是方便的工作流,还是需要频繁盯盘的自动化演示。
多 Agent 的价值在于交付,不在于数量
CatPaw 的任务入口仍然是对话,但目标不是只返回一段文字。用户给出最终目标后,Agent 可以读取文件、操作浏览器、运行终端命令,并交付 Excel、可视化报告或代码。面对跨领域任务,系统会动态拆解步骤,调度带有不同工具的 Agent 并发处理,各 Agent 运行在独立环境中,最后汇总结果。1

这里最值得关注的不是「3 个 Agent」或更多子代理,而是任务分工是否真的减少了等待和返工。一个可用的协同系统至少要处理四件事:谁负责拆解任务,哪些步骤可以并发,子任务失败后由谁重试,最终结果如何让用户核验。美团的发布材料展示了任务规划、Subagent 分工和结果文件,但没有给出不同任务复杂度下的成功率或延迟对比,因此还不能据此判断它相对单 Agent 工作流的稳定收益。
CatPaw 还把专家和技能做成了可复用组件。用户可以从专家广场安装能力,也可以通过对话描述工作方式,或者录制浏览器操作,把高频流程沉淀成团队可复用的技能。平台同时支持跨会话长期记忆,让偏好、操作习惯和历史上下文跨设备延续。1
这条路线的工程含义是,Agent 的价值不再只由模型单次回答决定,还取决于技能能否复用、知识是否及时更新、凭证是否安全,以及流程变化后能否快速调试。技能库越接近真实业务,维护成本也越不能被忽略。
Managed Agents 把 Agent 变成企业系统
CatPaw Managed Agents 面向的是另一类用户:需要批量创建、部署和管理专属 Agent 的企业团队。美团给出的工程底座包括 Agent 创建、运行环境部署、会话初始化、提示词、知识库、凭证和工具管理,企业不需要从零搭建这些基础设施。1
数字员工是其中最容易被理解的一层。Agent 可以运行在飞书、企微等 IM 中,通过 @ 唤醒;企业可以扫码使用预置角色,也可以用自然语言描述需求,生成专属数字员工。平台还提供按团队或角色下发专家和技能的能力,适合把一套运营流程分配给不同岗位。
企业真正要付出工程成本的部分,通常在 Agent 被大量使用以后。CatPaw 官方文章列出的托管能力包括:
- 运行环境按需配置,一键托管上线,资源可以动态扩缩。
- 沙箱提供轻量隔离,官方称冷启动达到百毫秒级,闲时自动释放资源。
- 会话记录完整留存,支持在线调试,模型调用量和消耗可见。
- 租户之间数据互不可见,凭证集中托管,Agent 不直接接触敏感资产。
- 支持分级权限、全链路审计和私有化部署。1

这部分比「数字员工」这个名称更重要。企业接入 Agent,难点往往不是让模型调用一个工具,而是把权限边界、凭证生命周期、会话审计、成本核算和故障排查接起来。CatPaw 至少把这些模块列入了平台产品范围,但发布文章没有展开权限粒度、审计日志格式、私有化交付条件和隔离机制的第三方验证,技术团队在采购或自建对比时仍要逐项核对。
9 万员工、3 万 Agent 说明了什么
美团称,CatPaw 已在内部覆盖 9 万名员工,搭建 Agent 3 万个,并在多个真实业务场景中完成验证。这个数字说明平台已经进入大规模内部使用阶段,也说明美团把 Agent 的推广单位从单个模型调用扩展到了员工、团队和业务流程。1
但它不是效果指标。官方材料没有同时给出这 3 万个 Agent 的活跃比例、任务完成率、平均调用成本、节省的人工时间、错误率或人工复核比例。读者可以把这组数据理解为部署规模和组织采用信号,不能直接理解为 3 万个 Agent 都在稳定创造同等价值。
对工程团队来说,CatPaw 当前最值得验证的有四个问题:
- 长程任务失败后,系统能否定位失败步骤并恢复,而不是从头重跑。
- 复杂任务拆给多个 Agent 后,结果合并是否比单 Agent 更可靠,额外的上下文和调用成本是多少。
- 数字员工连接企业知识库、业务系统和 IM 时,权限是否能细到人、角色、工具和数据对象。
- 7 × 24 小时托管运行的实际价格、资源上限、私有化交付方式和可观测数据是否足够支撑生产运维。
CatPaw 的发布把 LongCat 2.0 从「可下载的万亿参数模型」推进到「可接入工作流程的 Agent 平台」。这一步的完成度,最终要由真实任务的失败恢复、企业权限和长期成本来决定,而不是由参数规模或 Agent 数量单独决定。平台体验入口是 CatPaw。
Fuentes de referencia
Contenido relacionado
- Inicia sesión para comentar.
More from this channel›
- GPT-5.6 的 20% serving 成本下降:OpenAI 把优化推进到内核和 Agent harness
- ARC-AGI-3 从 13.3% 到 38.3%:OpenAI 拆解 Agent 基准的 harness 影响
- OpenAI 的 8 个科研计算案例:Agent 加速了代码,验证仍由人把关
- Claude Mythos Preview 找到 HAWK 与 7 轮 AES 的新攻击
- MineExplorer:Claude-Opus-4.6 成功率约 41%,多模态模型卡在动态世界
- LoHoSearch:GPT-5.5 也只答对 34.74%,长程搜索难在关系链
- Qwen-Music:先规划旋律,再生成整首歌
- Claude Opus 5:接近 Fable 5 的能力,成本曲线才是重点
