写在前面

2026 年 7 月,美团正式上线全场景 AI Agent 平台 CatPaw,搭载自研开源大模型 LongCat 2.0(1.6T MoE、MIT 协议)。这并非一个孤立的发布事件,而是一条从编辑器插件演进到企业级 Agent 托管平台的完整技术链路。本文从模型底层(LSA 稀疏注意力、MOPD 专家路由)到平台工程层(三端协同、Managed Agents、技能沉淀)做一次端到端的架构拆解。


一、CatPaw 平台定位与演进历程

1.1 三阶段演进路线

CatPaw 并非"重新发明轮子",而是一条务实的渐进式技术路线,其演进可清晰划分为三个阶段:

┌─────────────────────────────────────────────────────────────────────┐
│                      CatPaw 演进时间线                              │
├──────────────┬──────────────────────────────────────────────────────┤
│ 2023 年      │ 编辑器插件形态内部落地(IDE 插件,内部稳定运行 2 年) │
│              │ 定位:单点代码补全提效                                │
├──────────────┼──────────────────────────────────────────────────────┤
│ 2025-11-10   │ CatPaw AI IDE 正式公测                               │
│              │ 定位:Agent + AI 集成开发环境(对标 Cursor 交互基底) │
├──────────────┼──────────────────────────────────────────────────────┤
│ 2026-07-28   │ 全场景 AI Agent 平台正式上线                         │
│              │ 定位:个人提效 + 企业级 Agent 开发托管(Managed Agents)│
└──────────────┴──────────────────────────────────────────────────────┘

1.2 内部落地规模

CatPaw 在正式对外发布前,已在美团内部完成大规模验证,其落地指标在国内同类型产品中处于第一梯队:

指标 数据 说明
员工覆盖 9 万 全员规模覆盖
累计 Agent 数 3 万+ 内部搭建的 Agent 数量
研发渗透率 > 95% 研发人员日常使用比例
增量代码 AI 生成率 > 50% 新增代码中 AI 生成的占比
补全延迟 < 150ms 代码补全响应延迟

1.3 双面身份

CatPaw 的特殊性在于它同时承担两个角色,对应两条不同的技术栈:

  • AI 编程 IDE:面向开发者的智能工作台,核心是 LongCat-Flash 编程特训模型 + Ask/Agent 双模式 + 工具链闭环;
  • 全场景 Agent 平台:面向企业与个人的自主执行平台,核心是 LongCat 2.0 + Managed Agents + 行业专家技能包。

这两条线在底层共享同一套模型家族(LongCat),但在上层工程实现上分别面向"开发者编码"与"业务任务自动化"两个截然不同的场景。


二、整体架构设计

2.1 三端协同架构

CatPaw 最具辨识度的架构特征是移动端 / PC 端 / 云端三端协同,其核心设计目标是"全时段运行 + 任务不依赖设备在线"。

┌──────────────────────────────────────────────────────────────────────────┐
│                        CatPaw 三端协同架构                               │
└──────────────────────────────────────────────────────────────────────────┘

  ┌─────────────────┐      ┌─────────────────────┐      ┌────────────────┐
  │   移动端 App    │      │    PC 客户端        │      │  云端 7×24 常驻 │
  │                 │      │                     │      │                │
  │ · 随时发起任务  │      │ · 文件读写/修改     │      │ · 长程任务持续 │
  │ · 查看进度      │      │ · 浏览器控制        │      │ · 定时任务调度 │
  │ · 远程确认决策  │      │ · 终端命令执行      │      │ · 设备离线不断 │
  │ · 结果接收      │      │ · 完整深度执行能力  │      │ · 资源动态扩缩 │
  └────────┬────────┘      └──────────┬──────────┘      └───────┬────────┘
           │                          │                          │
           │     双端任务实时同步      │     任务状态回流          │
           └──────────────┬───────────┘                          │
                          │                                      │
                          ▼                                      │
              ┌───────────────────────────┐                      │
              │    任务同步与调度中枢      │◄──────────────────────┘
              │  (Task Sync & Scheduler)  │
              └─────────────┬─────────────┘
                            │
                            ▼
              ┌───────────────────────────┐
              │   LongCat 模型推理服务    │
              │  (LongCat-Flash / 2.0)    │
              └───────────────────────────┘

关键设计要点:

  1. 云端不依赖设备在线:长程任务与定时任务在云端持续运转,即使本地设备关机或断网也不受影响,完成后随时打开手机或电脑查看成果。
  2. 双端能力互补:移动端侧重"发起 + 确认 + 接收",PC 端侧重"本地深度执行"(文件操作、浏览器控制、终端命令)。
  3. 典型工作流:地铁上手机发起任务 → 云端持续运行 → 到办公室电脑查看结果,任务在中间无需人为接续。

2.2 Ask / Agent 双模式

CatPaw IDE 的核心交互范式是 Ask / Agent 双模式,覆盖从轻量问答到全自动开发的全场景。两种模式的本质区别在于"执行权"的归属。

维度 Ask 模式 Agent 模式
行为 只读问答,需手动 Apply 修改 自主执行:读/改文件、运行命令、查文档、调 API
执行权 用户持有(模型仅建议) 模型持有(在授权范围内自主操作)
安全性 高(无副作用) 中(高危操作需确认)
文件修改 不直接写盘,输出建议 直接读写文件系统
命令执行 不执行 可执行终端命令(支持 auto-run 开关)
典型场景 代码解读、Bug 定位、方案咨询 新建工程、全栈开发、自动化测试
底层数据流 单轮请求-响应 多轮 ReAct 循环 + 工具调用

设计哲学:Ask 模式保证"绝对安全",适合需要人工把关的场景;Agent 模式追求"端到端交付",适合目标明确、可自动化的任务。开发者可在 Agent → Add Mode 中按"最小权限原则"勾选工具集,自定义 Agent 的能力边界。

2.3 多 Agent 自主协同架构

面对跨领域的复杂任务,CatPaw 采用动态任务拆解 + 多 Agent 并发调度的协同架构。这是从单 Agent ReAct 循环向多 Agent 编排的关键升级。

┌──────────────────────────────────────────────────────────────────────┐
│                   多 Agent 自主协同架构                               │
└──────────────────────────────────────────────────────────────────────┘

                         ┌──────────────────┐
                         │   用户目标输入   │
                         │ "帮我做 X + Y"   │
                         └────────┬─────────┘
                                  │
                                  ▼
                    ┌──────────────────────────┐
                    │   Planner 规划器         │
                    │  · 动态任务拆解          │
                    │  · 依赖关系分析          │
                    │  · 并发度评估            │
                    └────────────┬─────────────┘
                                 │
              ┌──────────────────┼──────────────────┐
              │                  │                  │
              ▼                  ▼                  ▼
     ┌────────────────┐ ┌────────────────┐ ┌────────────────┐
     │  Agent-A       │ │  Agent-B       │ │  Agent-C       │
     │  独立沙箱环境  │ │  独立沙箱环境  │ │  独立沙箱环境  │
     │  专属工具集    │ │  专属工具集    │ │  专属工具集    │
     │  进度实时上报  │ │  进度实时上报  │ │  进度实时上报  │
     └────────┬───────┘ └────────┬───────┘ └────────┬───────┘
              │                  │                  │
              └──────────────────┼──────────────────┘
                                 │
                                 ▼
                    ┌──────────────────────────┐
                    │   结果自动汇总聚合器     │
                    │  · 交付 Excel/报告/代码  │
                    └──────────────────────────┘

协同机制的核心特征:

  1. 独立环境隔离:各 Agent 在独立沙箱中运行,互不干扰,避免文件竞争与状态污染;
  2. 进度实时可见:每个 Agent 的执行步骤实时上报,用户可随时查看;
  3. 结果自动汇总:子任务完成后由聚合器统一交付可用成果(Excel、可视化报告、代码等);
  4. 并发调度:无依赖关系的子任务并发执行,缩短整体完成时间。

三、LLM 后端:LongCat 模型家族

CatPaw 的模型底座是美团自研的 LongCat 模型家族,其中两个关键成员分别服务不同场景。

3.1 LongCat-Flash(IDE 编程模型)

LongCat-Flash 是 CatPaw IDE 的核心驱动模型,定位为"编程特训、低延迟、高吞吐":

  • 训练数据:20T+ tokens,其中包含大量编程语料专项强化;
  • 优化方向:代码补全延迟 < 150ms,侧重单 Token 生成吞吐与工具调用稳定性;
  • 应用层:IDE 中的代码补全、Ask/Agent 默认模型、@Docs 知识问答。

3.2 LongCat 2.0(平台核心模型)

LongCat 2.0 是 CatPaw 全场景 Agent 平台的核心推理引擎,于 2026 年 6 月 30 日发布技术方案,7 月 5 日完成全量 MIT 开源。其核心参数如下:

指标 参数详情
模型总参数量 1.6T(1.6 万亿)MoE 架构
单 Token 激活参数 约 48B(动态范围 33B ~ 56B)
原生上下文窗口 1M tokens(100 万)
预训练数据规模 30T+ tokens(官方技术博客口径 35T+)
训练算力 5 万张国产 AI ASIC 卡(业界首个全流程国产算力训练的万亿参数模型)
开源协议 MIT(商用无限制,完整权重 + 推理源码)
训练稳定性 全程无回滚、无不可逆 loss spike

国产算力关键意义:LongCat 2.0 的预训练与大规模部署完全建立在 AI ASIC superpods 之上,预训练跨越数百万加速器日,证明在非 Nvidia 生态上也可完成前沿规模训练。

3.3 LongCat 2.0 三大核心技术

LongCat 2.0 并非简单堆参数,其架构设计包含三个正交的核心创新。

① LongCat Sparse Attention(LSA)稀疏注意力

传统 Transformer 自注意力复杂度为 O(n²),序列长度翻倍则计算量翻四倍,对 1M 上下文窗口完全不可行。LSA 是 DeepSeek Sparse Attention(DSA)的演进版,针对 DSA 中 Lightning Indexer 的"输出不连续"与"二次打分开销"两个瓶颈,引入三层正交优化

┌──────────────────────────────────────────────────────────────────────┐
│              LongCat Sparse Attention (LSA) 三层正交索引架构         │
└──────────────────────────────────────────────────────────────────────┘

   输入序列 (1M tokens)
        │
        ▼
 ┌──────────────────────────────────────────────────────────┐
 │  ① SI 流式索引 (Streaming-aware Indexing)                │
 │  · 将 Token 选取预算做硬件对齐重排                       │
 │  · 碎片化内存读取 → 连续有序访问 (coalesced HBM access)  │
 │  · 释放高有效带宽,降低长文本 IO 开销                    │
 └──────────────────────┬───────────────────────────────────┘
                        │
                        ▼
 ┌──────────────────────────────────────────────────────────┐
 │  ② CLI 跨层索引 (Cross-Layer Indexing)                   │
 │  · 利用相邻层注意力显著度的经验稳定性                    │
 │  · 单次索引结果复用至多层计算 (amortize indexing cost)   │
 │  · 训练期跨层蒸馏 (cross-layer distillation) 保证一致性  │
 │  · 推理期:每 2 个连续层共享 1 次索引 (target model)     │
 └──────────────────────┬───────────────────────────────────┘
                        │
                        ▼
 ┌──────────────────────────────────────────────────────────┐
 │  ③ HI 分层索引 (Hierarchical Indexing)                   │
 │  · 两阶段粗到细打分 (coarse-to-fine)                     │
 │  · 第一阶段:块级近似打分粗召回 (block-level)            │
 │  · 第二阶段:候选集内精细 Token 选取 (fine-grained)      │
 │  · 训练免 (training-free),仅超长上下文任务启用          │
 └──────────────────────┬───────────────────────────────────┘
                        │
                        ▼
              稀疏注意力计算 (线性级复杂度)
              O(n²) ──────► O(n)

三层正交性的工程价值:SI、CLI、HI 三者可独立启用/禁用。这种正交设计意味着不同部署环境(显存受限 vs. 算力受限 vs. 极长上下文)可灵活组合,而非"一刀切"。LSA 还延伸到 3-step Multi-Token Prediction(MTP)模块以加速投机解码——在 MTP 中所有 3 个 draft step 共享 step 1 生成的索引集。

② N-gram Embedding 多粒度嵌入层

LongCat 2.0 继承自 LongCat-Flash-Lite 的 N-gram Embedding 技术,内置 135B 专用嵌入参数,n-gram size 配置为 5。其设计遵循两条缩放原则:

  1. MoE 稀疏性已跨过甜点:即便不考虑 N-gram Embedding,模型稀疏度已达约 97%,此时再为专家扩展 135B 参数收益微乎其微;同等参数规模的 N-gram Embedding 收益远超标准专家。
  2. 比例约束在最优区间:缩放实验表明,当 n-gram embedding 参数占比超过总预算 50% 时,其相对专家扩展的优势消失。LongCat 2.0 将该比例严格控制在 10% 以内。

工程收益:将参数从专家迁移到 N-gram Embedding,可减少大 batch 解码时的内存 I/O,加速生成。

③ MOPD + Zero-Compute Experts 动态专家路由

LongCat 2.0 在后训练阶段引入多教师学习专用专家组设计,采用 MOPD(Multi-Operation-Pooling-Decoder)架构整合三类专家能力,配合 Zero-Compute Experts 休眠机制实现动态激活。

专家类型 专攻能力 训练优化重点
Agent Experts 复杂真实场景的自主任务执行(代码、工作、检索等垂直领域 SOTA) 端到端任务成功率 + 原子能力(精确工具调用、多轮 API 参数解析、自我纠错抑制无限循环/重复调用)
Reasoning Experts 深度逻辑推理、按问题难度自适应计算 数学、STEM 求解、多跳推理任务
Interaction Experts 人类对齐与用户体验优化 细粒度指令遵循、抑制事实幻觉、建立有界安全机制且不损害有用性

Zero-Compute Experts(零计算专家)休眠机制:闲置专家进入休眠状态,单次推理仅动态激活 33B ~ 56B 参数,无冗余算力消耗。这是 1.6T 总参数却只需 ~48B 激活算力的关键——既保留能力上限,又控制推理成本。


四、Managed Agents 企业级架构

CatPaw Managed Agents 是企业级 AI Agent 开发与托管平台,提供开箱即用的工程底座。其核心价值是"无需从零搭建底层基建,即可快速构建、部署与管理专属 Agent"。该平台由四大支柱构成。

4.1 四大支柱

① 数字员工系统

数字员工是运行在飞书、企微等 IM 中的 AI 虚拟同事,@ 即可唤醒。其工程特征:

  • 扫码即用:平台预置多种角色模板,扫码即激活;
  • 行业模板:美团本地生活积累沉淀为专属模板,非通用聊天机器人,而是理解业务的行业 AI 助手;
  • 对话生成:通过 AI 对话描述需求,快速生成专属数字员工;
  • 全自动部署:从 Agent 创建到环境部署、会话初始化全程自动完成,无需手动配置;
  • 在线管理:提示词、知识库、凭证、工具均支持在线管理,团队按业务场景灵活搭建。

② 企业级安全架构

安全是企业落地的硬门槛,CatPaw 的安全设计覆盖四个层面:

安全维度 实现机制
运行环境隔离 Agent 运行环境严格隔离,租户间数据互不可见
凭证集中托管 凭证集中托管,确保 Agent 全程零接触敏感资产
分级权限管控 支持分级权限管控,满足企业最小权限原则
私有化部署 支持私有化部署,全面满足合规与安全审计要求

"凭证零接触"是关键设计:Agent 调用外部 API 时,凭证由平台集中注入,Agent 代码本身不持有任何密钥,从架构上杜绝凭证泄露风险。

③ Agent 托管运行

托管运行层解决"持续在线 + 成本可控"的矛盾:

  • 按需配置运行环境:一键托管上线;
  • 资源动态扩缩:根据负载弹性伸缩;
  • 百毫秒级冷启动:沙箱环境轻量隔离,冷启动延迟控制在百毫秒级;
  • 闲时自动释放:空闲资源自动回收,兼顾响应速度与成本。

百毫秒级冷启动的实现依赖于轻量沙箱与预热池技术,这是支撑"@ 即唤醒"体验的工程基础。

④ 可视化运维

┌──────────────────────────────────────────────────────────┐
│              统一运维管理界面                             │
├──────────────────────────────────────────────────────────┤
│  ┌────────────────┐  ┌────────────────┐                  │
│  │ 会话记录留存   │  │ 在线调试       │                  │
│  │ 完整可追溯     │  │ 实时排查问题   │                  │
│  └────────────────┘  └────────────────┘                  │
│  ┌────────────────┐  ┌────────────────┐                  │
│  │ 模型调用量统计 │  │ 消耗明细       │                  │
│  │ 清晰可见       │  │ 成本可查       │                  │
│  └────────────────┘  └────────────────┘                  │
└──────────────────────────────────────────────────────────┘

多维度数据统计与分析帮助团队持续评估 Agent 表现、优化运行效果,形成"运行 → 观测 → 优化"的闭环。


五、多场景任务处理机制

5.1 专家 + 技能两层架构

CatPaw 的能力组织采用专家(Expert)+ 技能(Skill)两层架构

  • 专家:集成多项技能与子代理,高效完成特定领域的复杂任务。从专家广场一键安装即可使用,也可通过对话将个人工作方式封装为专属专家,团队共享复用。
  • 技能:平台内置丰富技能库,开箱即用,是构成专家能力的原子单元。
┌──────────────────────────────────────────────────┐
│              专家 (Expert)                        │
│  ┌──────────┐ ┌──────────┐ ┌──────────┐         │
│  │ 技能 A   │ │ 技能 B   │ │ 子代理 C │         │
│  └──────────┘ └──────────┘ └──────────┘         │
└──────────────────────────────────────────────────┘
        ▲                          ▲
        │ 一键安装                  │ 对话封装
        │                          │
  专家广场                     个人工作流

5.2 操作录制 → 技能沉淀(核心差异化能力)

这是 CatPaw 最具差异化的能力之一。内嵌浏览器支持操作过程一键录制,将日常高频流程自动生成专属技能:

用户在浏览器中手动操作流程
        │
        ▼
 ┌──────────────────────────┐
 │  操作录制器 (Recorder)   │
 │  · 捕获点击/输入/导航    │
 │  · 记录页面状态变化      │
 └────────────┬─────────────┘
              │
              ▼
 ┌──────────────────────────┐
 │  技能生成器              │
 │  · 操作序列 → 可执行技能 │
 │  · 参数化与泛化          │
 └────────────┬─────────────┘
              │
              ▼
 ┌──────────────────────────┐
 │  专属技能库              │
 │  · 个人复用              │
 │  · 团队共享              │
 │  · 数字化资产沉淀        │
 └──────────────────────────┘

价值:个人与团队的隐性经验("我知道怎么操作但不一定能讲清楚")被沉淀为可复用的显性数字化资产,这是普通 Agent 框架难以做到的"经验工程化"。

5.3 跨会话长期记忆

CatPaw 支持跨会话长期记忆,自动记忆用户的个性化偏好、操作习惯与历史上下文,跨设备、跨对话保持连续理解。这与三端协同架构配合——记忆存储在云端,移动端与 PC 端共享同一份记忆,实现"越用越懂你"。

5.4 本地生活行业专家技能包

依托美团十余年本地生活深耕,CatPaw 将行业认知封装为即装即用的专家与技能,覆盖四大场景域:

场景域 典型能力
门店经营 门店评价诊断与优化、门店装修
商品 商品文案生成
营销 营销物料设计评估、活动策划
经营分析 经营数据分析、销售/团购核销/评价/库存信息汇总、异常识别

以服务零售为例,美团商家运营专家整合经营数据分析、评价管理、门店装修等核心场景,帮助商家实现智能化运营。这些技能包覆盖外卖、服务零售、医药健康等多个行业。

5.5 规划策略与任务编排

面对长程创作类任务,CatPaw 的多 Agent 编排能力体现为"规划 → 并行执行 → 评估回流"的闭环。以 AI 小说工厂为例,其编排链路如下:

┌──────────────────────────────────────────────────────────────┐
│                  AI 小说工厂 任务编排链路                     │
└──────────────────────────────────────────────────────────────┘

  ┌─────────────────────┐
  │ ① 世界观构建        │
  │  · 设定/人物/规则   │
  └──────────┬──────────┘
             │ 世界观作为共享上下文
             ▼
  ┌─────────────────────────────────────────┐
  │ ② 并行章节生成 (多 Agent 并发)          │
  │  ┌────────┐ ┌────────┐ ┌────────┐      │
  │  │ 章节 1 │ │ 章节 2 │ │ 章节 N │      │
  │  └───┬────┘ └───┬────┘ └───┬────┘      │
  └──────┼──────────┼──────────┼───────────┘
         │          │          │
         ▼          ▼          ▼
  ┌─────────────────────────────────────────┐
  │ ③ 质量评估                              │
  │  · 一致性检查 / 文学性打分              │
  └────────────────────┬────────────────────┘
                       │ 不达标章节
                       ▼
              ┌─────────────────┐
              │ ④ 回流修订      │
              │  · 针对性重写   │
              └─────────────────┘

这种编排模式的核心在于:世界观作为全局共享上下文注入每个章节 Agent,保证一致性;质量评估环节形成反馈回路,不达标章节回流修订,而非简单的一次性生成。


六、技术栈与工具链

6.1 IDE 内置 11 类原生工具

Agent 模式的执行能力建立在完整的工具链闭环之上,CatPaw IDE 当前内置 11 类原生工具:

 文件类:readFile / writeFile / createDir
 代码类:grep / searchSymbol / findReferences
 终端类:runCommand(支持 auto-run 开关)
 网络类:fetchURL / searchWeb
 测试类:runTests / debug

工具集遵循"最小权限原则":开发者可按需勾选所需工具集,避免 Agent 拥有不必要的能力。runCommandauto-run 开关允许控制命令是否自动执行,平衡效率与安全。

6.2 MCP 协议扩展

CatPaw 支持 MCP(Model Context Protocol)扩展,突破内置工具的边界。典型场景:接入 Chrome DevTools MCP,可实现"开发 → 启动 → 自动测试"无缝衔接——Agent 修改代码后自动打开浏览器、截图验证、回归测试,形成自动化闭环。

6.3 @Docs 知识索引系统(RAG 能力)

CatPaw 复刻并优化了 Cursor 标志性的 @Docs 功能,让 AI 学习私有文档:

  1. 进入 Settings → Indexing & Docs
  2. 添加 URL 或本地文档(支持 Markdown / PDF);
  3. 等待 indexed 状态生效;
  4. 对话中 @doc_name 即可引用知识。

实测:同时索引 CatPaw 官方文档与 Cursor Docs,Agent 可精准对比二者在 Agent 能力上的异同,输出结构化 Markdown 表格。

6.4 代码库索引能力

CatPaw 的代码库索引速度是其工程优势之一:

代码库规模 索引耗时
500 行 约 5 秒
12000 行 约 45 秒

快速的代码库索引使得 Agent 在大型项目中的上下文理解延迟可控,支撑仓库级别的代码编辑与跨文件重构。

6.5 自定义 Agent 配置模式

Agent → Add Mode 中可创建个性化 Agent,配置项包括:

  • 指定模型(LongCat-Flash / GLM-4.6 / Qwen2.5-Coder);
  • 勾选所需工具集(最小权限原则);
  • 编写角色化 Prompt(如"你是资深 React 性能工程师");
  • 开启 auto-fix(自动修 Linter)或 auto-run(自动执行终端命令)。

此外,CatPaw 支持将固定内容配置为 System Prompt,在每次侧边栏对话与 Inline 对话开始时自动发送给模型,确保团队代码规范的一致性。


七、LongCat 2.0 私有化部署实战

LongCat 2.0 采用 MIT 协议完整开放权重与推理代码,支持企业私有化部署。以下为基于 SGLang 的完整部署流程。

7.1 硬件与环境前置要求

  • 硬件推荐:16 张 H20 GPU(官方标准部署环境);
  • Python 版本:3.10 及以上;
  • 依赖库:sglang、torch、transformers;
  • GPU 架构适配:H100/H200(SM90A)需单独编译专用内核;
  • 无多卡集群替代方案:官方在线 Demo、OpenRouter API、国产 NPU 集群部署。

7.2 部署步骤

步骤 1:环境依赖安装

# 校验 Python 版本
python3 --version
# 安装基础推理依赖
pip3 install sglang torch transformers

步骤 2:拉取官方开源仓库

git clone https://github.com/meituan-longcat/LongCat-2.0.git
cd LongCat-2.0

步骤 3:编译 SM90A 架构专用 SGLang 内核

H20/H100 显卡必须编译定制内核以适配 LSA 稀疏注意力算子:

cd sgl-kernel
python3 -m uv build --wheel --color=always --no-build-isolation \
  -Ccmake.define.SGL_KERNEL_ENABLE_SM90A=1 \
  -Ccmake.define.CMAKE_POLICY_VERSION_MINIMUM=3.5 \
  -Cbuild-dir=build .
# 强制安装编译完成的内核包
pip3 install dist/sgl_kernel-0.3.21-cp310-abi3-linux_x86_64.whl --force-reinstall

步骤 4:启动分布式推理服务

采用张量并行(TP)+ 专家并行(EP)组合部署,开放局域网访问,端口 13423:

python -m sglang.launch_server \
  --model meituan-longcat/LongCat-2.0-FP8 \
  --trust-remote-code \
  --host 0.0.0.0 \
  --port 13423 \
  --tp 16 \
  --ep 16 \
  --mem-fraction-static 0.9

步骤 5:OpenAI 兼容 API 调用示例

服务启动后可通过标准 OpenAI SDK 调用:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:13423/v1",
    api_key="not-needed"
)

response = client.chat.completions.create(
    model="meituan-longcat/LongCat-2.0-FP8",
    messages=[
        {"role": "system", "content": "你是专业 AI 开发助手"},
        {"role": "user", "content": "编写 Python 脚本,批量将当前目录 jpg 文件按创建日期重命名"}
    ],
    temperature=0.7,
    max_tokens=2048
)
print(response.choices[0].message.content)

7.3 部署关键注意事项

注意事项 说明
--trust-remote-code 必填 模型内置自定义 LSA 注意力算子,必须信任远程代码
HI 模块暂不支持 当前版本暂不支持简化分层索引(HI)模块,仅完整集群部署生效
显存占用参数 --mem-fraction-static 建议 0.8 ~ 0.9,预留内存防止 OOM
单机不可用 激活参数 48B,消费级单卡 GPU 无法稳定运行

八、性能 Benchmark 对比

8.1 内部落地指标

指标 数据
员工覆盖 9 万
累计 Agent 3 万+
研发渗透率 > 95%
增量代码 AI 生成率 > 50%
代码补全延迟 < 150ms

8.2 IDE 实测性能

测试项 数据
500 行代码库索引 约 5 秒
12000 行代码库索引 约 45 秒
代码补全延迟 < 150ms
公测免费额度 500 次高阶额度

8.3 LongCat 2.0 vs 闭源旗舰模型对比

以下为代码、Agent 检索交互、基础通用能力三大赛道对比(带 * 为厂商官方公开数据):

代码能力评测

评测基准 LongCat-2.0 GPT-5.5 Claude Opus 4.8 Gemini 3.1 Pro
SWE-bench Pro 59.5 58.6* 69.2* 54.2*
SWE-bench Multilingual 77.3 - 84.8* 76.9*
Terminal-Bench 70.8 73.8* 78.9* 70.7*

Agent 检索交互能力

评测基准 LongCat-2.0 GPT-5.5 Claude Opus 4.8 Gemini 3.1 Pro
FORTE 73.2 77.8 77.2 70.3
RWSearch 长文本检索 78.8 85.3 77.3 76.3
BrowseComp 网页解析 79.9 84.4* 84.3* 85.9*

基础通用能力

评测基准 LongCat-2.0 GPT-5.5 Claude Opus 4.8 Gemini 3.1 Pro
IFEval 指令遵循 90.0 95.0 86.0 96.1
Writing Bench 文本创作 83.8 84.7 85.2 83.7
GPQA-diamond 专业推理 88.9 93.6* 92.4 94.3*

关键结论:

  1. 代码领域:SWE-bench Pro 得分 59.5,超越 GPT-5.5 官方 58.6,多语言代码理解优势突出;
  2. 长文本/网页:检索与浏览任务表现均衡,适配 RAG 与网页智能体;
  3. OpenRouter 全球调用量:LongCat 2.0 进入全球调用量前三;
  4. 数理推理:GPQA-diamond 略低于头部闭源模型,是当前主要短板。

8.4 与主流开源/闭源大模型横向对比

对比维度 LongCat-2.0 DeepSeek-V3.2 Llama 4 Maverick GPT-5.5
总参数量 1.6T MoE 671B 约 400B 未公开
单 Token 激活参数 ~48B 37B 未公开 未公开
最大上下文 1M tokens 128K 128K 128K+
开源协议 MIT 商用免费 ML 协议 Llama 商用限制 闭源仅 API
SWE-bench Pro 59.5 未公开 未公开 58.6
部署门槛 需 16×H20 集群 高算力集群 多卡 GPU 仅云端调用

九、与其他 Agent 框架对比

9.1 CatPaw vs Cursor / Copilot

维度 CatPaw Cursor GitHub Copilot
产品形态 AI IDE + 全场景 Agent 平台 AI IDE 编辑器插件 + Chat
核心模型 LongCat-Flash / 2.0(自研开源) Claude / GPT(闭源) GPT 系列(闭源)
三端协同 移动/PC/云端 7×24 PC 为主 编辑器内
云端常驻 支持(设备离线不断) 不支持 不支持
操作录制→技能 支持(核心差异化) 不支持 不支持
行业专家技能包 本地生活全链路
企业级托管 Managed Agents Copilot Workspace(有限)
私有化部署 支持(MIT 模型) 不支持 不支持
中文优化 原生中文 一般

9.2 美团 vs OpenAI vs 阶跃星辰路线对比

维度 美团(CatPaw + LongCat) OpenAI(GPT + Operator) 阶跃星辰
模型策略 自研开源(MIT)+ 国产算力 闭源旗舰 自研多模态
平台定位 全场景 Agent + 企业托管 通用 API + Operator Agent 多模态 Agent
行业纵深 本地生活 Know-how 护城河 通用 通用偏多模态
开源开放 模型 + 平台双开放 闭源 部分开源
落地验证 9 万员工内部大规模验证 全球开发者 垂直场景

9.3 CatPaw vs Coze / Dify / LangChain

维度 CatPaw Coze(字节) Dify LangChain
类型 模型+平台+行业知识一体化 Agent 搭建平台 LLM 应用开发平台 Agent 编排框架
自研模型 LongCat 2.0(1.6T MIT) 依赖第三方 依赖第三方 依赖第三方
企业托管 Managed Agents 全栈 无(框架级)
端形态 移动/PC/云端三端 多端 Web/API 代码库
行业技能包 本地生活深度封装 通用 通用 通用
操作录制 支持 不支持 不支持 不支持
代码能力 SWE-bench Pro 59.5 依赖模型 依赖模型 依赖模型

核心差异:CatPaw 是少数"模型 + 平台 + 行业知识"三位一体的方案,而 Coze/Dify/LangChain 本身不产模型,需对接第三方 LLM。


十、核心差异化与局限

10.1 核心差异化

CatPaw 的护城河可归纳为"模型 + 平台 + 行业知识"三位一体:

  1. 模型层:LongCat 2.0 是开源市场唯一同时满足"1.6T MoE + 原生 1M 上下文 + MIT 完全商用开源"三大特性的模型,且全程国产算力训练;
  2. 平台层:Managed Agents 提供从数字员工到可视化运维的企业级全栈托管,三端协同 + 操作录制沉淀是工程差异化;
  3. 行业知识层:美团十余年本地生活积累封装为专家与技能包,这是纯技术公司难以复制的 Know-how 护城河。

三者形成正反馈:行业知识反哺模型微调方向,平台工程支撑模型能力落地,模型开源降低企业选型门槛。

10.2 局限性

客观来看,CatPaw / LongCat 2.0 当前仍存在以下局限:

局限维度 具体表现 影响场景
部署门槛 需 16×H20 GPU 集群,消费级单卡不可用 中小团队私有化部署困难
数理推理 GPQA-diamond 88.9,低于 GPT-5.5(93.6)、Gemini(94.3) 顶尖数学竞赛、高难度 STEM 求解
自定义 endpoint IDE 暂不支持完全自定义 endpoint 需接入私有模型服务的场景受限
HI 模块 暂不支持简化分层索引 HI 模块,仅完整集群部署生效 轻量化部署无法用满 LSA 全部优化
闭源差距 Terminal-Bench、BrowseComp 等仍落后 Claude Opus 4.8 极致代码/浏览 Agent 任务

10.3 适用边界建议

基于上述分析,LongCat 2.0 的最优落地场景与不推荐场景如下:

最优落地场景

  • 代码智能 Agent(自动化 Bug 修复、代码评审、多语言工程脚本);
  • 百万级长文档分析(整本图书、大型项目文档、合同卷宗一次性解析);
  • 检索增强 RAG + 网页智能体(知识库问答、联网调研);
  • 多语言开发工具。

不推荐场景

  • 轻量化单机对话产品(激活参数 48B,单卡无法稳定运行);
  • 顶尖数学竞赛解题(数理推理低于头部闭源模型)。

结语

CatPaw 的技术价值不在于某一个单点突破,而在于它打通了"自研万亿参数开源模型 → 国产算力全流程训练 → 全场景 Agent 平台 → 企业级托管 → 行业 Know-how 沉淀"的完整链路。从工程视角看,三层正交的 LSA 稀疏注意力、MOPD 动态专家路由、三端协同架构、操作录制技能沉淀,每一个都是可独立分析的工程课题;而从产业视角看,"模型 + 平台 + 行业知识"三位一体才是其真正的差异化所在——行业 Know-how 是最难复制的那一层护城河。

对于有私有化部署、自建代码智能体、长文档分析平台需求的企业开发者,LongCat 2.0 是现阶段值得优先评估的开源选型;对于关注 Agent 平台工程实践的开发者,CatPaw 的 Managed Agents 架构与技能沉淀机制提供了有价值的参考范式。


参考资料

本文基于公开资料整理,技术细节以美团官方文档与开源代码为准。