写在前面
2026 年 7 月,美团正式上线全场景 AI Agent 平台 CatPaw,搭载自研开源大模型 LongCat 2.0(1.6T MoE、MIT 协议)。这并非一个孤立的发布事件,而是一条从编辑器插件演进到企业级 Agent 托管平台的完整技术链路。本文从模型底层(LSA 稀疏注意力、MOPD 专家路由)到平台工程层(三端协同、Managed Agents、技能沉淀)做一次端到端的架构拆解。
一、CatPaw 平台定位与演进历程
1.1 三阶段演进路线
CatPaw 并非"重新发明轮子",而是一条务实的渐进式技术路线,其演进可清晰划分为三个阶段:
┌─────────────────────────────────────────────────────────────────────┐
│ CatPaw 演进时间线 │
├──────────────┬──────────────────────────────────────────────────────┤
│ 2023 年 │ 编辑器插件形态内部落地(IDE 插件,内部稳定运行 2 年) │
│ │ 定位:单点代码补全提效 │
├──────────────┼──────────────────────────────────────────────────────┤
│ 2025-11-10 │ CatPaw AI IDE 正式公测 │
│ │ 定位:Agent + AI 集成开发环境(对标 Cursor 交互基底) │
├──────────────┼──────────────────────────────────────────────────────┤
│ 2026-07-28 │ 全场景 AI Agent 平台正式上线 │
│ │ 定位:个人提效 + 企业级 Agent 开发托管(Managed Agents)│
└──────────────┴──────────────────────────────────────────────────────┘
1.2 内部落地规模
CatPaw 在正式对外发布前,已在美团内部完成大规模验证,其落地指标在国内同类型产品中处于第一梯队:
| 指标 | 数据 | 说明 |
|---|---|---|
| 员工覆盖 | 9 万 | 全员规模覆盖 |
| 累计 Agent 数 | 3 万+ | 内部搭建的 Agent 数量 |
| 研发渗透率 | > 95% | 研发人员日常使用比例 |
| 增量代码 AI 生成率 | > 50% | 新增代码中 AI 生成的占比 |
| 补全延迟 | < 150ms | 代码补全响应延迟 |
1.3 双面身份
CatPaw 的特殊性在于它同时承担两个角色,对应两条不同的技术栈:
- AI 编程 IDE:面向开发者的智能工作台,核心是 LongCat-Flash 编程特训模型 + Ask/Agent 双模式 + 工具链闭环;
- 全场景 Agent 平台:面向企业与个人的自主执行平台,核心是 LongCat 2.0 + Managed Agents + 行业专家技能包。
这两条线在底层共享同一套模型家族(LongCat),但在上层工程实现上分别面向"开发者编码"与"业务任务自动化"两个截然不同的场景。
二、整体架构设计
2.1 三端协同架构
CatPaw 最具辨识度的架构特征是移动端 / PC 端 / 云端三端协同,其核心设计目标是"全时段运行 + 任务不依赖设备在线"。
┌──────────────────────────────────────────────────────────────────────────┐
│ CatPaw 三端协同架构 │
└──────────────────────────────────────────────────────────────────────────┘
┌─────────────────┐ ┌─────────────────────┐ ┌────────────────┐
│ 移动端 App │ │ PC 客户端 │ │ 云端 7×24 常驻 │
│ │ │ │ │ │
│ · 随时发起任务 │ │ · 文件读写/修改 │ │ · 长程任务持续 │
│ · 查看进度 │ │ · 浏览器控制 │ │ · 定时任务调度 │
│ · 远程确认决策 │ │ · 终端命令执行 │ │ · 设备离线不断 │
│ · 结果接收 │ │ · 完整深度执行能力 │ │ · 资源动态扩缩 │
└────────┬────────┘ └──────────┬──────────┘ └───────┬────────┘
│ │ │
│ 双端任务实时同步 │ 任务状态回流 │
└──────────────┬───────────┘ │
│ │
▼ │
┌───────────────────────────┐ │
│ 任务同步与调度中枢 │◄──────────────────────┘
│ (Task Sync & Scheduler) │
└─────────────┬─────────────┘
│
▼
┌───────────────────────────┐
│ LongCat 模型推理服务 │
│ (LongCat-Flash / 2.0) │
└───────────────────────────┘
关键设计要点:
- 云端不依赖设备在线:长程任务与定时任务在云端持续运转,即使本地设备关机或断网也不受影响,完成后随时打开手机或电脑查看成果。
- 双端能力互补:移动端侧重"发起 + 确认 + 接收",PC 端侧重"本地深度执行"(文件操作、浏览器控制、终端命令)。
- 典型工作流:地铁上手机发起任务 → 云端持续运行 → 到办公室电脑查看结果,任务在中间无需人为接续。
2.2 Ask / Agent 双模式
CatPaw IDE 的核心交互范式是 Ask / Agent 双模式,覆盖从轻量问答到全自动开发的全场景。两种模式的本质区别在于"执行权"的归属。
| 维度 | Ask 模式 | Agent 模式 |
|---|---|---|
| 行为 | 只读问答,需手动 Apply 修改 | 自主执行:读/改文件、运行命令、查文档、调 API |
| 执行权 | 用户持有(模型仅建议) | 模型持有(在授权范围内自主操作) |
| 安全性 | 高(无副作用) | 中(高危操作需确认) |
| 文件修改 | 不直接写盘,输出建议 | 直接读写文件系统 |
| 命令执行 | 不执行 | 可执行终端命令(支持 auto-run 开关) |
| 典型场景 | 代码解读、Bug 定位、方案咨询 | 新建工程、全栈开发、自动化测试 |
| 底层数据流 | 单轮请求-响应 | 多轮 ReAct 循环 + 工具调用 |
设计哲学:Ask 模式保证"绝对安全",适合需要人工把关的场景;Agent 模式追求"端到端交付",适合目标明确、可自动化的任务。开发者可在 Agent → Add Mode 中按"最小权限原则"勾选工具集,自定义 Agent 的能力边界。
2.3 多 Agent 自主协同架构
面对跨领域的复杂任务,CatPaw 采用动态任务拆解 + 多 Agent 并发调度的协同架构。这是从单 Agent ReAct 循环向多 Agent 编排的关键升级。
┌──────────────────────────────────────────────────────────────────────┐
│ 多 Agent 自主协同架构 │
└──────────────────────────────────────────────────────────────────────┘
┌──────────────────┐
│ 用户目标输入 │
│ "帮我做 X + Y" │
└────────┬─────────┘
│
▼
┌──────────────────────────┐
│ Planner 规划器 │
│ · 动态任务拆解 │
│ · 依赖关系分析 │
│ · 并发度评估 │
└────────────┬─────────────┘
│
┌──────────────────┼──────────────────┐
│ │ │
▼ ▼ ▼
┌────────────────┐ ┌────────────────┐ ┌────────────────┐
│ Agent-A │ │ Agent-B │ │ Agent-C │
│ 独立沙箱环境 │ │ 独立沙箱环境 │ │ 独立沙箱环境 │
│ 专属工具集 │ │ 专属工具集 │ │ 专属工具集 │
│ 进度实时上报 │ │ 进度实时上报 │ │ 进度实时上报 │
└────────┬───────┘ └────────┬───────┘ └────────┬───────┘
│ │ │
└──────────────────┼──────────────────┘
│
▼
┌──────────────────────────┐
│ 结果自动汇总聚合器 │
│ · 交付 Excel/报告/代码 │
└──────────────────────────┘
协同机制的核心特征:
- 独立环境隔离:各 Agent 在独立沙箱中运行,互不干扰,避免文件竞争与状态污染;
- 进度实时可见:每个 Agent 的执行步骤实时上报,用户可随时查看;
- 结果自动汇总:子任务完成后由聚合器统一交付可用成果(Excel、可视化报告、代码等);
- 并发调度:无依赖关系的子任务并发执行,缩短整体完成时间。
三、LLM 后端:LongCat 模型家族
CatPaw 的模型底座是美团自研的 LongCat 模型家族,其中两个关键成员分别服务不同场景。
3.1 LongCat-Flash(IDE 编程模型)
LongCat-Flash 是 CatPaw IDE 的核心驱动模型,定位为"编程特训、低延迟、高吞吐":
- 训练数据:20T+ tokens,其中包含大量编程语料专项强化;
- 优化方向:代码补全延迟 < 150ms,侧重单 Token 生成吞吐与工具调用稳定性;
- 应用层:IDE 中的代码补全、Ask/Agent 默认模型、@Docs 知识问答。
3.2 LongCat 2.0(平台核心模型)
LongCat 2.0 是 CatPaw 全场景 Agent 平台的核心推理引擎,于 2026 年 6 月 30 日发布技术方案,7 月 5 日完成全量 MIT 开源。其核心参数如下:
| 指标 | 参数详情 |
|---|---|
| 模型总参数量 | 1.6T(1.6 万亿)MoE 架构 |
| 单 Token 激活参数 | 约 48B(动态范围 33B ~ 56B) |
| 原生上下文窗口 | 1M tokens(100 万) |
| 预训练数据规模 | 30T+ tokens(官方技术博客口径 35T+) |
| 训练算力 | 5 万张国产 AI ASIC 卡(业界首个全流程国产算力训练的万亿参数模型) |
| 开源协议 | MIT(商用无限制,完整权重 + 推理源码) |
| 训练稳定性 | 全程无回滚、无不可逆 loss spike |
国产算力关键意义:LongCat 2.0 的预训练与大规模部署完全建立在 AI ASIC superpods 之上,预训练跨越数百万加速器日,证明在非 Nvidia 生态上也可完成前沿规模训练。
3.3 LongCat 2.0 三大核心技术
LongCat 2.0 并非简单堆参数,其架构设计包含三个正交的核心创新。
① LongCat Sparse Attention(LSA)稀疏注意力
传统 Transformer 自注意力复杂度为 O(n²),序列长度翻倍则计算量翻四倍,对 1M 上下文窗口完全不可行。LSA 是 DeepSeek Sparse Attention(DSA)的演进版,针对 DSA 中 Lightning Indexer 的"输出不连续"与"二次打分开销"两个瓶颈,引入三层正交优化:
┌──────────────────────────────────────────────────────────────────────┐
│ LongCat Sparse Attention (LSA) 三层正交索引架构 │
└──────────────────────────────────────────────────────────────────────┘
输入序列 (1M tokens)
│
▼
┌──────────────────────────────────────────────────────────┐
│ ① SI 流式索引 (Streaming-aware Indexing) │
│ · 将 Token 选取预算做硬件对齐重排 │
│ · 碎片化内存读取 → 连续有序访问 (coalesced HBM access) │
│ · 释放高有效带宽,降低长文本 IO 开销 │
└──────────────────────┬───────────────────────────────────┘
│
▼
┌──────────────────────────────────────────────────────────┐
│ ② CLI 跨层索引 (Cross-Layer Indexing) │
│ · 利用相邻层注意力显著度的经验稳定性 │
│ · 单次索引结果复用至多层计算 (amortize indexing cost) │
│ · 训练期跨层蒸馏 (cross-layer distillation) 保证一致性 │
│ · 推理期:每 2 个连续层共享 1 次索引 (target model) │
└──────────────────────┬───────────────────────────────────┘
│
▼
┌──────────────────────────────────────────────────────────┐
│ ③ HI 分层索引 (Hierarchical Indexing) │
│ · 两阶段粗到细打分 (coarse-to-fine) │
│ · 第一阶段:块级近似打分粗召回 (block-level) │
│ · 第二阶段:候选集内精细 Token 选取 (fine-grained) │
│ · 训练免 (training-free),仅超长上下文任务启用 │
└──────────────────────┬───────────────────────────────────┘
│
▼
稀疏注意力计算 (线性级复杂度)
O(n²) ──────► O(n)
三层正交性的工程价值:SI、CLI、HI 三者可独立启用/禁用。这种正交设计意味着不同部署环境(显存受限 vs. 算力受限 vs. 极长上下文)可灵活组合,而非"一刀切"。LSA 还延伸到 3-step Multi-Token Prediction(MTP)模块以加速投机解码——在 MTP 中所有 3 个 draft step 共享 step 1 生成的索引集。
② N-gram Embedding 多粒度嵌入层
LongCat 2.0 继承自 LongCat-Flash-Lite 的 N-gram Embedding 技术,内置 135B 专用嵌入参数,n-gram size 配置为 5。其设计遵循两条缩放原则:
- MoE 稀疏性已跨过甜点:即便不考虑 N-gram Embedding,模型稀疏度已达约 97%,此时再为专家扩展 135B 参数收益微乎其微;同等参数规模的 N-gram Embedding 收益远超标准专家。
- 比例约束在最优区间:缩放实验表明,当 n-gram embedding 参数占比超过总预算 50% 时,其相对专家扩展的优势消失。LongCat 2.0 将该比例严格控制在 10% 以内。
工程收益:将参数从专家迁移到 N-gram Embedding,可减少大 batch 解码时的内存 I/O,加速生成。
③ MOPD + Zero-Compute Experts 动态专家路由
LongCat 2.0 在后训练阶段引入多教师学习与专用专家组设计,采用 MOPD(Multi-Operation-Pooling-Decoder)架构整合三类专家能力,配合 Zero-Compute Experts 休眠机制实现动态激活。
| 专家类型 | 专攻能力 | 训练优化重点 |
|---|---|---|
| Agent Experts | 复杂真实场景的自主任务执行(代码、工作、检索等垂直领域 SOTA) | 端到端任务成功率 + 原子能力(精确工具调用、多轮 API 参数解析、自我纠错抑制无限循环/重复调用) |
| Reasoning Experts | 深度逻辑推理、按问题难度自适应计算 | 数学、STEM 求解、多跳推理任务 |
| Interaction Experts | 人类对齐与用户体验优化 | 细粒度指令遵循、抑制事实幻觉、建立有界安全机制且不损害有用性 |
Zero-Compute Experts(零计算专家)休眠机制:闲置专家进入休眠状态,单次推理仅动态激活 33B ~ 56B 参数,无冗余算力消耗。这是 1.6T 总参数却只需 ~48B 激活算力的关键——既保留能力上限,又控制推理成本。
四、Managed Agents 企业级架构
CatPaw Managed Agents 是企业级 AI Agent 开发与托管平台,提供开箱即用的工程底座。其核心价值是"无需从零搭建底层基建,即可快速构建、部署与管理专属 Agent"。该平台由四大支柱构成。
4.1 四大支柱
① 数字员工系统
数字员工是运行在飞书、企微等 IM 中的 AI 虚拟同事,@ 即可唤醒。其工程特征:
- 扫码即用:平台预置多种角色模板,扫码即激活;
- 行业模板:美团本地生活积累沉淀为专属模板,非通用聊天机器人,而是理解业务的行业 AI 助手;
- 对话生成:通过 AI 对话描述需求,快速生成专属数字员工;
- 全自动部署:从 Agent 创建到环境部署、会话初始化全程自动完成,无需手动配置;
- 在线管理:提示词、知识库、凭证、工具均支持在线管理,团队按业务场景灵活搭建。
② 企业级安全架构
安全是企业落地的硬门槛,CatPaw 的安全设计覆盖四个层面:
| 安全维度 | 实现机制 |
|---|---|
| 运行环境隔离 | Agent 运行环境严格隔离,租户间数据互不可见 |
| 凭证集中托管 | 凭证集中托管,确保 Agent 全程零接触敏感资产 |
| 分级权限管控 | 支持分级权限管控,满足企业最小权限原则 |
| 私有化部署 | 支持私有化部署,全面满足合规与安全审计要求 |
"凭证零接触"是关键设计:Agent 调用外部 API 时,凭证由平台集中注入,Agent 代码本身不持有任何密钥,从架构上杜绝凭证泄露风险。
③ Agent 托管运行
托管运行层解决"持续在线 + 成本可控"的矛盾:
- 按需配置运行环境:一键托管上线;
- 资源动态扩缩:根据负载弹性伸缩;
- 百毫秒级冷启动:沙箱环境轻量隔离,冷启动延迟控制在百毫秒级;
- 闲时自动释放:空闲资源自动回收,兼顾响应速度与成本。
百毫秒级冷启动的实现依赖于轻量沙箱与预热池技术,这是支撑"@ 即唤醒"体验的工程基础。
④ 可视化运维
┌──────────────────────────────────────────────────────────┐
│ 统一运维管理界面 │
├──────────────────────────────────────────────────────────┤
│ ┌────────────────┐ ┌────────────────┐ │
│ │ 会话记录留存 │ │ 在线调试 │ │
│ │ 完整可追溯 │ │ 实时排查问题 │ │
│ └────────────────┘ └────────────────┘ │
│ ┌────────────────┐ ┌────────────────┐ │
│ │ 模型调用量统计 │ │ 消耗明细 │ │
│ │ 清晰可见 │ │ 成本可查 │ │
│ └────────────────┘ └────────────────┘ │
└──────────────────────────────────────────────────────────┘
多维度数据统计与分析帮助团队持续评估 Agent 表现、优化运行效果,形成"运行 → 观测 → 优化"的闭环。
五、多场景任务处理机制
5.1 专家 + 技能两层架构
CatPaw 的能力组织采用专家(Expert)+ 技能(Skill)两层架构:
- 专家:集成多项技能与子代理,高效完成特定领域的复杂任务。从专家广场一键安装即可使用,也可通过对话将个人工作方式封装为专属专家,团队共享复用。
- 技能:平台内置丰富技能库,开箱即用,是构成专家能力的原子单元。
┌──────────────────────────────────────────────────┐
│ 专家 (Expert) │
│ ┌──────────┐ ┌──────────┐ ┌──────────┐ │
│ │ 技能 A │ │ 技能 B │ │ 子代理 C │ │
│ └──────────┘ └──────────┘ └──────────┘ │
└──────────────────────────────────────────────────┘
▲ ▲
│ 一键安装 │ 对话封装
│ │
专家广场 个人工作流
5.2 操作录制 → 技能沉淀(核心差异化能力)
这是 CatPaw 最具差异化的能力之一。内嵌浏览器支持操作过程一键录制,将日常高频流程自动生成专属技能:
用户在浏览器中手动操作流程
│
▼
┌──────────────────────────┐
│ 操作录制器 (Recorder) │
│ · 捕获点击/输入/导航 │
│ · 记录页面状态变化 │
└────────────┬─────────────┘
│
▼
┌──────────────────────────┐
│ 技能生成器 │
│ · 操作序列 → 可执行技能 │
│ · 参数化与泛化 │
└────────────┬─────────────┘
│
▼
┌──────────────────────────┐
│ 专属技能库 │
│ · 个人复用 │
│ · 团队共享 │
│ · 数字化资产沉淀 │
└──────────────────────────┘
价值:个人与团队的隐性经验("我知道怎么操作但不一定能讲清楚")被沉淀为可复用的显性数字化资产,这是普通 Agent 框架难以做到的"经验工程化"。
5.3 跨会话长期记忆
CatPaw 支持跨会话长期记忆,自动记忆用户的个性化偏好、操作习惯与历史上下文,跨设备、跨对话保持连续理解。这与三端协同架构配合——记忆存储在云端,移动端与 PC 端共享同一份记忆,实现"越用越懂你"。
5.4 本地生活行业专家技能包
依托美团十余年本地生活深耕,CatPaw 将行业认知封装为即装即用的专家与技能,覆盖四大场景域:
| 场景域 | 典型能力 |
|---|---|
| 门店经营 | 门店评价诊断与优化、门店装修 |
| 商品 | 商品文案生成 |
| 营销 | 营销物料设计评估、活动策划 |
| 经营分析 | 经营数据分析、销售/团购核销/评价/库存信息汇总、异常识别 |
以服务零售为例,美团商家运营专家整合经营数据分析、评价管理、门店装修等核心场景,帮助商家实现智能化运营。这些技能包覆盖外卖、服务零售、医药健康等多个行业。
5.5 规划策略与任务编排
面对长程创作类任务,CatPaw 的多 Agent 编排能力体现为"规划 → 并行执行 → 评估回流"的闭环。以 AI 小说工厂为例,其编排链路如下:
┌──────────────────────────────────────────────────────────────┐
│ AI 小说工厂 任务编排链路 │
└──────────────────────────────────────────────────────────────┘
┌─────────────────────┐
│ ① 世界观构建 │
│ · 设定/人物/规则 │
└──────────┬──────────┘
│ 世界观作为共享上下文
▼
┌─────────────────────────────────────────┐
│ ② 并行章节生成 (多 Agent 并发) │
│ ┌────────┐ ┌────────┐ ┌────────┐ │
│ │ 章节 1 │ │ 章节 2 │ │ 章节 N │ │
│ └───┬────┘ └───┬────┘ └───┬────┘ │
└──────┼──────────┼──────────┼───────────┘
│ │ │
▼ ▼ ▼
┌─────────────────────────────────────────┐
│ ③ 质量评估 │
│ · 一致性检查 / 文学性打分 │
└────────────────────┬────────────────────┘
│ 不达标章节
▼
┌─────────────────┐
│ ④ 回流修订 │
│ · 针对性重写 │
└─────────────────┘
这种编排模式的核心在于:世界观作为全局共享上下文注入每个章节 Agent,保证一致性;质量评估环节形成反馈回路,不达标章节回流修订,而非简单的一次性生成。
六、技术栈与工具链
6.1 IDE 内置 11 类原生工具
Agent 模式的执行能力建立在完整的工具链闭环之上,CatPaw IDE 当前内置 11 类原生工具:
文件类:readFile / writeFile / createDir
代码类:grep / searchSymbol / findReferences
终端类:runCommand(支持 auto-run 开关)
网络类:fetchURL / searchWeb
测试类:runTests / debug
工具集遵循"最小权限原则":开发者可按需勾选所需工具集,避免 Agent 拥有不必要的能力。runCommand 的 auto-run 开关允许控制命令是否自动执行,平衡效率与安全。
6.2 MCP 协议扩展
CatPaw 支持 MCP(Model Context Protocol)扩展,突破内置工具的边界。典型场景:接入 Chrome DevTools MCP,可实现"开发 → 启动 → 自动测试"无缝衔接——Agent 修改代码后自动打开浏览器、截图验证、回归测试,形成自动化闭环。
6.3 @Docs 知识索引系统(RAG 能力)
CatPaw 复刻并优化了 Cursor 标志性的 @Docs 功能,让 AI 学习私有文档:
- 进入
Settings → Indexing & Docs; - 添加 URL 或本地文档(支持 Markdown / PDF);
- 等待
indexed状态生效; - 对话中
@doc_name即可引用知识。
实测:同时索引 CatPaw 官方文档与 Cursor Docs,Agent 可精准对比二者在 Agent 能力上的异同,输出结构化 Markdown 表格。
6.4 代码库索引能力
CatPaw 的代码库索引速度是其工程优势之一:
| 代码库规模 | 索引耗时 |
|---|---|
| 500 行 | 约 5 秒 |
| 12000 行 | 约 45 秒 |
快速的代码库索引使得 Agent 在大型项目中的上下文理解延迟可控,支撑仓库级别的代码编辑与跨文件重构。
6.5 自定义 Agent 配置模式
在 Agent → Add Mode 中可创建个性化 Agent,配置项包括:
- 指定模型(LongCat-Flash / GLM-4.6 / Qwen2.5-Coder);
- 勾选所需工具集(最小权限原则);
- 编写角色化 Prompt(如"你是资深 React 性能工程师");
- 开启
auto-fix(自动修 Linter)或auto-run(自动执行终端命令)。
此外,CatPaw 支持将固定内容配置为 System Prompt,在每次侧边栏对话与 Inline 对话开始时自动发送给模型,确保团队代码规范的一致性。
七、LongCat 2.0 私有化部署实战
LongCat 2.0 采用 MIT 协议完整开放权重与推理代码,支持企业私有化部署。以下为基于 SGLang 的完整部署流程。
7.1 硬件与环境前置要求
- 硬件推荐:16 张 H20 GPU(官方标准部署环境);
- Python 版本:3.10 及以上;
- 依赖库:sglang、torch、transformers;
- GPU 架构适配:H100/H200(SM90A)需单独编译专用内核;
- 无多卡集群替代方案:官方在线 Demo、OpenRouter API、国产 NPU 集群部署。
7.2 部署步骤
步骤 1:环境依赖安装
# 校验 Python 版本
python3 --version
# 安装基础推理依赖
pip3 install sglang torch transformers
步骤 2:拉取官方开源仓库
git clone https://github.com/meituan-longcat/LongCat-2.0.git
cd LongCat-2.0
步骤 3:编译 SM90A 架构专用 SGLang 内核
H20/H100 显卡必须编译定制内核以适配 LSA 稀疏注意力算子:
cd sgl-kernel
python3 -m uv build --wheel --color=always --no-build-isolation \
-Ccmake.define.SGL_KERNEL_ENABLE_SM90A=1 \
-Ccmake.define.CMAKE_POLICY_VERSION_MINIMUM=3.5 \
-Cbuild-dir=build .
# 强制安装编译完成的内核包
pip3 install dist/sgl_kernel-0.3.21-cp310-abi3-linux_x86_64.whl --force-reinstall
步骤 4:启动分布式推理服务
采用张量并行(TP)+ 专家并行(EP)组合部署,开放局域网访问,端口 13423:
python -m sglang.launch_server \
--model meituan-longcat/LongCat-2.0-FP8 \
--trust-remote-code \
--host 0.0.0.0 \
--port 13423 \
--tp 16 \
--ep 16 \
--mem-fraction-static 0.9
步骤 5:OpenAI 兼容 API 调用示例
服务启动后可通过标准 OpenAI SDK 调用:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:13423/v1",
api_key="not-needed"
)
response = client.chat.completions.create(
model="meituan-longcat/LongCat-2.0-FP8",
messages=[
{"role": "system", "content": "你是专业 AI 开发助手"},
{"role": "user", "content": "编写 Python 脚本,批量将当前目录 jpg 文件按创建日期重命名"}
],
temperature=0.7,
max_tokens=2048
)
print(response.choices[0].message.content)
7.3 部署关键注意事项
| 注意事项 | 说明 |
|---|---|
--trust-remote-code 必填 |
模型内置自定义 LSA 注意力算子,必须信任远程代码 |
| HI 模块暂不支持 | 当前版本暂不支持简化分层索引(HI)模块,仅完整集群部署生效 |
| 显存占用参数 | --mem-fraction-static 建议 0.8 ~ 0.9,预留内存防止 OOM |
| 单机不可用 | 激活参数 48B,消费级单卡 GPU 无法稳定运行 |
八、性能 Benchmark 对比
8.1 内部落地指标
| 指标 | 数据 |
|---|---|
| 员工覆盖 | 9 万 |
| 累计 Agent | 3 万+ |
| 研发渗透率 | > 95% |
| 增量代码 AI 生成率 | > 50% |
| 代码补全延迟 | < 150ms |
8.2 IDE 实测性能
| 测试项 | 数据 |
|---|---|
| 500 行代码库索引 | 约 5 秒 |
| 12000 行代码库索引 | 约 45 秒 |
| 代码补全延迟 | < 150ms |
| 公测免费额度 | 500 次高阶额度 |
8.3 LongCat 2.0 vs 闭源旗舰模型对比
以下为代码、Agent 检索交互、基础通用能力三大赛道对比(带 * 为厂商官方公开数据):
代码能力评测
| 评测基准 | LongCat-2.0 | GPT-5.5 | Claude Opus 4.8 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-bench Pro | 59.5 | 58.6* | 69.2* | 54.2* |
| SWE-bench Multilingual | 77.3 | - | 84.8* | 76.9* |
| Terminal-Bench | 70.8 | 73.8* | 78.9* | 70.7* |
Agent 检索交互能力
| 评测基准 | LongCat-2.0 | GPT-5.5 | Claude Opus 4.8 | Gemini 3.1 Pro |
|---|---|---|---|---|
| FORTE | 73.2 | 77.8 | 77.2 | 70.3 |
| RWSearch 长文本检索 | 78.8 | 85.3 | 77.3 | 76.3 |
| BrowseComp 网页解析 | 79.9 | 84.4* | 84.3* | 85.9* |
基础通用能力
| 评测基准 | LongCat-2.0 | GPT-5.5 | Claude Opus 4.8 | Gemini 3.1 Pro |
|---|---|---|---|---|
| IFEval 指令遵循 | 90.0 | 95.0 | 86.0 | 96.1 |
| Writing Bench 文本创作 | 83.8 | 84.7 | 85.2 | 83.7 |
| GPQA-diamond 专业推理 | 88.9 | 93.6* | 92.4 | 94.3* |
关键结论:
- 代码领域:SWE-bench Pro 得分 59.5,超越 GPT-5.5 官方 58.6,多语言代码理解优势突出;
- 长文本/网页:检索与浏览任务表现均衡,适配 RAG 与网页智能体;
- OpenRouter 全球调用量:LongCat 2.0 进入全球调用量前三;
- 数理推理:GPQA-diamond 略低于头部闭源模型,是当前主要短板。
8.4 与主流开源/闭源大模型横向对比
| 对比维度 | LongCat-2.0 | DeepSeek-V3.2 | Llama 4 Maverick | GPT-5.5 |
|---|---|---|---|---|
| 总参数量 | 1.6T MoE | 671B | 约 400B | 未公开 |
| 单 Token 激活参数 | ~48B | 37B | 未公开 | 未公开 |
| 最大上下文 | 1M tokens | 128K | 128K | 128K+ |
| 开源协议 | MIT 商用免费 | ML 协议 | Llama 商用限制 | 闭源仅 API |
| SWE-bench Pro | 59.5 | 未公开 | 未公开 | 58.6 |
| 部署门槛 | 需 16×H20 集群 | 高算力集群 | 多卡 GPU | 仅云端调用 |
九、与其他 Agent 框架对比
9.1 CatPaw vs Cursor / Copilot
| 维度 | CatPaw | Cursor | GitHub Copilot |
|---|---|---|---|
| 产品形态 | AI IDE + 全场景 Agent 平台 | AI IDE | 编辑器插件 + Chat |
| 核心模型 | LongCat-Flash / 2.0(自研开源) | Claude / GPT(闭源) | GPT 系列(闭源) |
| 三端协同 | 移动/PC/云端 7×24 | PC 为主 | 编辑器内 |
| 云端常驻 | 支持(设备离线不断) | 不支持 | 不支持 |
| 操作录制→技能 | 支持(核心差异化) | 不支持 | 不支持 |
| 行业专家技能包 | 本地生活全链路 | 无 | 无 |
| 企业级托管 | Managed Agents | 无 | Copilot Workspace(有限) |
| 私有化部署 | 支持(MIT 模型) | 不支持 | 不支持 |
| 中文优化 | 原生中文 | 弱 | 一般 |
9.2 美团 vs OpenAI vs 阶跃星辰路线对比
| 维度 | 美团(CatPaw + LongCat) | OpenAI(GPT + Operator) | 阶跃星辰 |
|---|---|---|---|
| 模型策略 | 自研开源(MIT)+ 国产算力 | 闭源旗舰 | 自研多模态 |
| 平台定位 | 全场景 Agent + 企业托管 | 通用 API + Operator Agent | 多模态 Agent |
| 行业纵深 | 本地生活 Know-how 护城河 | 通用 | 通用偏多模态 |
| 开源开放 | 模型 + 平台双开放 | 闭源 | 部分开源 |
| 落地验证 | 9 万员工内部大规模验证 | 全球开发者 | 垂直场景 |
9.3 CatPaw vs Coze / Dify / LangChain
| 维度 | CatPaw | Coze(字节) | Dify | LangChain |
|---|---|---|---|---|
| 类型 | 模型+平台+行业知识一体化 | Agent 搭建平台 | LLM 应用开发平台 | Agent 编排框架 |
| 自研模型 | LongCat 2.0(1.6T MIT) | 依赖第三方 | 依赖第三方 | 依赖第三方 |
| 企业托管 | Managed Agents 全栈 | 有 | 有 | 无(框架级) |
| 端形态 | 移动/PC/云端三端 | 多端 | Web/API | 代码库 |
| 行业技能包 | 本地生活深度封装 | 通用 | 通用 | 通用 |
| 操作录制 | 支持 | 不支持 | 不支持 | 不支持 |
| 代码能力 | SWE-bench Pro 59.5 | 依赖模型 | 依赖模型 | 依赖模型 |
核心差异:CatPaw 是少数"模型 + 平台 + 行业知识"三位一体的方案,而 Coze/Dify/LangChain 本身不产模型,需对接第三方 LLM。
十、核心差异化与局限
10.1 核心差异化
CatPaw 的护城河可归纳为"模型 + 平台 + 行业知识"三位一体:
- 模型层:LongCat 2.0 是开源市场唯一同时满足"1.6T MoE + 原生 1M 上下文 + MIT 完全商用开源"三大特性的模型,且全程国产算力训练;
- 平台层:Managed Agents 提供从数字员工到可视化运维的企业级全栈托管,三端协同 + 操作录制沉淀是工程差异化;
- 行业知识层:美团十余年本地生活积累封装为专家与技能包,这是纯技术公司难以复制的 Know-how 护城河。
三者形成正反馈:行业知识反哺模型微调方向,平台工程支撑模型能力落地,模型开源降低企业选型门槛。
10.2 局限性
客观来看,CatPaw / LongCat 2.0 当前仍存在以下局限:
| 局限维度 | 具体表现 | 影响场景 |
|---|---|---|
| 部署门槛 | 需 16×H20 GPU 集群,消费级单卡不可用 | 中小团队私有化部署困难 |
| 数理推理 | GPQA-diamond 88.9,低于 GPT-5.5(93.6)、Gemini(94.3) | 顶尖数学竞赛、高难度 STEM 求解 |
| 自定义 endpoint | IDE 暂不支持完全自定义 endpoint | 需接入私有模型服务的场景受限 |
| HI 模块 | 暂不支持简化分层索引 HI 模块,仅完整集群部署生效 | 轻量化部署无法用满 LSA 全部优化 |
| 闭源差距 | Terminal-Bench、BrowseComp 等仍落后 Claude Opus 4.8 | 极致代码/浏览 Agent 任务 |
10.3 适用边界建议
基于上述分析,LongCat 2.0 的最优落地场景与不推荐场景如下:
最优落地场景:
- 代码智能 Agent(自动化 Bug 修复、代码评审、多语言工程脚本);
- 百万级长文档分析(整本图书、大型项目文档、合同卷宗一次性解析);
- 检索增强 RAG + 网页智能体(知识库问答、联网调研);
- 多语言开发工具。
不推荐场景:
- 轻量化单机对话产品(激活参数 48B,单卡无法稳定运行);
- 顶尖数学竞赛解题(数理推理低于头部闭源模型)。
结语
CatPaw 的技术价值不在于某一个单点突破,而在于它打通了"自研万亿参数开源模型 → 国产算力全流程训练 → 全场景 Agent 平台 → 企业级托管 → 行业 Know-how 沉淀"的完整链路。从工程视角看,三层正交的 LSA 稀疏注意力、MOPD 动态专家路由、三端协同架构、操作录制技能沉淀,每一个都是可独立分析的工程课题;而从产业视角看,"模型 + 平台 + 行业知识"三位一体才是其真正的差异化所在——行业 Know-how 是最难复制的那一层护城河。
对于有私有化部署、自建代码智能体、长文档分析平台需求的企业开发者,LongCat 2.0 是现阶段值得优先评估的开源选型;对于关注 Agent 平台工程实践的开发者,CatPaw 的 Managed Agents 架构与技能沉淀机制提供了有价值的参考范式。
参考资料
- 美团技术团队:《美团 LongCat-2.0 正式发布》https://tech.meituan.com/2026/06/30/LongCat2.0.html
- LongCat 官方博客:https://longcat.chat/blog/longcat-2.0/
- 美团技术团队:《美团正式发布 CatPaw:全场景 AI Agent》https://tech.meituan.com/2026/07/28/CatPaw-LongCat.html
- LongCat-2.0 GitHub 仓库:https://github.com/meituan-longcat/LongCat-2.0
- CatPaw 体验地址:https://catpaw.meituan.com/
本文基于公开资料整理,技术细节以美团官方文档与开源代码为准。
浙公网安备 33010602011771号