一、架构概览:模型 + Agent + 工具生态的三层协同

腾讯在 2026 年 7 月正式发布混元 Hy3 模型,与桌面 AI 智能体 WorkBuddy 深度适配,形成了一套完整的国产 Agent 方案。其架构不是简单的"大模型 + 套壳",而是模型与产品 Co-design(协同设计) 的结果。[1][2]

┌─────────────────────────────────────────────────────┐
│                 工具生态层                            │
│  腾讯文档 │ 企业微信 │ 腾讯会议 │ ima │ PPT/HTML交付  │
└─────────────────────────┬───────────────────────────┘
                          │ Agent 可调用
┌─────────────────────────▼───────────────────────────┐
│              WorkBuddy Agent 层                      │
│  ┌──────────┐ ┌──────────┐ ┌───────────────────┐    │
│  │ 任务拆解  │ │ 工具调度  │ │ 长程状态管理(500步)│    │
│  └──────────┘ └──────────┘ └───────────────────┘    │
│  双核架构:主桌面端 + Claw 远程插件                    │
└─────────────────────────┬───────────────────────────┘
                          │
┌─────────────────────────▼───────────────────────────┐
│              混元 Hy3 模型层                          │
│  MoE · 295B 总参 · 21B 激活 · 256K 上下文             │
│  192 路由专家 · Top-8 激活 · 1 共享专家               │
│  快慢思考三档:no_think / low / high                 │
└─────────────────────────────────────────────────────┘

二、Hy3 模型技术拆解

2.1 MoE 架构关键参数

参数 工程意义
总参数量 295B 知识容量大,推理时只激活部分
激活参数量 21B 单次推理的计算量仅相当于 21B 模型
路由专家数 192 覆盖广泛的任务类型和领域知识
每次激活 Top-8 + 1 共享专家 推理效率极高
上下文窗口 256K(约 20 万字中文) 支持长文档、长程任务
推理档位 no_think / low / high 按任务复杂度动态分配算力

MoE 的核心优势:295B 的知识容量 + 21B 的推理成本。这意味着 Hy3 在回答复杂问题时可以调动更多专家知识,但计算开销远小于同等参数量的稠密模型。[3]

2.2 快慢思考融合

Hy3 支持推理力度分档,这是与 Claude 的 extended thinking 类似但更灵活的设计:

  • no_think:直接回答,适用于简单问答、格式转换等无需深度推理的任务
  • low:轻度思考,适用于常规编码、信息提取
  • high:深度思考,适用于复杂推理、多步规划、数学推导

WorkBuddy 会根据任务复杂度自动选择档位,也可以由用户手动指定。实测中,深度推理在错排问题等数学场景下表现出色。

2.3 核心升级方向

根据腾讯官方数据,Hy3 正式版相比预览版在关键指标上有显著提升:

指标 预览版 正式版 提升幅度
幻觉率 12.5% 5.4% -57%
任务解决率 72% 90% +25%
耗时 基准 基准 × 0.66 -34%
Token 效率(文档) 基准 基准 × 0.53 -47.4%
Token 效率(PPT) 基准 基准 × 0.51 -49.0%

三、WorkBuddy Agent 能力对比

3.1 与同类产品架构对比

维度 WorkBuddy + Hy3 Claude Code + Claude Cursor + GPT-5.5
部署形态 桌面客户端 + 远程插件 CLI 工具 VS Code 插件
模型 混元 Hy3(可切换) Claude 系列 GPT 系列
工具调用 浏览器、文件、文档、PPT、Excel、代码 Shell、文件、浏览器 文件、终端、浏览器
长程执行 支持近 500 步工作流 依赖上下文窗口 依赖上下文窗口
企业集成 腾讯文档/企微/会议原生打通 无原生企业集成 无原生企业集成
上下文管理 自动压缩 + 状态保持 自动压缩 手动管理
价格 Hy3 免费试用两周,后续按量 按订阅/按量 按订阅/按量

3.2 五维能力实测评估

根据公开测评,WorkBuddy + Hy3 在以下五个维度表现突出:[1]

1. 前端规划能力 — 给定 Neo-Brutalism 风格的高约束密度提示词(4 个指定色值、像素级描边/阴影参数、hover 交互规格、SVG 内联要求),能一次性统一规划并生成完整的单页网站。

2. 工具使用能力 — 浏览器导航 + 信息提取精度测试:同时打开 GitHub 仓库、HuggingFace 模型卡、OpenRouter 三个页面,提取并对比信息。能准确识别 OpenRouter 上"Hy3 全量版不存在"这一事实,对冲突信息明确标注出处。

3. 长程执行能力 — 跨 Excel(数据整理)、图表(统计可视化)、PPT(10 页报告)三个工具的四步任务链,全程保持数据一致性。实测中能完成 3 月份 45 篇文章的统计,且 Excel 字数与原文件吻合。

4. 复杂推理能力 — 错排问题的完整推导(容斥原理 → 数学精确解 → Python 蒙特卡洛模拟 100 万次 → Matplotlib 收敛曲线 → 误差对比),五个环节环环相扣。

5. 代码能力 — 与 DeepSeek V4 Pro 非常接近,在前端代码生成场景中表现稳定。

四、实践心得

4.1 什么时候选 WorkBuddy + Hy3

适合的场景

  • 需要长程执行(300+ 步)的复杂办公任务
  • 需要与腾讯生态(文档、企微、会议)深度集成的企业场景
  • 前端代码生成与可视化任务
  • 数据分析 + 报告生成的端到端流水线

不太适合的场景

  • 纯英文场景下的代码生成(Claude Code / Cursor 仍占优)
  • 需要极强多模态理解的任务(GPT-5.6 的视觉能力更强)
  • 开源生态依赖较重的开发工作流

4.2 提示词技巧

基于公开测评用例,可以提炼出几个有效模式:

模式一:约束密度测试

# 有效的约束型提示词特征:
# 1. 给出具体数值(色值 #FFE156、偏移 6px、圆角 16px)
# 2. 说明交互行为(hover 时阴影缩短到 2px)
# 3. 指定技术限制(纯 HTML/CSS/JS 单文件,不引入外部库)
# 4. 要求特定技术实现(SVG 内联、噪点纹理)

模式二:多源交叉验证

# 要求 Agent 对比多个信息源,并标注冲突
# 关键句式:"如果三个来源的数据对不上,单独列出冲突项并标明出处。
#           不确定的信息直接写「未找到」,不要猜。"

模式三:自检驱动

# 在长程任务末尾要求自检
# 关键句式:"全部完成后,自查一遍 Excel 里的数据和原文件是否一致,再交给我。"

4.3 上下文压缩的观察

在长程任务中(如 500 步工作流),WorkBuddy 会自动触发上下文压缩。这意味着模型不是无限累积对话历史,而是在关键时刻做摘要和状态固化。实测中压缩后仍能保持关键数据的一致性,说明压缩策略较为智能。

总结:Hy3 + WorkBuddy 的核心竞争力在于"模型与产品协同设计"——Hy3 的快慢三档推理、长上下文、低幻觉率是为 Agent 场景量身定做的能力,WorkBuddy 的桌面端 + 远程插件双核架构、500 步长程执行、腾讯生态原生集成则是承接这些能力的最佳载体。对于国内企业用户的办公 Agent 场景,这套方案目前是第一梯队的选择。

参考来源

  1. 技术派 paicoding.com, Hy3 + WorkBuddy = 国产顶级 Agent(附完整提示词), 2026-07-08 — 原文链接
  2. 界面新闻, Hy3发布后,腾讯的生产力AI走向收敛, 2026-07 — 原文链接
  3. 雪球, WorkBuddy利与弊, 2026-07 — 原文链接
  4. 腾讯云开发者社区, 腾讯云 AI Agent 产品横向测评原文链接