Hermes Agent 全功能详解:40+ 特性从 Core 到 Customization 全梳理

Hermes Agent 全功能详解:40+ 特性从 Core 到 Customization 全梳理

如果只想看官方文档 hermes-agent.nousresearch.com/docs/user-guide/features/overview 里列的所有能力,这篇帮你把它们翻译成"上手用什么、怎么配、哪一层最强"。

不知道从哪里开始,Hermes 官方给过一句话的快速路径:hermes setup --portal 一条命令完成模型 Provider + Tool Gateway 的四大工具(Web 搜索、图像生成、TTS、浏览器)接入。这是最快的"从安装到能用"路径,但离"发挥 Hermes 全部能力"差了至少 30 个开关。

本文按官方文档五大分类(Core 核心 / Automation 自动化 / Media & Web 媒体与网络 / Integrations 集成 / Customization 定制),把 Overview 列出的所有子特性加上对应子页的细节逐一拆开。读完之后你会知道:哪些功能免费内置、哪些要开插件、哪些有字符数限制、哪些有硬编码默认值、MCP 和工具集到底怎么选。

本文提纲

  1. 一图看懂功能全景 + 快速启动命令
  2. Core 核心层:工具 / Skills / 记忆 / 上下文文件 / @引用 / 检查点回滚
  3. Automation 自动化:Cron 调度 / delegate_task 子 Agent / execute_code 代码执行 / Event Hooks / 批处理
  4. Media & Web:语音模式 / 唤醒词 / 浏览器自动化 / 视觉贴图 / 图像生成 / TTS
  5. Integrations 集成:MCP / Provider 路由 / Fallback / 凭证池 / Prompt Cache / 8 家记忆提供方 / API Server / ACP
  6. Customization 定制:SOUL.md 人格 / Skins 皮肤 / 三类插件
  7. 各层能力与同类竞品对照表(vs Claude Code / Codex / Teams Copilot)

1. 一图看懂功能全景 + 快速启动命令

MERMAID_BLOCK_0

快速启动命令速记:

# 最快方案:一条命令完成 Provider + 4 个 Tool Gateway 工具
hermes setup --portal

# 从零开始,不想要任何内置 Skills
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash -s -- --no-skills

# 创建一个不继承 bundled skills 的命名 Profile
hermes profile create research --no-skills

2. Core 核心层:工具 / Skills / 记忆 / 上下文文件 / @引用 / 检查点回滚

2.1 Tools & Toolsets:按平台开关的工具分组

工具(Tools)是扩展 Agent 能力的函数;工具集(Toolsets)是按逻辑分组、可按平台独立启停的一组工具。内置注册表覆盖了非常大的范围:

类别 典型工具名 说明
Web web_searchweb_extract 全网搜索 + 网页正文提取
X(Twitter)Search x_search 通过 xAI 内置的 Responses 工具搜 X 帖子;需 SuperGrok OAuth 或 XAI_API_KEY,默认关闭,hermes tools → X 手动开
终端与文件 terminalprocessread_filepatch 执行命令、进程管理、读写/打补丁文件
浏览器 browser_navigatebrowser_snapshotbrowser_vision 交互式浏览器自动化,含文本 + 视觉双通道
媒体 vision_analyzeimage_generatetext_to_speech 多模态分析、生成、朗读
Agent 编排 todoclarifyexecute_codedelegate_task 规划、澄清、代码执行、子 Agent 委派
记忆与回溯 memorysession_search 持久记忆 + 当前会话搜索
自动化 cronjob 创建/列表/更新/暂停/恢复/立即运行/删除 调度任务
集成 ha_* + MCP Home Assistant 全系函数 + MCP 外部工具

重要提示:Honcho(跨会话记忆)不是内置 Toolset,而是以记忆提供方插件形式存在(plugins/memory/honcho/),需要通过插件管理安装。

2.2 Skills System:按需加载的知识文档 + agentskills.io 开放标准

Skills 是按需加载的知识文档,遵循 Progressive Disclosure(渐进披露)模式来减少 token 占用;格式与 agentskills.io 开放标准兼容。

  • 主目录:所有 Skill 存于 ~/.hermes/skills/——是唯一真源。内置 bundled skills 在安装时复制进来;通过 Hub 安装的和 Agent 自建的都放这里。Agent 可以修改或删除任何 Skill。
  • 外部 Skill 目录:可以通过配置额外指向扫描文件夹,与主目录并行生效。
  • Bundled Skills Catalog + Optional Skills Catalog:官方维护两份目录(随文档链接提供)。
  • 三种"不要内置 skills"的方式
  • 安装时 --no-skills (作用于默认 profile)
  • 创建 profile 时 hermes profile create <name> --no-skills
  • 运行时 hermes skills opt-out [--remove],再反向 hermes skills opt-in --sync
  • 标记文件.no-bundled-skills marker。只要存在,安装器、hermes update、任何 skills sync 都不会再播种 bundled skills。

2.3 Persistent Memory:有字符硬限制、Agent 自行管理的持久记忆

记忆有两个文件,都存在 ~/.hermes/memories/,在会话开始时作为冻结快照注入 system prompt。

文件 用途 字符上限 约 token
MEMORY.md Agent 自己的笔记:环境事实、编码惯例、学到的东西 2,200 字符 ~800 tokens
USER.md 用户画像:偏好、沟通风格、期望 1,375 字符 ~500 tokens

关键点:
- "一个 Hermes 家目录 = 一个 Agent 进程":两个 Agent 进程不要共享 ~/.hermes,会互相写记忆造成双方都没写过的状态。想多 Agent 共享记忆请用 Profile + 外部记忆提供方(Honcho/Mem0 等)。
- 字符超限不自动压缩:Agent 调用 memory 工具写超出限制时,工具直接报错而非默默截断——Agent 会在同一回合内自己压缩/删条目再重试。replace 操作也受上限约束,把一条替换成长的同样会溢出,所以 Agent 必须先缩短或者删另一条。

2.4 Context Files:项目级规则文件,有严格发现优先级

Hermes 会自动发现项目上下文文件并按如下优先级从高到低注入 system prompt:.hermes.md → AGENTS.md 链 → CLAUDE.md → .cursorrules。这意味着如果你想写项目专属规则,最高优先级是写 .hermes.md;已有团队在 AGENTS.md 中的规则会被继承;Claude Code / Cursor 的规则文件也自动适配——不强迫你改一遍。

注意:SOUL.md(人格)不在这个上下文发现链里,它走单独的 personality 机制。

2.5 Context References:@ 引用文件/文件夹/git diff/URL,自动展开

消息中 @ 后面跟引用:文件、文件夹、git diff、URL 都可以直接注入。Hermes 把引用内联展开,自动追加内容到输入。这是目前 AI IDE / Agent CLI 的标准交互范式,Hermes 内置原生支持。

2.6 Checkpoints & Rollback:改文件前自动快照,/rollback 一键回滚

Hermes 在任何文件改动前自动对工作目录做快照。出现意外时 /rollback 回退,是对"Agent 写崩了项目"的终极保险网。命令走的是 /rollback 斜杠命令。

3. Automation 自动化:Cron / 子 Agent / execute_code / Hooks / 批处理

3.1 Scheduled Tasks (Cron):自然语言 + Cron 表达式 + 独立模型 + no-agent 模式

cronjob 工具以 action-style 暴露 create/list/update/pause/resume/run/remove 七种操作。Cron 的能力远不止"定时跑 LLM 对话":

  • 投递系统:结果可以发送回发起聊天、本地文件、或任意已配置平台目标。发送走 cron 自带的 delivery、hermes send CLI 和网关 notifier——不是 Agent-callable tool 发的,所以执行安全边界是独立的。
  • Skills 挂载:一个 cron 任务可以挂 0~N 个 skills,让定时任务有专属知识库。
  • 三层模型解析(执行时才决定用什么模型):
    1. 每个 job 单独 pin(用户拥有,Agent 的 cronjob 工具不能改 pin)→ CLI:hermes cron create/edit --model … --provider … 或直接改 jobs.json
    2. cron.model + cron.model_provider 在 config.yaml 中设 cron 车队默认值
    3. 全局 hermes model 跟随。快照机制:创建时记 provider+model,若之后全局默认变了,job fail closed:跳跑并在日志里记录"默认模型快照不匹配,为避免跑错模型我没跑。"
  • No-agent Mode(只跑脚本):完全不调 LLM。cron 触发一个 shell/python/js 脚本,stdout 原样投递。零 token 费用——这一点在批量监控任务上非常有用。

3.2 Subagent Delegation:delegate_task 默认并发 3,子 Agent 零知识 + 自动注入项目上下文

关键事实一:子 Agent 什么都不知道。只有 goal + context 两个字段给进去,没有任何父对话历史、没有之前 tool call 记录,完全独立。

关键事实二:唯一例外是 workspace 的项目上下文文件链。如果父 Agent 已经解析出一个 workspace 根,子 Agent 的 system prompt 会自动嵌入该 repo 的 .hermes.md → AGENTS.md → CLAUDE.md → .cursorrules(SOUL.md 排除)。所以子 Agent 在同一个仓库里自动按 repo 约定做事,不用重新发现。

两种调用形式:

# 单任务
delegate_task(goal="Debug why tests fail", context="Error: assertion in test_foo.py line 42")

# 并行批量(默认并发 3,可配置,无硬上限)
delegate_task(tasks=[
    {"goal": "Research topic A", "context": "..."},
    {"goal": "Research topic B", "context": "..."},
    {"goal": "Fix the build", "context": "..."},
])

顶层 model 调用自动后台执行。Hermes 立刻返回一个句柄,父对话可以继续聊,完成后再回传结果;编排型子 Agent 会等自己的 workers 全部完成再合成结果。

3.3 Code Execution:execute_code Python 沙箱 RPC

Agent 写 Python 脚本,脚本内部可以通过 RPC 直接调用 Hermes 自身工具。好处是把多步工作流(先工具 A 拿结果、再工具 B 处理、再根据结果 C 决定分支)折叠成一个 LLM 回合——不需要模型每一步重新推理。Sandboxed RPC 执行,安全隔离。

3.4 Event Hooks:关键生命周期注入自定义代码

分为两大类:
- Gateway Hooks(网关钩子):日志、告警、Webhook——处理消息进出通道层面的拦截。
- Plugin Hooks(插件钩子):工具拦截、指标收集、护栏——处理 Agent 决策面的检查。

具体用场景:把所有终端命令的实际执行记录到审计系统里;在发邮件/写工单之前额外做一次合规扫描;在每一次模型调用前后埋入 APM 指标。

3.5 Batch Processing:成百上千 Prompt 并行

从 CLI 把几百上千个 prompt 批量喂给 Hermes Agent 并行跑,产出结构化 ShareGPT 格式的轨迹数据。典型用途:
- 构造自己的 SFT / DPO 训练集(让 Hermes 示范好的行为轨迹)
- 大规模评估(eval):把测试集全部跑一遍,拿到结构化 pass/fail 和 token 成本

4. Media & Web:语音 / 唤醒词 / 浏览器 / 视觉 / 出图 / TTS

4.1 Voice Mode:CLI + 全消息平台 + Discord 语音频道

不是"语音转文字 + 文字转语音"的简单拼接,而是完整的语音交互管道:
- CLI 模式:用麦克风直接跟 Hermes 对话。
- 全消息平台:WhatsApp、飞书、钉钉、LINE、QQ、微信等发语音消息 → Hermes 转录 + 回答 + 语音返回。
- Discord 语音频道:实时跟频道里的人做 live voice 对话。

4.2 Wake Word:本地端侧"Hey Hermes"

On-device 热词监听,所以在等待唤醒时没有任何音频流出设备。CLI、TUI、桌面端三端都支持。多 Profile 路由:不同唤醒词可以直达不同 Profile 的 Agent。

4.3 Browser Automation:多云多后端 + 本地 CDP

四种后端任你选:
- 云:Browserbase、Browser Use
- 本地 CDP:Chrome、Brave、Chromium、Edge
- 本地 Chromium 独立安装

导航、填表、提取信息全部支持,而且配合 browser_vision 工具还能看图理解页面。

4.4 Vision & Image Paste:剪贴板贴图进 CLI

直接从系统剪贴板把图片粘进 CLI,Agent 调视觉模型分析、描述、处理图像内容。配合 Pasteboard,一条命令就能把截图喂给 Agent。

4.5 Image Generation:FAL.ai 提供 11 个模型

生成模型列表(官方列出,全是 FAL.ai 后端):

  1. FLUX.2 Klein
  2. FLUX.2 Pro
  3. GPT-Image 1.5
  4. GPT-Image 2
  5. Nano Banana Pro
  6. Ideogram V3
  7. Recraft V4 Pro
  8. Qwen Image
  9. Z-Image Turbo
  10. Krea V2 Medium
  11. Krea V2 Large

通过 hermes tools 选择当前使用哪一个。

4.6 Voice & TTS:10 家原生 TTS + 自定义命令提供方

TTS 提供商(文本转语音):
- Edge TTS(免费)
- ElevenLabs
- OpenAI TTS
- MiniMax
- Mistral Voxtral
- Google Gemini
- xAI
- NeuTTS
- KittenTTS
- Piper(本地 TTS CLI 热门)

再加一个自定义命令提供方——任何本地 CLI TTS 都可以通过一条 shell 命令包装接入。

STT(语音转文字):所有消息平台上的语音消息都走统一转录管道 + 统一语言解析,防止回来的 transcript 语言错乱;OpenAI GPT-Transcribe 原生支持;还有一个跨所有 TTS 提供方的"统一语音预处理器"负责把 markdown、代码、URL 从要朗读的文本里清洗掉,避免念出三个反引号和 HTTP 协议。

5. Integrations 集成:MCP / Provider 路由 / Fallback / 凭证池 / Cache / 8 家记忆 / API Server / ACP

5.1 MCP:stdio + HTTP 双传输 + 官方 Catalog

MCP 支持是标准安装自带的,不用额外步骤。config.yaml 里的 mcp_servers 对应 Claude Code 的 ~/.claude.jsonmcpServers——而且 hermes import-agent claude-code 会把整个配置(含 skills 和 instructions)一起迁移。

MCP 给 Hermes 带来的东西:

  • 不需要写原生 Hermes 工具就能接入外部工具生态
  • 同一配置里并存本地 stdio 服务器 + 远程 HTTP 服务器
  • 启动时自动发现和注册所有工具
  • 支持 per-server 工具过滤(你可以只暴露自己想让 Hermes 看到的几个工具,而不是整个 MCP Server 的工具全露给它)
  • 支持 sampling 配置
  • 官方 Catalog:经过 Nous 员工 review 的一批 MCP 服务器,默认关闭按需安装:
    hermes mcp # 交互 picker hermes mcp catalog # 脚本友好的纯文本列表 hermes mcp install n8n # 按名字安装 catalog 项

5.2 Provider Routing:哪次推理用哪家模型,你说了算

精细控制每次请求到底走哪家 provider。优化维度三维:

  • 按成本优化
  • 按速度优化
  • 按质量优化

控制手段:排序 + 白名单 + 黑名单 + 优先级顺序。你能把"便宜的先试、失败再试贵的"或者"只有代码生成任务用强模型、其余用便宜"这样的策略配置进去。

5.3 Fallback Providers:主挂自动切,视觉/压缩有独立 Fallback

当你的主模型出故障(HTTP 5xx、限流)时,自动 Failover 到备用 Provider。更狠的一点:视觉任务、上下文压缩任务,都可以跟主 LLM 的 Fallback 独立配置——主模型倒了但视觉模型可能还活着,反之亦然。

5.4 Credential Pools:多 Key 轮询 + 限流自动切走

同一家 provider 的多个 API Key 丢进池。按顺序轮询;一旦某 Key 遇到 rate limit 或失败,自动从当前轮换里切走一段时间,恢复回来再插回。

5.5 Prompt Caching:跨会话 1 小时前缀 Cache,零配置

对 Anthropic 原生、OpenRouter、Nous Portal 三个渠道自动开启跨会话 1 小时前缀缓存。不需要任何配置开关。对你反复使用同一段 system prompt + SOUL.md + 记忆 + 大段上下文的场景,可以极大减少重复计费。

5.6 Memory Providers:8 家外部记忆提供方

超越 MEMORY.md/USER.md 的内置记忆边界,做跨会话用户建模和个性化:

  1. Honcho
  2. OpenViking
  3. Mem0
  4. Hindsight
  5. Holographic
  6. RetainDB
  7. ByteRover
  8. Supermemory

都是以记忆提供方插件形式安装。如果要让多个 Profile/Bot 共享记忆,外部提供方是唯一官方推荐做法。

5.7 API Server:OpenAI 兼容 HTTP 端点

把 Hermes 暴露成一个 /v1/chat/completions 风格的 OpenAI 兼容 HTTP 端点。结果是:任何能接 OpenAI 的前端都能直接接 Hermes——官方明确列了三个:
- Open WebUI
- LobeChat
- LibreChat

5.8 IDE Integration (ACP):VS Code / Zed / JetBrains

Hermes 作为后端跑在 ACP(Agent Communication Protocol,不同 ACP 哦,注意这里是 IDE 用的 ACP)兼容的编辑器里:聊天、工具活动、文件 diffs、终端命令,全部在编辑器内部原生渲染。不要把 Hermes 当 CLI 外面开一个终端,直接在 IDE 里用。

6. Customization 定制:SOUL 人格 / Skins 皮肤 / 三类插件

6.1 SOUL.md & Personality:system prompt 的第一位 + /personality 预设切换

SOUL.md人格主文件,它出现在 system prompt 的最顶部——是对 Agent 性格最有话语权的注入点。你可以写一整套"你是一个怎样的助手、如何回答问题、禁忌是什么"。配合 /personality 命令可以在会话中切换到内置或自定义预设,一次对话里改人格是标准操作,不是 hack。

6.2 Skins & Themes:CLI 视觉全可定制

可以改的项:Banner 配色 / Spinner 的表情与动词 / 响应框标签 / 品牌文字 / 工具活动前缀。全是小改动,但对内部品牌或团队统一体验非常有用——一行一行改 config 就能把 Hermes CLI 的脸换了。

6.3 Plugins:三大类 + hermes plugins 交互管理

三种插件类型:

  • 通用插件(Tools + Hooks):加入自定义工具、拦截工具调用、指标、护栏
  • 记忆提供方插件:把上面 8 家之外的记忆接入进来
  • 上下文引擎插件:替换默认的上下文处理方案(做自己的相关性排序、注入外部知识源等)

统一通过 hermes plugins 交互 UI 安装、管理、删除。

7. 各层能力与同类竞品对照表

功能维度 Hermes Agent(本文) Claude Code 2.x Codex(OpenAI) Teams Copilot
Tools 内置覆盖面 Web+X+终端+文件+浏览器+媒体+编排+记忆+Cron+HomeAssistant+MCP Web+终端+文件+MCP+图像 Web+终端+文件+Office/邮件/日历/PPT等 仅限 M365 Graph + 声明式 Agent Action Plugin
Skills / 指令库 agentskills.io 兼容 · 渐进披露 · 可 opt-out SKILL.md · 较简单 仅 Teams 端 Cowork SKILL.md(用户级) SKILL.md Cowork 级;Agent 侧是 Prompt 指令
持久记忆字符上限 MEMORY.md 2200c + USER.md 1375c + 8 外部记忆提供方 无公开硬上限 · MEMORY.md + USER.md 等 workspace 级无公开上限 会话级为主;SharePoint 作为知识源
上下文发现链 .hermes.md → AGENTS.md → CLAUDE.md → .cursorrules AGENTS.md + CLAUDE.md + SOUL.md + .cursorrules 等 Teams 工作空间 + M365 文档 仅 M365 Graph / SharePoint / Outlook
@引用 文件/文件夹/@diff/URL 自动展开 文件/文件夹/@diff/MCP server / @workspace 文件 + MCP 无原生 @引用机制,仅文件上传
自动快照 + /rollback ✅ 改文件前自动快照,斜杠命令回滚 ✅ Checkpoint & Rollback ❌ N/A ❌ N/A
Cron 自然语言+Cron · Skills 挂载 · 独立模型 pin · no-agent · fail closed closed snapshot 安全 基本 /cron 自动化(Automation)做定时 有 Power Automate 但 Copilot 本身无 Cron
delegate_task 默认并发 3 · 子Agent 独立上下文+终端+自动注入项目上下文 · 后台执行 delegate_task 子Agent(日志不可见) Team 多 Agent(可视面板) 声明式 Agent 无原生子Agent delegation(靠 Message Extension)
execute_code Python RPC execute_code(Python+JS+shell)
Event Hooks Gateway + Plugin 两大类 Hooks 但文档没公开细化 N/A Power Platform Connectors / Copilot Studio Topic 钩子
Batch Processing ShareGPT 轨迹 ✅ 成百上千 prompt 并行 部分可实现但非官方主打
语音模式 + 多平台 ✅ CLI + 全消息平台 + Discord 语音 + 唤醒词 无语音 语音笔记式但非流式 语音仅限 Teams 会议
浏览器 4 种后端 Browserbase/BrowserUse/CDP/本地Chromium 自带 Browser Use 内建浏览器 无内建浏览器
视觉+贴图 ✅ 剪贴板贴图进 CLI ✅(文件上传) 图像上传但非原生 paste
出图模型数 11 FAL.ai DALL·E 3 + 其他 MCP 原生 DALL·E 3/图像 1.5 Teams 聊天中禁图像生成(官方文档)
TTS 提供方数 10 + 自定义命令
MCP ✅ 原生 + Catalog 一键安装 + per-server 过滤 ✅ 原生 + mcpServers.json ✅ 原生 需要声明式 Agent + Action Plugin
Provider 路由 / Fallback / 凭证池 / Prompt Cache 四套全独立支持 部分支持但细粒度弱 模型锁定自家 Copilot 锁定自家 GPT;自定义引擎 Agent 能带别家但流程重
外部记忆提供方 8 家插件接入(Honcho/Mem0…) 部分通过 MCP N/A 仅 M365 自带知识库/语义索引
OpenAI 兼容 API Server ✅ Open WebUI/LobeChat/LibreChat 已验证 自家专用 ✅(M365 Copilot Chat API Preview,但限制硬)
IDE (ACP) ✅ VS Code / Zed / JetBrains VS Code + Cursor 自家产品 + JetBrains WIP 无原生 ACP 但可用 VS Code Copilot Copilot for VS Code 另购
SOUL / 人格 / 皮肤 ✅ SOUL.md + /personality 切换 + CLI 5 项皮肤 ✅ SOUL.md(但皮肤无) 无原生人格配置 声明式 Agent Persona 是 metadata
插件体系 通用工具/记忆提供方/上下文引擎 三大类 + 交互管理 Skill 生态但非插件形态 Plugin 市场 + Copilot GPTs Teams App Manifest + Copilot Studio 插件/连接器

作者: itech001
来源: 公众号:AI人工智能时代(the-ai-era)
网站: https://www.theaiera.top/
关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top

本文首发于 AI人工智能时代,转载请注明出处。

posted @ 2026-09-02 22:42  iTech  阅读(7)  评论(0)    收藏  举报