Hermes Agent 全功能详解:40+ 特性从 Core 到 Customization 全梳理
Hermes Agent 全功能详解:40+ 特性从 Core 到 Customization 全梳理
如果只想看官方文档 hermes-agent.nousresearch.com/docs/user-guide/features/overview 里列的所有能力,这篇帮你把它们翻译成"上手用什么、怎么配、哪一层最强"。
不知道从哪里开始,Hermes 官方给过一句话的快速路径:hermes setup --portal 一条命令完成模型 Provider + Tool Gateway 的四大工具(Web 搜索、图像生成、TTS、浏览器)接入。这是最快的"从安装到能用"路径,但离"发挥 Hermes 全部能力"差了至少 30 个开关。
本文按官方文档五大分类(Core 核心 / Automation 自动化 / Media & Web 媒体与网络 / Integrations 集成 / Customization 定制),把 Overview 列出的所有子特性加上对应子页的细节逐一拆开。读完之后你会知道:哪些功能免费内置、哪些要开插件、哪些有字符数限制、哪些有硬编码默认值、MCP 和工具集到底怎么选。
本文提纲
- 一图看懂功能全景 + 快速启动命令
- Core 核心层:工具 / Skills / 记忆 / 上下文文件 / @引用 / 检查点回滚
- Automation 自动化:Cron 调度 / delegate_task 子 Agent / execute_code 代码执行 / Event Hooks / 批处理
- Media & Web:语音模式 / 唤醒词 / 浏览器自动化 / 视觉贴图 / 图像生成 / TTS
- Integrations 集成:MCP / Provider 路由 / Fallback / 凭证池 / Prompt Cache / 8 家记忆提供方 / API Server / ACP
- Customization 定制:SOUL.md 人格 / Skins 皮肤 / 三类插件
- 各层能力与同类竞品对照表(vs Claude Code / Codex / Teams Copilot)
1. 一图看懂功能全景 + 快速启动命令
MERMAID_BLOCK_0
快速启动命令速记:
# 最快方案:一条命令完成 Provider + 4 个 Tool Gateway 工具
hermes setup --portal
# 从零开始,不想要任何内置 Skills
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash -s -- --no-skills
# 创建一个不继承 bundled skills 的命名 Profile
hermes profile create research --no-skills
2. Core 核心层:工具 / Skills / 记忆 / 上下文文件 / @引用 / 检查点回滚
2.1 Tools & Toolsets:按平台开关的工具分组
工具(Tools)是扩展 Agent 能力的函数;工具集(Toolsets)是按逻辑分组、可按平台独立启停的一组工具。内置注册表覆盖了非常大的范围:
| 类别 | 典型工具名 | 说明 |
|---|---|---|
| Web | web_search、web_extract |
全网搜索 + 网页正文提取 |
| X(Twitter)Search | x_search |
通过 xAI 内置的 Responses 工具搜 X 帖子;需 SuperGrok OAuth 或 XAI_API_KEY,默认关闭,hermes tools → X 手动开 |
| 终端与文件 | terminal、process、read_file、patch |
执行命令、进程管理、读写/打补丁文件 |
| 浏览器 | browser_navigate、browser_snapshot、browser_vision |
交互式浏览器自动化,含文本 + 视觉双通道 |
| 媒体 | vision_analyze、image_generate、text_to_speech |
多模态分析、生成、朗读 |
| Agent 编排 | todo、clarify、execute_code、delegate_task |
规划、澄清、代码执行、子 Agent 委派 |
| 记忆与回溯 | memory、session_search |
持久记忆 + 当前会话搜索 |
| 自动化 | cronjob |
创建/列表/更新/暂停/恢复/立即运行/删除 调度任务 |
| 集成 | ha_* + MCP |
Home Assistant 全系函数 + MCP 外部工具 |
重要提示:Honcho(跨会话记忆)不是内置 Toolset,而是以记忆提供方插件形式存在(plugins/memory/honcho/),需要通过插件管理安装。
2.2 Skills System:按需加载的知识文档 + agentskills.io 开放标准
Skills 是按需加载的知识文档,遵循 Progressive Disclosure(渐进披露)模式来减少 token 占用;格式与 agentskills.io 开放标准兼容。
- 主目录:所有 Skill 存于
~/.hermes/skills/——是唯一真源。内置 bundled skills 在安装时复制进来;通过 Hub 安装的和 Agent 自建的都放这里。Agent 可以修改或删除任何 Skill。 - 外部 Skill 目录:可以通过配置额外指向扫描文件夹,与主目录并行生效。
- Bundled Skills Catalog + Optional Skills Catalog:官方维护两份目录(随文档链接提供)。
- 三种"不要内置 skills"的方式:
- 安装时
--no-skills(作用于默认 profile) - 创建 profile 时
hermes profile create <name> --no-skills - 运行时
hermes skills opt-out [--remove],再反向hermes skills opt-in --sync - 标记文件:
.no-bundled-skillsmarker。只要存在,安装器、hermes update、任何 skills sync 都不会再播种 bundled skills。
2.3 Persistent Memory:有字符硬限制、Agent 自行管理的持久记忆
记忆有两个文件,都存在 ~/.hermes/memories/,在会话开始时作为冻结快照注入 system prompt。
| 文件 | 用途 | 字符上限 | 约 token |
|---|---|---|---|
MEMORY.md |
Agent 自己的笔记:环境事实、编码惯例、学到的东西 | 2,200 字符 | ~800 tokens |
USER.md |
用户画像:偏好、沟通风格、期望 | 1,375 字符 | ~500 tokens |
关键点:
- "一个 Hermes 家目录 = 一个 Agent 进程":两个 Agent 进程不要共享 ~/.hermes,会互相写记忆造成双方都没写过的状态。想多 Agent 共享记忆请用 Profile + 外部记忆提供方(Honcho/Mem0 等)。
- 字符超限不自动压缩:Agent 调用 memory 工具写超出限制时,工具直接报错而非默默截断——Agent 会在同一回合内自己压缩/删条目再重试。replace 操作也受上限约束,把一条替换成长的同样会溢出,所以 Agent 必须先缩短或者删另一条。
2.4 Context Files:项目级规则文件,有严格发现优先级
Hermes 会自动发现项目上下文文件并按如下优先级从高到低注入 system prompt:.hermes.md → AGENTS.md 链 → CLAUDE.md → .cursorrules。这意味着如果你想写项目专属规则,最高优先级是写 .hermes.md;已有团队在 AGENTS.md 中的规则会被继承;Claude Code / Cursor 的规则文件也自动适配——不强迫你改一遍。
注意:SOUL.md(人格)不在这个上下文发现链里,它走单独的 personality 机制。
2.5 Context References:@ 引用文件/文件夹/git diff/URL,自动展开
消息中 @ 后面跟引用:文件、文件夹、git diff、URL 都可以直接注入。Hermes 把引用内联展开,自动追加内容到输入。这是目前 AI IDE / Agent CLI 的标准交互范式,Hermes 内置原生支持。
2.6 Checkpoints & Rollback:改文件前自动快照,/rollback 一键回滚
Hermes 在任何文件改动前自动对工作目录做快照。出现意外时 /rollback 回退,是对"Agent 写崩了项目"的终极保险网。命令走的是 /rollback 斜杠命令。
3. Automation 自动化:Cron / 子 Agent / execute_code / Hooks / 批处理
3.1 Scheduled Tasks (Cron):自然语言 + Cron 表达式 + 独立模型 + no-agent 模式
cronjob 工具以 action-style 暴露 create/list/update/pause/resume/run/remove 七种操作。Cron 的能力远不止"定时跑 LLM 对话":
- 投递系统:结果可以发送回发起聊天、本地文件、或任意已配置平台目标。发送走 cron 自带的 delivery、
hermes sendCLI 和网关 notifier——不是 Agent-callable tool 发的,所以执行安全边界是独立的。 - Skills 挂载:一个 cron 任务可以挂 0~N 个 skills,让定时任务有专属知识库。
- 三层模型解析(执行时才决定用什么模型):
1. 每个 job 单独 pin(用户拥有,Agent 的cronjob工具不能改 pin)→ CLI:hermes cron create/edit --model … --provider …或直接改jobs.json
2.cron.model+cron.model_provider在 config.yaml 中设 cron 车队默认值
3. 全局hermes model跟随。快照机制:创建时记 provider+model,若之后全局默认变了,job fail closed:跳跑并在日志里记录"默认模型快照不匹配,为避免跑错模型我没跑。" - No-agent Mode(只跑脚本):完全不调 LLM。cron 触发一个 shell/python/js 脚本,stdout 原样投递。零 token 费用——这一点在批量监控任务上非常有用。
3.2 Subagent Delegation:delegate_task 默认并发 3,子 Agent 零知识 + 自动注入项目上下文
关键事实一:子 Agent 什么都不知道。只有 goal + context 两个字段给进去,没有任何父对话历史、没有之前 tool call 记录,完全独立。
关键事实二:唯一例外是 workspace 的项目上下文文件链。如果父 Agent 已经解析出一个 workspace 根,子 Agent 的 system prompt 会自动嵌入该 repo 的 .hermes.md → AGENTS.md → CLAUDE.md → .cursorrules(SOUL.md 排除)。所以子 Agent 在同一个仓库里自动按 repo 约定做事,不用重新发现。
两种调用形式:
# 单任务
delegate_task(goal="Debug why tests fail", context="Error: assertion in test_foo.py line 42")
# 并行批量(默认并发 3,可配置,无硬上限)
delegate_task(tasks=[
{"goal": "Research topic A", "context": "..."},
{"goal": "Research topic B", "context": "..."},
{"goal": "Fix the build", "context": "..."},
])
顶层 model 调用自动后台执行。Hermes 立刻返回一个句柄,父对话可以继续聊,完成后再回传结果;编排型子 Agent 会等自己的 workers 全部完成再合成结果。
3.3 Code Execution:execute_code Python 沙箱 RPC
Agent 写 Python 脚本,脚本内部可以通过 RPC 直接调用 Hermes 自身工具。好处是把多步工作流(先工具 A 拿结果、再工具 B 处理、再根据结果 C 决定分支)折叠成一个 LLM 回合——不需要模型每一步重新推理。Sandboxed RPC 执行,安全隔离。
3.4 Event Hooks:关键生命周期注入自定义代码
分为两大类:
- Gateway Hooks(网关钩子):日志、告警、Webhook——处理消息进出通道层面的拦截。
- Plugin Hooks(插件钩子):工具拦截、指标收集、护栏——处理 Agent 决策面的检查。
具体用场景:把所有终端命令的实际执行记录到审计系统里;在发邮件/写工单之前额外做一次合规扫描;在每一次模型调用前后埋入 APM 指标。
3.5 Batch Processing:成百上千 Prompt 并行
从 CLI 把几百上千个 prompt 批量喂给 Hermes Agent 并行跑,产出结构化 ShareGPT 格式的轨迹数据。典型用途:
- 构造自己的 SFT / DPO 训练集(让 Hermes 示范好的行为轨迹)
- 大规模评估(eval):把测试集全部跑一遍,拿到结构化 pass/fail 和 token 成本
4. Media & Web:语音 / 唤醒词 / 浏览器 / 视觉 / 出图 / TTS
4.1 Voice Mode:CLI + 全消息平台 + Discord 语音频道
不是"语音转文字 + 文字转语音"的简单拼接,而是完整的语音交互管道:
- CLI 模式:用麦克风直接跟 Hermes 对话。
- 全消息平台:WhatsApp、飞书、钉钉、LINE、QQ、微信等发语音消息 → Hermes 转录 + 回答 + 语音返回。
- Discord 语音频道:实时跟频道里的人做 live voice 对话。
4.2 Wake Word:本地端侧"Hey Hermes"
On-device 热词监听,所以在等待唤醒时没有任何音频流出设备。CLI、TUI、桌面端三端都支持。多 Profile 路由:不同唤醒词可以直达不同 Profile 的 Agent。
4.3 Browser Automation:多云多后端 + 本地 CDP
四种后端任你选:
- 云:Browserbase、Browser Use
- 本地 CDP:Chrome、Brave、Chromium、Edge
- 本地 Chromium 独立安装
导航、填表、提取信息全部支持,而且配合 browser_vision 工具还能看图理解页面。
4.4 Vision & Image Paste:剪贴板贴图进 CLI
直接从系统剪贴板把图片粘进 CLI,Agent 调视觉模型分析、描述、处理图像内容。配合 Pasteboard,一条命令就能把截图喂给 Agent。
4.5 Image Generation:FAL.ai 提供 11 个模型
生成模型列表(官方列出,全是 FAL.ai 后端):
- FLUX.2 Klein
- FLUX.2 Pro
- GPT-Image 1.5
- GPT-Image 2
- Nano Banana Pro
- Ideogram V3
- Recraft V4 Pro
- Qwen Image
- Z-Image Turbo
- Krea V2 Medium
- Krea V2 Large
通过 hermes tools 选择当前使用哪一个。
4.6 Voice & TTS:10 家原生 TTS + 自定义命令提供方
TTS 提供商(文本转语音):
- Edge TTS(免费)
- ElevenLabs
- OpenAI TTS
- MiniMax
- Mistral Voxtral
- Google Gemini
- xAI
- NeuTTS
- KittenTTS
- Piper(本地 TTS CLI 热门)
再加一个自定义命令提供方——任何本地 CLI TTS 都可以通过一条 shell 命令包装接入。
STT(语音转文字):所有消息平台上的语音消息都走统一转录管道 + 统一语言解析,防止回来的 transcript 语言错乱;OpenAI GPT-Transcribe 原生支持;还有一个跨所有 TTS 提供方的"统一语音预处理器"负责把 markdown、代码、URL 从要朗读的文本里清洗掉,避免念出三个反引号和 HTTP 协议。
5. Integrations 集成:MCP / Provider 路由 / Fallback / 凭证池 / Cache / 8 家记忆 / API Server / ACP
5.1 MCP:stdio + HTTP 双传输 + 官方 Catalog
MCP 支持是标准安装自带的,不用额外步骤。config.yaml 里的 mcp_servers 对应 Claude Code 的 ~/.claude.json 的 mcpServers——而且 hermes import-agent claude-code 会把整个配置(含 skills 和 instructions)一起迁移。
MCP 给 Hermes 带来的东西:
- 不需要写原生 Hermes 工具就能接入外部工具生态
- 同一配置里并存本地 stdio 服务器 + 远程 HTTP 服务器
- 启动时自动发现和注册所有工具
- 支持 per-server 工具过滤(你可以只暴露自己想让 Hermes 看到的几个工具,而不是整个 MCP Server 的工具全露给它)
- 支持 sampling 配置
- 官方 Catalog:经过 Nous 员工 review 的一批 MCP 服务器,默认关闭按需安装:
hermes mcp # 交互 picker hermes mcp catalog # 脚本友好的纯文本列表 hermes mcp install n8n # 按名字安装 catalog 项
5.2 Provider Routing:哪次推理用哪家模型,你说了算
精细控制每次请求到底走哪家 provider。优化维度三维:
- 按成本优化
- 按速度优化
- 按质量优化
控制手段:排序 + 白名单 + 黑名单 + 优先级顺序。你能把"便宜的先试、失败再试贵的"或者"只有代码生成任务用强模型、其余用便宜"这样的策略配置进去。
5.3 Fallback Providers:主挂自动切,视觉/压缩有独立 Fallback
当你的主模型出故障(HTTP 5xx、限流)时,自动 Failover 到备用 Provider。更狠的一点:视觉任务、上下文压缩任务,都可以跟主 LLM 的 Fallback 独立配置——主模型倒了但视觉模型可能还活着,反之亦然。
5.4 Credential Pools:多 Key 轮询 + 限流自动切走
同一家 provider 的多个 API Key 丢进池。按顺序轮询;一旦某 Key 遇到 rate limit 或失败,自动从当前轮换里切走一段时间,恢复回来再插回。
5.5 Prompt Caching:跨会话 1 小时前缀 Cache,零配置
对 Anthropic 原生、OpenRouter、Nous Portal 三个渠道自动开启跨会话 1 小时前缀缓存。不需要任何配置开关。对你反复使用同一段 system prompt + SOUL.md + 记忆 + 大段上下文的场景,可以极大减少重复计费。
5.6 Memory Providers:8 家外部记忆提供方
超越 MEMORY.md/USER.md 的内置记忆边界,做跨会话用户建模和个性化:
- Honcho
- OpenViking
- Mem0
- Hindsight
- Holographic
- RetainDB
- ByteRover
- Supermemory
都是以记忆提供方插件形式安装。如果要让多个 Profile/Bot 共享记忆,外部提供方是唯一官方推荐做法。
5.7 API Server:OpenAI 兼容 HTTP 端点
把 Hermes 暴露成一个 /v1/chat/completions 风格的 OpenAI 兼容 HTTP 端点。结果是:任何能接 OpenAI 的前端都能直接接 Hermes——官方明确列了三个:
- Open WebUI
- LobeChat
- LibreChat
5.8 IDE Integration (ACP):VS Code / Zed / JetBrains
Hermes 作为后端跑在 ACP(Agent Communication Protocol,不同 ACP 哦,注意这里是 IDE 用的 ACP)兼容的编辑器里:聊天、工具活动、文件 diffs、终端命令,全部在编辑器内部原生渲染。不要把 Hermes 当 CLI 外面开一个终端,直接在 IDE 里用。
6. Customization 定制:SOUL 人格 / Skins 皮肤 / 三类插件
6.1 SOUL.md & Personality:system prompt 的第一位 + /personality 预设切换
SOUL.md 是人格主文件,它出现在 system prompt 的最顶部——是对 Agent 性格最有话语权的注入点。你可以写一整套"你是一个怎样的助手、如何回答问题、禁忌是什么"。配合 /personality 命令可以在会话中切换到内置或自定义预设,一次对话里改人格是标准操作,不是 hack。
6.2 Skins & Themes:CLI 视觉全可定制
可以改的项:Banner 配色 / Spinner 的表情与动词 / 响应框标签 / 品牌文字 / 工具活动前缀。全是小改动,但对内部品牌或团队统一体验非常有用——一行一行改 config 就能把 Hermes CLI 的脸换了。
6.3 Plugins:三大类 + hermes plugins 交互管理
三种插件类型:
- 通用插件(Tools + Hooks):加入自定义工具、拦截工具调用、指标、护栏
- 记忆提供方插件:把上面 8 家之外的记忆接入进来
- 上下文引擎插件:替换默认的上下文处理方案(做自己的相关性排序、注入外部知识源等)
统一通过 hermes plugins 交互 UI 安装、管理、删除。
7. 各层能力与同类竞品对照表
| 功能维度 | Hermes Agent(本文) | Claude Code 2.x | Codex(OpenAI) | Teams Copilot |
|---|---|---|---|---|
| Tools 内置覆盖面 | Web+X+终端+文件+浏览器+媒体+编排+记忆+Cron+HomeAssistant+MCP | Web+终端+文件+MCP+图像 | Web+终端+文件+Office/邮件/日历/PPT等 | 仅限 M365 Graph + 声明式 Agent Action Plugin |
| Skills / 指令库 | agentskills.io 兼容 · 渐进披露 · 可 opt-out | SKILL.md · 较简单 | 仅 Teams 端 Cowork SKILL.md(用户级) | SKILL.md Cowork 级;Agent 侧是 Prompt 指令 |
| 持久记忆字符上限 | MEMORY.md 2200c + USER.md 1375c + 8 外部记忆提供方 | 无公开硬上限 · MEMORY.md + USER.md 等 | workspace 级无公开上限 | 会话级为主;SharePoint 作为知识源 |
| 上下文发现链 | .hermes.md → AGENTS.md → CLAUDE.md → .cursorrules | AGENTS.md + CLAUDE.md + SOUL.md + .cursorrules 等 | Teams 工作空间 + M365 文档 | 仅 M365 Graph / SharePoint / Outlook |
| @引用 | 文件/文件夹/@diff/URL 自动展开 |
文件/文件夹/@diff/MCP server / @workspace | 文件 + MCP | 无原生 @引用机制,仅文件上传 |
| 自动快照 + /rollback | ✅ 改文件前自动快照,斜杠命令回滚 | ✅ Checkpoint & Rollback | ❌ N/A | ❌ N/A |
| Cron | 自然语言+Cron · Skills 挂载 · 独立模型 pin · no-agent · fail closed closed snapshot 安全 | 基本 /cron | 自动化(Automation)做定时 | 有 Power Automate 但 Copilot 本身无 Cron |
| delegate_task | 默认并发 3 · 子Agent 独立上下文+终端+自动注入项目上下文 · 后台执行 | delegate_task 子Agent(日志不可见) | Team 多 Agent(可视面板) | 声明式 Agent 无原生子Agent delegation(靠 Message Extension) |
| execute_code Python RPC | ✅ | execute_code(Python+JS+shell) | ❌ | ❌ |
| Event Hooks | Gateway + Plugin 两大类 | Hooks 但文档没公开细化 | N/A | Power Platform Connectors / Copilot Studio Topic 钩子 |
| Batch Processing ShareGPT 轨迹 | ✅ 成百上千 prompt 并行 | 部分可实现但非官方主打 | 无 | 无 |
| 语音模式 + 多平台 | ✅ CLI + 全消息平台 + Discord 语音 + 唤醒词 | 无语音 | 语音笔记式但非流式 | 语音仅限 Teams 会议 |
| 浏览器 | 4 种后端 Browserbase/BrowserUse/CDP/本地Chromium | 自带 Browser Use | 内建浏览器 | 无内建浏览器 |
| 视觉+贴图 | ✅ 剪贴板贴图进 CLI | ✅ | ✅(文件上传) | 图像上传但非原生 paste |
| 出图模型数 | 11 FAL.ai | DALL·E 3 + 其他 MCP | 原生 DALL·E 3/图像 1.5 | Teams 聊天中禁图像生成(官方文档) |
| TTS 提供方数 | 10 + 自定义命令 | 无 | 无 | 无 |
| MCP | ✅ 原生 + Catalog 一键安装 + per-server 过滤 | ✅ 原生 + mcpServers.json | ✅ 原生 | 需要声明式 Agent + Action Plugin |
| Provider 路由 / Fallback / 凭证池 / Prompt Cache | 四套全独立支持 | 部分支持但细粒度弱 | 模型锁定自家 | Copilot 锁定自家 GPT;自定义引擎 Agent 能带别家但流程重 |
| 外部记忆提供方 | 8 家插件接入(Honcho/Mem0…) | 部分通过 MCP | N/A | 仅 M365 自带知识库/语义索引 |
| OpenAI 兼容 API Server | ✅ Open WebUI/LobeChat/LibreChat 已验证 | ❌ | 自家专用 | ✅(M365 Copilot Chat API Preview,但限制硬) |
| IDE (ACP) | ✅ VS Code / Zed / JetBrains | VS Code + Cursor 自家产品 + JetBrains WIP | 无原生 ACP 但可用 VS Code Copilot | Copilot for VS Code 另购 |
| SOUL / 人格 / 皮肤 | ✅ SOUL.md + /personality 切换 + CLI 5 项皮肤 |
✅ SOUL.md(但皮肤无) | 无原生人格配置 | 声明式 Agent Persona 是 metadata |
| 插件体系 | 通用工具/记忆提供方/上下文引擎 三大类 + 交互管理 | Skill 生态但非插件形态 | Plugin 市场 + Copilot GPTs | Teams App Manifest + Copilot Studio 插件/连接器 |
作者: itech001
来源: 公众号:AI人工智能时代(the-ai-era)
网站: https://www.theaiera.top/
关注每日最新AI新闻和技术博客,主页有更多的文章的AI 技术参考:https://www.theaiera.top
本文首发于 AI人工智能时代,转载请注明出处。

浙公网安备 33010602011771号