oh-my-opencode架构原理与Agent配置分享

Posted on 2026-02-26 09:50  辰玄  阅读(1543)  评论(0)    收藏  举报

日常开发需求的时候,开发效果的好坏,很大程度上取决于模型本身的智能水平。模型越聪明,理解需求、补全上下文、处理复杂逻辑的能力就越强,这点毋庸置疑。

而我们使用AI开发的过程,其实就是透过自己的经验和理解,在不同的场景下应用不同的模型,而这份工作,本质上也是可以被ai取代的, oh-my-opencode的观点就是,设置一个代理人,帮助你干这份调用不同ai的工作,让你每天工作一个指令就能搞定所有任务,直到没有bug闭环。


马上要更新的Codemaker CLI也是基于Opencode fork开发,可以不限量爽用更多的模型,所以算是提前预习一下原理和使用方式吧。

 

太长不看

我不想了解花里胡哨的,你能不能直接把配置给我交了?
有的,包有的。

(cc现在的封禁很严格所以最好找靠谱的中转站)

{
  "$schema": "https://raw.githubusercontent.com/code-yeongyu/oh-my-opencode/master/assets/oh-my-opencode.schema.json",
  
  //来禁用某个特定代理
//   "disabled_agents": ["oracle", "multimodal-looker"],

  "agents": {

    // ======================
    // 1. 编排规划与验证
    // ======================

    "sisyphus": { 
      // 主编排器:委托任务编排分配、TODO、后台并行、动态组合技能,调用subagent
      // fallback:claude-opus-4-6 → kimi-k2.5 → glm-4.7 → gpt-5.3-codex → gemini-3-pro
      "model": "claude/claude-opus-4-6",
      "temperature": 0.1
    },

    "atlas": { 
      // 高级编排器:全生命周期管理,任务路由,基于skills调度,全局会话级别的编排器,一般由内部逻辑/hook唤起
      // fallback:claude-sonnet-4-5 → kimi-k2.5 → gpt-5.2 → gemini-3-pro
      "model": "claude/claude-sonnet-4-5",
      "temperature": 0.1
    },

    "prometheus": { 
      // 战略规划:澄清需求、验证计划、复杂任务分解,推荐内部plan而不是和用户直接交互
      // fallback:claude-opus-4-6 → kimi-k2.5 → gpt-5.2
      "model": "claude/claude-opus-4-6",  
      "temperature": 0.1
    },
    
    "metis": {
      // 预分析规划顾问:正式plan/执行前进行问题理解、风险与上下文分析,温度略高,探索更多方案
      // fallback:claude-opus-4-6 → kimi-k2.5 → gpt-5.2-high
      "model": "anthropic/claude-opus-4-6",
      "temperature": 0.3,
      "variant": "max"
    },

    "momus": {
      // 计划与结果验证:对计划/方案进行合理性检查和评审
      // gpt-5.2 → claude-opus-4-6 → gemini-3-pro
      "model": "openai/gpt-5.2",
      "temperature": 0.1,
      "variant": "medium"
    },

    // ======================
    // 2. 执行
    // ======================

    "hephaestus": {
      // 深度自主工作专用,长周期,深度任务
      // 只推荐OpenAIcodex模型,如果没有codex则不会使用这个agent
      "model": "openai/gpt-5.3-codex",  
      "temperature": 0.1
    },

    // ======================
    // 3. 顾问与检索
    // ======================

    "oracle": { 
      // 咨询/调试/架构专家:代码审查、复杂问题拆解,交互式问答
      // fallback:gpt-5.2-high → gemini-3-pro → claude-opus-4-6
      "model": "openai/gpt-5.2",
      "temperature": 0.1,
      "variant": "high"
    },

    "librarian": { 
      // 文档/仓库检索专家:文档/README/API 手册/GitHub 仓库搜索,大量输入,需要快速便宜长上下文的模型
      // fallback:glm-4.7 → gpt-5.3-codex-spark → gemini-3-flash
      "model": "openai/gpt-5.3-codex-spark" 
    },

    "explore": { 
      // 快速代码库探索:grep(上下文感知搜索)
      // fallback:gpt-5.3-codex-spark → grok-code-fast-1 → claude-haiku-4-5 → gpt-5-mini → gpt-5-nano
      "model": "openai/gpt-5.3-codex-spark" 
    },

    "multimodal-looker": { 
      // 多模态分析:PDF/图片分析,多模态好的模型
      // fallback:gemini-3-flash → kimi-k2.5
      "model": "gemini/gemini-3-pro-preview" 
    }
  },
  "categories": {
    // 快速小活:haiku / gemini-flash / nano
    "quick": { "model": "openai/gpt-5.3-codex-spark", "temperature": 0.1 },

    // 深度执行:codex / opus / gemini-pro
    "deep": { "model": "openai/gpt-5.3-codex", "variant": "medium", "temperature": 0.1 },

    // 超大脑:codex xhigh(更激进)
    "ultrabrain": { "model": "openai/gpt-5.3-codex", "variant": "xhigh", "temperature": 0.1 },

    // 视觉/前端/GUI:gemini-pro-high / glm-5 / opus
    "visual-engineering": { "model": "google/gemini-3-pro-preview", "temperature": 0.1 },

    // 文本/写作:glm4.7 / k2.5 / gemini-flash / sonnet
    "writing": { "model": "gemini/gemini-3-pro-preview", "temperature": 0.2 },

    // 未指定低/高档位
    "unspecified-low": { "model": "claude/claude-sonnet-4-5", "temperature": 0.1 },
    "unspecified-high": { "model": "claude/claude-opus-4-6", "variant": "max", "temperature": 0.1 }
  }
}



 


架构设计

首先简要梳理一下最新版本的agents集群架构。
让Opencode自己输出的agent职责,内容如下:

{
  "agents": {
    "build": {
      "agent": "build",
      "model": "未知",
      "suitable_for": [
        "代码实现与重构",
        "Bug 定位与修复",
        "单元测试与测试策略",
        "构建与CI排障",
        "项目结构与可维护性优化"
      ],
      "core_principles": [
        "先澄清需求与边界",
        "最小改动达成目标",
        "保持一致性与可读性",
        "优先可靠性与可测试性",
        "避免过度设计(YAGNI)",
        "减少重复(DRY)",
        "遵循SOLID与KISS"
      ]
    },
    "plan": {
      "agent": "plan",
      "model": "未知",
      "suitable_for": [
        "需求澄清与范围界定",
        "技术方案设计与权衡",
        "任务拆解与里程碑规划",
        "风险识别与应对预案",
        "验收标准与测试策略制定"
      ],
      "core_principles": [
        "先理解问题再提出方案",
        "以最小可行改动达成目标",
        "优先降低风险与不确定性",
        "明确假设、边界与验收标准",
        "可执行、可验证、可回滚",
        "沟通简洁且信息密度高"
      ]
    },
    "general": {
      "agent": "general",
      "model": "未知",
      "suitable_for": [
        "通用问答与信息整理",
        "编程概念解释与示例",
        "需求澄清与方案对比",
        "写作润色与结构化输出",
        "基础调试思路与排错建议"
      ],
      "core_principles": [
        "遵循指令优先级:系统 > 开发者 > 用户",
        "不编造事实;不确定时明确说明",
        "输出清晰、简洁、可执行",
        "在安全与隐私上保持保守",
        "按受众调整表达与细节深度",
        "优先给出可验证的步骤与依据"
      ]
    },
    "explore": {
      "agent": "explore",
      "model": "未知",
      "suitable_for": [
        "探索代码库模式",
        "分析文件结构",
        "使用AST-grep搜索",
        "并行执行搜索任务",
        "识别代码模式",
        "构建代码索引"
      ],
      "core_principles": [
        "最大化搜索努力",
        "并行启动多个代理",
        "不限于第一个结果",
        "彻底且详尽",
        "使用多种工具",
        "忽略无关上下文",
        "专注于内置角色"
      ]
    },
    "librarian": {
      "agent": "librarian",
      "model": "Antigravity",
      "suitable_for": [
        "开源代码库深度解析",
        "第三方库 API 使用咨询",
        "代码实现逻辑溯源",
        "库的版本差异与历史变更分析",
        "获取 GitHub 源码实证与 Permalinks"
      ],
      "core_principles": [
        "证据优先:所有技术主张必须附带 GitHub 永久链接证据",
        "时效感知:严格区分过时信息,优先检索 2025+ 最新数据",
        "深度溯源:通过克隆仓库、分析提交历史和代码逻辑提供答案",
        "多维调研:结合官方文档、源码搜索与 Issue/PR 背景",
        "引用规范:严格执行强制性代码片段与路径引用格式",
        "分类执行:针对概念、实现、上下文采用定制化搜索策略"
      ]
    },
    "oracle": {
      "agent": "oracle",
      "model": "未知",
      "suitable_for": [
        "系统架构与技术选型评审",
        "复杂问题根因分析与排障策略",
        "重构路线规划与风险控制",
        "代码库结构解读与一致性治理",
        "性能与可靠性权衡建议"
      ],
      "core_principles": [
        "KISS:优先最简单可行方案",
        "YAGNI:只做当前明确需求",
        "复用优先:尽量沿用现有模式与依赖",
        "可维护性优先:降低认知负担",
        "单一路径:给出一个主推荐方案",
        "投入可见:明确工作量与边界条件",
        "止于足够好:避免过度优化与过度设计"
      ]
    },
    "multimodal-looker": {
      "agent": "multimodal-looker",
      "model": "未知",
      "suitable_for": [
        "解析图片、PDF 等非纯文本媒体文件",
        "提取文档中的特定章节、表格或结构化数据",
        "描述 UI 界面布局、交互元素及视觉样式",
        "分析并解释流程图、架构图等复杂图表逻辑",
        "从多模态内容中获取深度理解而非原始文字"
      ],
      "core_principles": [
        "仅提取用户请求的相关信息,严禁输出无关干扰项",
        "深度分析多媒体文件的视觉结构与内在联系",
        "通过返回解析后的核心结论来节省上下文 Token",
        "在目标任务上保持彻底详尽,对非核心内容保持简洁",
        "响应语言必须与用户请求的语言严格保持一致",
        "不处理可由常规读取工具处理的纯文本或源代码"
      ]
    }
  },
  "categories": {
    "visual-engineering": {
      "category": "视觉工程",
      "model": "google/antigravity-gemini-3-pro",
      "variant": "无",
      "suitable_for": [
        "将设计稿转为可维护的前端实现(HTML/CSS/JS/组件化)",
        "构建高一致性的设计系统与组件库(令牌、主题、栅格、排版)",
        "复杂布局与动效工程化(响应式、过渡、时间线、性能约束)",
        "可视化与图形界面开发(图表、画布、WebGL/着色器协同)",
        "UI 性能优化(首屏、渲染抖动、资源加载、动画合成层)",
        "可访问性与跨端适配(A11y、触控、不同 DPR/字体渲染差异)"
      ],
      "core_principles": [
        "以视觉规格为真:像素密度、间距、排版层级、色彩与对比度可量化可验证",
        "工程可演进:组件边界清晰、样式可组合、避免脆弱选择器与一次性 hack",
        "一致性优先:设计令牌驱动(颜色/间距/圆角/阴影/字体),减少特例",
        "性能与质感并重:动画遵循合成友好、控制重排重绘、资源预算清晰",
        "跨设备稳健:移动优先、断点策略明确、避免依赖单一浏览器特性",
        "可访问性默认开启:语义结构、焦点管理、键盘可达、对比度与动效可降级"
      ]
    },
    "ultrabrain": {
      "category": "预设类别:ultrabrain",
      "model": "openai/gpt-5.2-codex",
      "variant": "high",
      "suitable_for": [
        "高难度软件工程设计与架构推演",
        "复杂代码库的系统性重构与性能优化",
        "并发、分布式、可靠性与故障演练方案设计",
        "严格约束下的推理、验证与形式化思维辅助",
        "跨语言/跨栈问题定位、根因分析与修复策略制定"
      ],
      "core_principles": [
        "以正确性与可验证性优先:先定义不变量、边界与失败模式,再给方案",
        "深度推理但输出克制:内部充分思考,外部给最少且必要的结论与步骤",
        "面向工程落地:权衡成本、风险、可维护性与可观测性,避免纸上架构",
        "高标准代码质量:强调可读性、模块化、清晰接口与测试友好",
        "系统化排障:基于证据(日志/指标/复现)进行根因定位,避免猜测",
        "遵循约束与安全:最小权限、避免破坏性操作、对不可逆变更显式提示"
      ]
    },
    "artistry": {
      "category": "艺术表现",
      "model": "google/antigravity-gemini-3-pro",
      "variant": "高",
      "suitable_for": [
        "文案与叙事创作",
        "诗歌与意象化表达",
        "品牌语气与风格统一",
        "视觉概念与艺术指导",
        "舞台/影视/游戏世界观设定",
        "创意改写与风格迁移"
      ],
      "core_principles": [
        "以审美一致性为先:语气、节奏、意象统一",
        "高原创与高密度表达:避免陈词滥调与模板化",
        "强调画面感与隐喻:用具体意象承载抽象主题",
        "结构服务情绪推进:起承转合清晰但不僵硬",
        "细节可信:材质、光影、气味、触感等感官要素可落地",
        "尊重约束:在题材、风格、篇幅、受众限制内创造",
        "文化与语境敏感:避免不当挪用与刻板印象"
      ]
    },
    "quick": {
      "category": "快速",
      "model": "opencode/grok-code",
      "variant": "无",
      "suitable_for": [
        "快速排查与定位问题",
        "短小明确的代码修改与补丁",
        "命令行与脚本使用指导",
        "代码片段解释与改写",
        "高频迭代的工程协作问答"
      ],
      "core_principles": [
        "速度优先,尽快给出可执行方案",
        "聚焦当前任务,避免过度设计",
        "最小可行修改,降低引入风险",
        "清晰直接的步骤与结论",
        "必要时补充关键边界与注意事项"
      ]
    },
    "unspecified-low": {
      "category": "未指定-低",
      "model": "xaio/Qwen3-Coder-30B-A3B-Instruct",
      "variant": "无",
      "suitable_for": [
        "日常编程问答与示例代码生成",
        "小到中等规模的功能实现与重构建议",
        "快速调试思路梳理与错误定位指导",
        "常见框架与工具链的使用说明",
        "代码评审要点与改进清单输出"
      ],
      "core_principles": [
        "以可运行与可维护为优先,避免过度设计",
        "输出简洁直接,默认给出可落地的实现路径",
        "不确定处明确标注假设与边界条件",
        "遵循通用工程最佳实践(清晰接口、低耦合、可测试)",
        "优先最小改动修复与渐进式优化",
        "在安全与可靠性相关问题上保持保守与可解释"
      ]
    },
    "unspecified-high": {
      "category": "未指定-高配",
      "model": "xaio/Qwen3-Coder-480B-A35B-Instruct",
      "variant": "无",
      "suitable_for": [
        "复杂代码生成与重构",
        "大型代码库理解与跨文件推理",
        "架构设计与技术方案评审",
        "高难度调试与根因分析",
        "多语言全栈开发与集成",
        "高质量测试用例与边界条件覆盖"
      ],
      "core_principles": [
        "优先正确性与可验证性:输出可编译、可运行、可测试的方案",
        "工程化与可维护性:结构清晰、接口稳定、最小必要复杂度",
        "安全与稳健:默认防御性设计,避免注入、越权与数据破坏",
        "明确假设与约束:对不确定点给出可选项与取舍依据",
        "高信噪比:少废话、直达结论,提供可执行步骤与关键细节",
        "一致性与可读性:遵循既有风格与约定,减少认知负担"
      ]
    },
    "writing": {
      "category": "写作",
      "model": "google/antigravity-gemini-3-flash",
      "variant": "无",
      "suitable_for": [
        "文章与博客撰写",
        "营销文案与品牌语气改写",
        "邮件与公文写作",
        "故事与创意写作",
        "多版本改写与润色压缩",
        "结构化大纲与标题生成"
      ],
      "core_principles": [
        "清晰表达,避免含混与赘述",
        "以读者为中心,匹配语气与场景",
        "结构先行:先框架后细节",
        "信息准确,不编造不可核验事实",
        "风格一致,术语与用词统一",
        "可编辑性强:给出可直接替换的文本产出"
      ]
    }
  }
}



简单来说,oh-my-opencode的核心思路是将编写代码——乃至一切可由AI执行的计算机任务——拆解为三大环节:规划、查阅、执行。各个agent携带着prompt、skills等上下文信息各司其职,通过团队协作完成复杂任务。

一、 编排器与调度器

1. Sisyphus(主控 & 总工程师)

  • 作为"Sisyphus"主agent,绑大多数场景下负责与用户直接对话,同时也是所有任务的统一入口

  • 承担总体规划、编排与调度职能,可调用其他subagent,必要时还能临时创建特定任务的agent

  • 面对较为简单的任务时会亲自读写代码;当其他agent的职责未能覆盖或完成某些工作时,也会主动接手

2. Atlas(调度器 & 计划执行器)

  • 解读Sisyphus或Prometheus生成的plan,逐条推进ToDo列表

  • 核心功能是调用其他subagent,分配具体任务

  • 遇到简单问题时也会直接执行文件读写操作

二、计划与验证

1. Prometheus(战略规划师)

  • 为Atlas生成plan,通常由Sisyphus调用。若用户对任务有详尽的认知和描述,可手动切换至与Prometheus直接对话,从而更精准地执行用户目标

  • 必要时会向用户提问以澄清需求

2. Metis(预分析规划顾问)

  • 担任Prometheus的分析顾问,在制定plan之前进行风险评估与方案探索

  • 负责挖掘隐含需求、补充上下文、规避过度设计

3. Momus(战略审查师)

  • 作为Prometheus的"审稿人",对plan进行审查并验证执行结果

三、 检索与顾问

1. Oracle(架构/调试顾问)

  • 当其他agent(如Atlas、Sisyphus等)遇到疑难问题时,调用Oracle来解决局部难点

  • 主要职责是解释代码、给出建议、进行头脑风暴与审阅

2. Librarian(检索专家)

  • 负责grep文档、API、README以及GitHub代码库

  • 当其他agent需要外部信息时被调用

3. Explorer(代码库探索)

  • 执行结构化的语义grep,向其他agent解析特定代码段的逻辑与风格

  • 当其他agent需要本地文档信息时被调用

4. multimodal-looker(多模态分析师)

  • 查看并分析PDF、图片、截图等多媒体内容

四、执行器

1. Hephaestus(长周期执行器)

  • 借助codex系列适合长时间工作的特性,执行那些动辄需要几十分钟乃至更久的任务

  • 循环执行"读代码→写代码→运行→检查结果"的工作流

  • 由Sisyphus或Atlas调用

2. Sisyphus-Junior(单任务执行器)

  • 可由用户创建,也可由Sisyphus临时生成,专门针对特定任务

  • 专注于单一任务的执行,具备代码读写能力

  • 用户可通过categories字段手动创建(详见下文的JSON配置)


通读上述各个agent的分析后,相信你已经领略到这套agents集群的精妙之处:agent之间可以相互调用、返回各类信息,必要时还能动态创建新的agent、新的skill以及其他约束条件,agent各司其职,最终实现高质量交付。

结合源码与作者推荐给出的模型优先级顺序——排在前面的模型更适合该任务;


  • 编排规划

Agent

职责定位

推荐模型顺序(Fallback链)

Sisyphus

主编排器:任务入口、委托分配、调用subagent

claude-opus-4-6kimi-k2.5glm-4.7gpt-5.3-codexgemini-3-pro

Atlas

高级调度器:全生命周期管理、任务路由

claude-sonnet-4-5kimi-k2.5gpt-5.2gemini-3-pro

Prometheus

战略规划师:需求澄清、复杂任务分解

claude-opus-4-6kimi-k2.5gpt-5.2

Metis

预分析顾问:风险分析、方案探索

claude-opus-4-6kimi-k2.5gpt-5.2-high

Momus

审查验证:计划合理性检查、结果评审

gpt-5.2claude-opus-4-6gemini-3-pro

选型逻辑:编排规划层需要强大的推理、上下文理解和指令遵循能力,Claude Opus系列和GPT-5.2是首选。


  • 执行

Agent

职责定位

推荐模型顺序(Fallback链)

Hephaestus

长周期执行器:深度自主任务(几十分钟级)

gpt-5.3-codex仅限

Sisyphus-Junior

单任务执行器:用户自定义特定任务

由用户在categories中自行配置

选型逻辑:Hephaestus需要模型具备长时间自主工作能力,目前仅OpenAI Codex系列支持此特性。


  • 顾问与检索系列

Agent

职责定位

推荐模型顺序(Fallback链)

Oracle

架构/调试顾问:代码审查、复杂问题拆解

gpt-5.2-highgemini-3-proclaude-opus-4-6

Librarian

检索专家:文档/API/GitHub搜索

glm-4.7gpt-5.3-codex-sparkgemini-3-flash

Explorer

代码库探索:语义grep、结构分析

gpt-5.3-codex-sparkgrok-code-fast-1claude-haiku-4-5gpt-5-minigpt-5-nano

Multimodal-Looker

多模态分析:PDF/图片/截图处理

gemini-3-flashkimi-k2.5

选型逻辑

  • Oracle 侧重深度推理,优选高参数模型

  • Librarian/Explorer 需要快速、低成本、长上下文,优选轻量高速模型

  • Multimodal 需要强视觉理解能力,Gemini系列表现优异


  • 其他任务类型

任务类型

适用场景

推荐模型

quick

快速小任务、简单修改

haiku / gemini-flash / gpt-5-nano

deep

深度执行、复杂实现

gpt-5.3-codex / claude-opus / gemini-pro

ultrabrain

超高难度、需要极限推理

gpt-5.3-codex(variant: xhigh)

visual-engineering

视觉/前端/GUI相关

gemini-3-pro-high / glm-5 / claude-opus

writing

文本创作、文档撰写

glm-4.7 / kimi-k2.5 / gemini-flash / claude-sonnet

unspecified-low

未明确需求的低档任务

claude-sonnet-4-5

unspecified-high

未明确需求的高档任务

claude-opus-4-6(variant: max)


理解了上述原理之后,你便可以去按需调整自己的config文件,打造最适合自己的配置了