日常开发需求的时候,开发效果的好坏,很大程度上取决于模型本身的智能水平。模型越聪明,理解需求、补全上下文、处理复杂逻辑的能力就越强,这点毋庸置疑。
而我们使用AI开发的过程,其实就是透过自己的经验和理解,在不同的场景下应用不同的模型,而这份工作,本质上也是可以被ai取代的, oh-my-opencode的观点就是,设置一个代理人,帮助你干这份调用不同ai的工作,让你每天工作一个指令就能搞定所有任务,直到没有bug闭环。
马上要更新的Codemaker CLI也是基于Opencode fork开发,可以不限量爽用更多的模型,所以算是提前预习一下原理和使用方式吧。
太长不看
我不想了解花里胡哨的,你能不能直接把配置给我交了?
有的,包有的。
(cc现在的封禁很严格所以最好找靠谱的中转站)
{
"$schema": "https://raw.githubusercontent.com/code-yeongyu/oh-my-opencode/master/assets/oh-my-opencode.schema.json",
//来禁用某个特定代理
// "disabled_agents": ["oracle", "multimodal-looker"],
"agents": {
// ======================
// 1. 编排规划与验证
// ======================
"sisyphus": {
// 主编排器:委托任务编排分配、TODO、后台并行、动态组合技能,调用subagent
// fallback:claude-opus-4-6 → kimi-k2.5 → glm-4.7 → gpt-5.3-codex → gemini-3-pro
"model": "claude/claude-opus-4-6",
"temperature": 0.1
},
"atlas": {
// 高级编排器:全生命周期管理,任务路由,基于skills调度,全局会话级别的编排器,一般由内部逻辑/hook唤起
// fallback:claude-sonnet-4-5 → kimi-k2.5 → gpt-5.2 → gemini-3-pro
"model": "claude/claude-sonnet-4-5",
"temperature": 0.1
},
"prometheus": {
// 战略规划:澄清需求、验证计划、复杂任务分解,推荐内部plan而不是和用户直接交互
// fallback:claude-opus-4-6 → kimi-k2.5 → gpt-5.2
"model": "claude/claude-opus-4-6",
"temperature": 0.1
},
"metis": {
// 预分析规划顾问:正式plan/执行前进行问题理解、风险与上下文分析,温度略高,探索更多方案
// fallback:claude-opus-4-6 → kimi-k2.5 → gpt-5.2-high
"model": "anthropic/claude-opus-4-6",
"temperature": 0.3,
"variant": "max"
},
"momus": {
// 计划与结果验证:对计划/方案进行合理性检查和评审
// gpt-5.2 → claude-opus-4-6 → gemini-3-pro
"model": "openai/gpt-5.2",
"temperature": 0.1,
"variant": "medium"
},
// ======================
// 2. 执行
// ======================
"hephaestus": {
// 深度自主工作专用,长周期,深度任务
// 只推荐OpenAIcodex模型,如果没有codex则不会使用这个agent
"model": "openai/gpt-5.3-codex",
"temperature": 0.1
},
// ======================
// 3. 顾问与检索
// ======================
"oracle": {
// 咨询/调试/架构专家:代码审查、复杂问题拆解,交互式问答
// fallback:gpt-5.2-high → gemini-3-pro → claude-opus-4-6
"model": "openai/gpt-5.2",
"temperature": 0.1,
"variant": "high"
},
"librarian": {
// 文档/仓库检索专家:文档/README/API 手册/GitHub 仓库搜索,大量输入,需要快速便宜长上下文的模型
// fallback:glm-4.7 → gpt-5.3-codex-spark → gemini-3-flash
"model": "openai/gpt-5.3-codex-spark"
},
"explore": {
// 快速代码库探索:grep(上下文感知搜索)
// fallback:gpt-5.3-codex-spark → grok-code-fast-1 → claude-haiku-4-5 → gpt-5-mini → gpt-5-nano
"model": "openai/gpt-5.3-codex-spark"
},
"multimodal-looker": {
// 多模态分析:PDF/图片分析,多模态好的模型
// fallback:gemini-3-flash → kimi-k2.5
"model": "gemini/gemini-3-pro-preview"
}
},
"categories": {
// 快速小活:haiku / gemini-flash / nano
"quick": { "model": "openai/gpt-5.3-codex-spark", "temperature": 0.1 },
// 深度执行:codex / opus / gemini-pro
"deep": { "model": "openai/gpt-5.3-codex", "variant": "medium", "temperature": 0.1 },
// 超大脑:codex xhigh(更激进)
"ultrabrain": { "model": "openai/gpt-5.3-codex", "variant": "xhigh", "temperature": 0.1 },
// 视觉/前端/GUI:gemini-pro-high / glm-5 / opus
"visual-engineering": { "model": "google/gemini-3-pro-preview", "temperature": 0.1 },
// 文本/写作:glm4.7 / k2.5 / gemini-flash / sonnet
"writing": { "model": "gemini/gemini-3-pro-preview", "temperature": 0.2 },
// 未指定低/高档位
"unspecified-low": { "model": "claude/claude-sonnet-4-5", "temperature": 0.1 },
"unspecified-high": { "model": "claude/claude-opus-4-6", "variant": "max", "temperature": 0.1 }
}
}
架构设计
首先简要梳理一下最新版本的agents集群架构。
让Opencode自己输出的agent职责,内容如下:
{
"agents": {
"build": {
"agent": "build",
"model": "未知",
"suitable_for": [
"代码实现与重构",
"Bug 定位与修复",
"单元测试与测试策略",
"构建与CI排障",
"项目结构与可维护性优化"
],
"core_principles": [
"先澄清需求与边界",
"最小改动达成目标",
"保持一致性与可读性",
"优先可靠性与可测试性",
"避免过度设计(YAGNI)",
"减少重复(DRY)",
"遵循SOLID与KISS"
]
},
"plan": {
"agent": "plan",
"model": "未知",
"suitable_for": [
"需求澄清与范围界定",
"技术方案设计与权衡",
"任务拆解与里程碑规划",
"风险识别与应对预案",
"验收标准与测试策略制定"
],
"core_principles": [
"先理解问题再提出方案",
"以最小可行改动达成目标",
"优先降低风险与不确定性",
"明确假设、边界与验收标准",
"可执行、可验证、可回滚",
"沟通简洁且信息密度高"
]
},
"general": {
"agent": "general",
"model": "未知",
"suitable_for": [
"通用问答与信息整理",
"编程概念解释与示例",
"需求澄清与方案对比",
"写作润色与结构化输出",
"基础调试思路与排错建议"
],
"core_principles": [
"遵循指令优先级:系统 > 开发者 > 用户",
"不编造事实;不确定时明确说明",
"输出清晰、简洁、可执行",
"在安全与隐私上保持保守",
"按受众调整表达与细节深度",
"优先给出可验证的步骤与依据"
]
},
"explore": {
"agent": "explore",
"model": "未知",
"suitable_for": [
"探索代码库模式",
"分析文件结构",
"使用AST-grep搜索",
"并行执行搜索任务",
"识别代码模式",
"构建代码索引"
],
"core_principles": [
"最大化搜索努力",
"并行启动多个代理",
"不限于第一个结果",
"彻底且详尽",
"使用多种工具",
"忽略无关上下文",
"专注于内置角色"
]
},
"librarian": {
"agent": "librarian",
"model": "Antigravity",
"suitable_for": [
"开源代码库深度解析",
"第三方库 API 使用咨询",
"代码实现逻辑溯源",
"库的版本差异与历史变更分析",
"获取 GitHub 源码实证与 Permalinks"
],
"core_principles": [
"证据优先:所有技术主张必须附带 GitHub 永久链接证据",
"时效感知:严格区分过时信息,优先检索 2025+ 最新数据",
"深度溯源:通过克隆仓库、分析提交历史和代码逻辑提供答案",
"多维调研:结合官方文档、源码搜索与 Issue/PR 背景",
"引用规范:严格执行强制性代码片段与路径引用格式",
"分类执行:针对概念、实现、上下文采用定制化搜索策略"
]
},
"oracle": {
"agent": "oracle",
"model": "未知",
"suitable_for": [
"系统架构与技术选型评审",
"复杂问题根因分析与排障策略",
"重构路线规划与风险控制",
"代码库结构解读与一致性治理",
"性能与可靠性权衡建议"
],
"core_principles": [
"KISS:优先最简单可行方案",
"YAGNI:只做当前明确需求",
"复用优先:尽量沿用现有模式与依赖",
"可维护性优先:降低认知负担",
"单一路径:给出一个主推荐方案",
"投入可见:明确工作量与边界条件",
"止于足够好:避免过度优化与过度设计"
]
},
"multimodal-looker": {
"agent": "multimodal-looker",
"model": "未知",
"suitable_for": [
"解析图片、PDF 等非纯文本媒体文件",
"提取文档中的特定章节、表格或结构化数据",
"描述 UI 界面布局、交互元素及视觉样式",
"分析并解释流程图、架构图等复杂图表逻辑",
"从多模态内容中获取深度理解而非原始文字"
],
"core_principles": [
"仅提取用户请求的相关信息,严禁输出无关干扰项",
"深度分析多媒体文件的视觉结构与内在联系",
"通过返回解析后的核心结论来节省上下文 Token",
"在目标任务上保持彻底详尽,对非核心内容保持简洁",
"响应语言必须与用户请求的语言严格保持一致",
"不处理可由常规读取工具处理的纯文本或源代码"
]
}
},
"categories": {
"visual-engineering": {
"category": "视觉工程",
"model": "google/antigravity-gemini-3-pro",
"variant": "无",
"suitable_for": [
"将设计稿转为可维护的前端实现(HTML/CSS/JS/组件化)",
"构建高一致性的设计系统与组件库(令牌、主题、栅格、排版)",
"复杂布局与动效工程化(响应式、过渡、时间线、性能约束)",
"可视化与图形界面开发(图表、画布、WebGL/着色器协同)",
"UI 性能优化(首屏、渲染抖动、资源加载、动画合成层)",
"可访问性与跨端适配(A11y、触控、不同 DPR/字体渲染差异)"
],
"core_principles": [
"以视觉规格为真:像素密度、间距、排版层级、色彩与对比度可量化可验证",
"工程可演进:组件边界清晰、样式可组合、避免脆弱选择器与一次性 hack",
"一致性优先:设计令牌驱动(颜色/间距/圆角/阴影/字体),减少特例",
"性能与质感并重:动画遵循合成友好、控制重排重绘、资源预算清晰",
"跨设备稳健:移动优先、断点策略明确、避免依赖单一浏览器特性",
"可访问性默认开启:语义结构、焦点管理、键盘可达、对比度与动效可降级"
]
},
"ultrabrain": {
"category": "预设类别:ultrabrain",
"model": "openai/gpt-5.2-codex",
"variant": "high",
"suitable_for": [
"高难度软件工程设计与架构推演",
"复杂代码库的系统性重构与性能优化",
"并发、分布式、可靠性与故障演练方案设计",
"严格约束下的推理、验证与形式化思维辅助",
"跨语言/跨栈问题定位、根因分析与修复策略制定"
],
"core_principles": [
"以正确性与可验证性优先:先定义不变量、边界与失败模式,再给方案",
"深度推理但输出克制:内部充分思考,外部给最少且必要的结论与步骤",
"面向工程落地:权衡成本、风险、可维护性与可观测性,避免纸上架构",
"高标准代码质量:强调可读性、模块化、清晰接口与测试友好",
"系统化排障:基于证据(日志/指标/复现)进行根因定位,避免猜测",
"遵循约束与安全:最小权限、避免破坏性操作、对不可逆变更显式提示"
]
},
"artistry": {
"category": "艺术表现",
"model": "google/antigravity-gemini-3-pro",
"variant": "高",
"suitable_for": [
"文案与叙事创作",
"诗歌与意象化表达",
"品牌语气与风格统一",
"视觉概念与艺术指导",
"舞台/影视/游戏世界观设定",
"创意改写与风格迁移"
],
"core_principles": [
"以审美一致性为先:语气、节奏、意象统一",
"高原创与高密度表达:避免陈词滥调与模板化",
"强调画面感与隐喻:用具体意象承载抽象主题",
"结构服务情绪推进:起承转合清晰但不僵硬",
"细节可信:材质、光影、气味、触感等感官要素可落地",
"尊重约束:在题材、风格、篇幅、受众限制内创造",
"文化与语境敏感:避免不当挪用与刻板印象"
]
},
"quick": {
"category": "快速",
"model": "opencode/grok-code",
"variant": "无",
"suitable_for": [
"快速排查与定位问题",
"短小明确的代码修改与补丁",
"命令行与脚本使用指导",
"代码片段解释与改写",
"高频迭代的工程协作问答"
],
"core_principles": [
"速度优先,尽快给出可执行方案",
"聚焦当前任务,避免过度设计",
"最小可行修改,降低引入风险",
"清晰直接的步骤与结论",
"必要时补充关键边界与注意事项"
]
},
"unspecified-low": {
"category": "未指定-低",
"model": "xaio/Qwen3-Coder-30B-A3B-Instruct",
"variant": "无",
"suitable_for": [
"日常编程问答与示例代码生成",
"小到中等规模的功能实现与重构建议",
"快速调试思路梳理与错误定位指导",
"常见框架与工具链的使用说明",
"代码评审要点与改进清单输出"
],
"core_principles": [
"以可运行与可维护为优先,避免过度设计",
"输出简洁直接,默认给出可落地的实现路径",
"不确定处明确标注假设与边界条件",
"遵循通用工程最佳实践(清晰接口、低耦合、可测试)",
"优先最小改动修复与渐进式优化",
"在安全与可靠性相关问题上保持保守与可解释"
]
},
"unspecified-high": {
"category": "未指定-高配",
"model": "xaio/Qwen3-Coder-480B-A35B-Instruct",
"variant": "无",
"suitable_for": [
"复杂代码生成与重构",
"大型代码库理解与跨文件推理",
"架构设计与技术方案评审",
"高难度调试与根因分析",
"多语言全栈开发与集成",
"高质量测试用例与边界条件覆盖"
],
"core_principles": [
"优先正确性与可验证性:输出可编译、可运行、可测试的方案",
"工程化与可维护性:结构清晰、接口稳定、最小必要复杂度",
"安全与稳健:默认防御性设计,避免注入、越权与数据破坏",
"明确假设与约束:对不确定点给出可选项与取舍依据",
"高信噪比:少废话、直达结论,提供可执行步骤与关键细节",
"一致性与可读性:遵循既有风格与约定,减少认知负担"
]
},
"writing": {
"category": "写作",
"model": "google/antigravity-gemini-3-flash",
"variant": "无",
"suitable_for": [
"文章与博客撰写",
"营销文案与品牌语气改写",
"邮件与公文写作",
"故事与创意写作",
"多版本改写与润色压缩",
"结构化大纲与标题生成"
],
"core_principles": [
"清晰表达,避免含混与赘述",
"以读者为中心,匹配语气与场景",
"结构先行:先框架后细节",
"信息准确,不编造不可核验事实",
"风格一致,术语与用词统一",
"可编辑性强:给出可直接替换的文本产出"
]
}
}
}
简单来说,oh-my-opencode的核心思路是将编写代码——乃至一切可由AI执行的计算机任务——拆解为三大环节:规划、查阅、执行。各个agent携带着prompt、skills等上下文信息各司其职,通过团队协作完成复杂任务。
一、 编排器与调度器
1. Sisyphus(主控 & 总工程师)
-
作为"Sisyphus"主agent,绑大多数场景下负责与用户直接对话,同时也是所有任务的统一入口
-
承担总体规划、编排与调度职能,可调用其他subagent,必要时还能临时创建特定任务的agent
-
面对较为简单的任务时会亲自读写代码;当其他agent的职责未能覆盖或完成某些工作时,也会主动接手
2. Atlas(调度器 & 计划执行器)
-
解读Sisyphus或Prometheus生成的plan,逐条推进ToDo列表
-
核心功能是调用其他subagent,分配具体任务
-
遇到简单问题时也会直接执行文件读写操作
二、计划与验证
1. Prometheus(战略规划师)
-
为Atlas生成plan,通常由Sisyphus调用。若用户对任务有详尽的认知和描述,可手动切换至与Prometheus直接对话,从而更精准地执行用户目标
-
必要时会向用户提问以澄清需求
2. Metis(预分析规划顾问)
-
担任Prometheus的分析顾问,在制定plan之前进行风险评估与方案探索
-
负责挖掘隐含需求、补充上下文、规避过度设计
3. Momus(战略审查师)
-
作为Prometheus的"审稿人",对plan进行审查并验证执行结果
三、 检索与顾问
1. Oracle(架构/调试顾问)
-
当其他agent(如Atlas、Sisyphus等)遇到疑难问题时,调用Oracle来解决局部难点
-
主要职责是解释代码、给出建议、进行头脑风暴与审阅
2. Librarian(检索专家)
-
负责grep文档、API、README以及GitHub代码库
-
当其他agent需要外部信息时被调用
3. Explorer(代码库探索)
-
执行结构化的语义grep,向其他agent解析特定代码段的逻辑与风格
-
当其他agent需要本地文档信息时被调用
4. multimodal-looker(多模态分析师)
-
查看并分析PDF、图片、截图等多媒体内容
四、执行器
1. Hephaestus(长周期执行器)
-
借助codex系列适合长时间工作的特性,执行那些动辄需要几十分钟乃至更久的任务
-
循环执行"读代码→写代码→运行→检查结果"的工作流
-
由Sisyphus或Atlas调用
2. Sisyphus-Junior(单任务执行器)
-
可由用户创建,也可由Sisyphus临时生成,专门针对特定任务
-
专注于单一任务的执行,具备代码读写能力
-
用户可通过categories字段手动创建(详见下文的JSON配置)
通读上述各个agent的分析后,相信你已经领略到这套agents集群的精妙之处:agent之间可以相互调用、返回各类信息,必要时还能动态创建新的agent、新的skill以及其他约束条件,agent各司其职,最终实现高质量交付。
结合源码与作者推荐给出的模型优先级顺序——排在前面的模型更适合该任务;
-
编排规划
|
Agent |
职责定位 |
推荐模型顺序(Fallback链) |
|---|---|---|
|
Sisyphus |
主编排器:任务入口、委托分配、调用subagent |
claude-opus-4-6 → kimi-k2.5 → glm-4.7 → gpt-5.3-codex → gemini-3-pro |
|
Atlas |
高级调度器:全生命周期管理、任务路由 |
claude-sonnet-4-5 → kimi-k2.5 → gpt-5.2 → gemini-3-pro |
|
Prometheus |
战略规划师:需求澄清、复杂任务分解 |
claude-opus-4-6 → kimi-k2.5 → gpt-5.2 |
|
Metis |
预分析顾问:风险分析、方案探索 |
claude-opus-4-6 → kimi-k2.5 → gpt-5.2-high |
|
Momus |
审查验证:计划合理性检查、结果评审 |
gpt-5.2 → claude-opus-4-6 → gemini-3-pro |
选型逻辑:编排规划层需要强大的推理、上下文理解和指令遵循能力,Claude Opus系列和GPT-5.2是首选。
-
执行
|
Agent |
职责定位 |
推荐模型顺序(Fallback链) |
|---|---|---|
|
Hephaestus |
长周期执行器:深度自主任务(几十分钟级) |
gpt-5.3-codex(仅限) |
|
Sisyphus-Junior |
单任务执行器:用户自定义特定任务 |
由用户在categories中自行配置 |
选型逻辑:Hephaestus需要模型具备长时间自主工作能力,目前仅OpenAI Codex系列支持此特性。
-
顾问与检索系列
|
Agent |
职责定位 |
推荐模型顺序(Fallback链) |
|---|---|---|
|
Oracle |
架构/调试顾问:代码审查、复杂问题拆解 |
gpt-5.2-high → gemini-3-pro → claude-opus-4-6 |
|
Librarian |
检索专家:文档/API/GitHub搜索 |
glm-4.7 → gpt-5.3-codex-spark → gemini-3-flash |
|
Explorer |
代码库探索:语义grep、结构分析 |
gpt-5.3-codex-spark → grok-code-fast-1 → claude-haiku-4-5 → gpt-5-mini → gpt-5-nano |
|
Multimodal-Looker |
多模态分析:PDF/图片/截图处理 |
gemini-3-flash → kimi-k2.5 |
选型逻辑:
Oracle 侧重深度推理,优选高参数模型
Librarian/Explorer 需要快速、低成本、长上下文,优选轻量高速模型
Multimodal 需要强视觉理解能力,Gemini系列表现优异
-
其他任务类型
|
任务类型 |
适用场景 |
推荐模型 |
|---|---|---|
|
quick |
快速小任务、简单修改 |
haiku / gemini-flash / gpt-5-nano |
|
deep |
深度执行、复杂实现 |
gpt-5.3-codex / claude-opus / gemini-pro |
|
ultrabrain |
超高难度、需要极限推理 |
gpt-5.3-codex(variant: xhigh) |
|
visual-engineering |
视觉/前端/GUI相关 |
gemini-3-pro-high / glm-5 / claude-opus |
|
writing |
文本创作、文档撰写 |
glm-4.7 / kimi-k2.5 / gemini-flash / claude-sonnet |
|
unspecified-low |
未明确需求的低档任务 |
claude-sonnet-4-5 |
|
unspecified-high |
未明确需求的高档任务 |
claude-opus-4-6(variant: max) |
理解了上述原理之后,你便可以去按需调整自己的config文件,打造最适合自己的配置了
浙公网安备 33010602011771号