GPT‑6 Sol、Luna来了:能力更强、价格更低,Codex怎么用?
OpenAI 发布了 GPT‑6 Sol 和 GPT‑6 Luna。继 Astra 之后,GPT‑6 家族有了面向更多日常工作的选择:Sol 处理复杂编程和专业任务,Luna 适合大量、目标清晰的工作。两款模型已经进入 Codex、ChatGPT Work 和 API。
这次更新吸引人的地方很直接:能力提高了,价格却降了。让 Codex 修一个 bug,它要读代码、找原因、修改、跑测试。第一次没修好,还得看着测试结果再来一轮。开发者关心的不只是它能不能修好,还包括修好这个问题要花多少时间、多少 token。比较 Sol、Luna 与 GPT‑5.6,也该把完成质量和整项任务的成本放在一起看。

01 Sol 和 Luna 的分工
GPT‑6 Sol 面向复杂编程和需要持续判断的任务。比如接手一个不熟悉的代码库,先弄清调用关系,再决定修改范围。GPT‑6 Luna 适合目标明确、调用频繁的工作。GPT‑6 Astra 仍是这一代能力最强的型号。
一个项目也可以按任务阶段选择模型:用 Sol 处理难定位的问题,再尝试让 Luna 完成范围清楚的步骤。是否这样分工,要看代码质量、完成时间和总费用,不能只看单次调用价格。
与 GPT‑5.6 相比,价格变化很直观。按每百万 token 的 API 标准价格计算:

- GPT‑5.6 Sol:输入 4 美元、输出 20 美元;GPT‑6 Sol:输入 2 美元、输出 10 美元。
- GPT‑5.6 Luna:输入 0.20 美元、输出 1.20 美元;GPT‑6 Luna:输入 0.10 美元、输出 0.50 美元。
价格降了,能力有没有跟上?先看复杂业务流程。AutomationBench 要求 Agent 使用 47 种工具,完成销售、市场、运营、客服等领域的整套任务。
GPT‑6 Sol 在 xhigh 推理强度下得分33.2%,单项任务的估算成本为 0.27 美元。
GPT‑6 Luna 在 high 强度下,比 GPT‑5.6 Luna提高 5.4 个百分点,单项任务成本降低 58%。这类测试的难点在于:模型需要自己决定下一步用什么工具,并把多个步骤接起来。

专业工作测试也显示了 Sol 的提升。在覆盖多个行业复杂流程的 Agents’ Last Exam 中,Sol 的最高成绩为56.4%。这不表示它能独立完成一半以上的真实岗位工作,却说明它已具备处理较长、多步骤任务的能力。真正落到公司业务里,仍需要把任务边界、资料来源和人工复核安排清楚。
02 写代码,强在能不能交付
编程模型最容易给人留下印象的是“写得快”。但在真实仓库里,代码能运行只是第一步:修改有没有越界,测试是否可靠,风格是否符合项目要求,都会影响它能否合并。
FrontierCode 把这些因素纳入评估。GPT‑6 Sol 在不同推理强度下,相比 GPT‑5.6 Sol,取得相近或更高成绩所需的任务成本明显降低。它在最高推理强度下得分49.3%,也达到了 Claude Fable 5.1 高强度档位附近的水平。

如果说 FrontierCode 更关注改动能否进入代码库,DeepSWE 则把 Agent 放进真实代码库,考察它解决复杂工程任务的能力。
GPT‑6 Sol 在 DeepSWE v1.1 的最高得分为68.8%,Luna 为66.6%。Luna 的表现尤其值得关注:一些修复和实现任务,现在可以先用成本更低的模型尝试,再根据测试结果决定是否需要更强的模型继续处理。

如果你正在选编程模型,可以把这两张图放在一起看:FrontierCode 看代码改完能否合并,DeepSWE 看它能否处理真实仓库里的复杂任务。分数之外,每项任务要花多少钱也得算进去。到了自己的项目里,还要看它需要返工几次、测试能不能过。这些比榜单上的最高分更能决定你会不会一直用它。
03 Sol 和 Luna 在 Codex 中如何搭配
可以从任务难度入手。需求还在变化、涉及多个模块,或者需要反复排错时,先让 Sol 处理;目标和步骤已经明确的批量工作,可以试试 Luna。这是一种值得测试的分工,最终还得看代码能否通过测试、需要返工几次。
编程任务一长,Codex 会反复用到仓库说明、先前的对话和工具指令。GPT‑6 改进了提示词缓存:调整推理强度或增减工具时,已有上下文仍有机会复用。缓存命中得越多,重复处理的输入就越少;实际能省多少,要看项目的使用情况
04 如何借助 OpenCSG 使用 Codex
GPT‑6 已经进入 Codex,但要在项目里用得顺手,还有几件事要解决:Codex 怎么装、复杂任务怎么让几个 Agent 分头做、工单和内部文档又怎么让它查到?OpenCSG 的几款产品可以用在这些环节。CSGLite 帮你安装和管理 Codex,CSGClaw 用来组织多 Agent 任务,CSGHub 则管理可通过 MCP 接入的团队工具。
CSGLite:快速启动工具
想在自己的电脑上使用 Codex,先要把工具安装、配置好。先是把工具用起来。CSGLite 的 AI Apps 页面支持安装、配置和运行 Codex,还能查看安装日志。开发者如果同时使用本地模型,也可以在 CSGLite 中下载、运行受支持的模型,并通过 AI 网关管理接口和用量。它管理的是 Codex 应用及相关工具环境。
平时还用 Claude Code、OpenCode 的开发者,可以在同一处找到这些应用,不用来回寻找入口。

CSGClaw:组织复杂多Agent任务
一个人让 Codex 修 bug,通常只需盯住这一次改动。任务涉及前后端、测试和文档时,进度就没那么容易看清了。CSGClaw 把协作过程放进浏览器工作区:Manager 接收需求、拆分任务,Worker 按职责执行。你可以进入会话看进展,必要时通过消息或 @ 提及参与讨论。执行任务时,CSGClaw 默认使用沙箱环境。

例如,一次跨前后端的功能改造,往往要查现有逻辑、修改接口、更新页面、补测试。单个 Agent 可以完成其中许多步骤,但任务一长,人就容易失去对进度的把握。CSGClaw 提供的是组织这些工作的方式:由 Manager 统筹,Worker 分担具体事项,用户在关键节点检查结果。CSGLite 与 CSGClaw 承接 Codex 的位置因此不同:前者方便把工具用起来,后者帮助组织多 Agent 执行复杂任务。
CSGHub:让 Codex 接入团队工具
有些问题,光读仓库找不到答案。需求可能留在工单里,接口约定写在内部文档中,失败原因则藏在测试日志里。团队可以把这些查询能力做成 MCP 服务,放到 CSGHub 中管理,再按 Codex 的 MCP 配置方式接入。这样,Agent 在动手改代码前,能先拿到解决问题所需的背景;改完之后,也能查询相关的测试结果。具体能访问哪些资料和工具,仍由团队配置的服务与权限决定。

一次开发任务做到最后,开发者最关心的还是问题有没有解决。CSGLite 让 Codex 更容易安装和管理;任务需要分工时,CSGClaw 帮你跟进各个 Agent 的工作;需要查询工单、文档或测试结果时,还可以将 CSGHub 管理的 MCP 服务配置到 Codex 中。把这些环节接好,再用真实任务比较 Sol 和 Luna 的完成质量、耗时与返工次数,才能看出 GPT‑6 在自己的项目里带来了什么变化。
05 关于OpenCSG
OpenCSG是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种AI原生方法论,由OpenCSG(开放传神)提出AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品CSGHub提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。

浙公网安备 33010602011771号