Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案

大家好,我是程序员天天困。

很多人想 Codex 接入 DeepSeek-V4-Flash,图的是便宜 Agent 大脑。我之前写过成绩单拆解:DeepSeek V4 Flash 正式版:成绩碾压 Pro 预览版,白菜价——Agent 能打、价格白菜、还原生 Responses API,确实适合塞进 Codex。

硬伤也得说清:DeepSeek-V4-Flash 是纯文本模型,不能像多模态模型那样直接读图。 你扔张 UI 截图,让它「看看图里写了什么」,它识别不出来。

那有没有办法:一边用 Flash 做便宜又强的推理,一边让 Codex 还能处理图像?还真有。下面手把手把 CLI 和桌面端配通,再给两套识图方案。

点个收藏,咱们开始~

一、先准备 DeepSeek API Key

Codex 接第三方模型,第一步永远是 Key,不是改配置文件。

打开 DeepSeek 开放平台 注册登录,进入 API keys,新建一把 Key。创建时完整字符串只显示一次,当场复制存好;丢了只能作废重建。

Flash 输出约 2 元 / 百万 token,个人日常写码一般够用。

二、Codex CLI 配置 DeepSeek

Codex CLI:OpenAI 出的终端侧 AI 编程助手,你在项目目录里跟它对话,它能读写文件、跑命令、改代码。你可以把它理解成「住在终端里的结对程序员」。

先确保本机有 Node.js,没有就去官网装个 LTS。然后全局安装:

npm install -g @openai/codex

装完输入 codex 能进对话界面就算成。首次启动会要你登录 OpenAI 账号——没订阅也没关系,接下来我们直接切到 DeepSeek。

重要前置:CLI 或桌面端至少启动过一次,让 ~/.codex(Windows 是 %USERPROFILE%\.codex\)目录先生成出来。官方脚本要往里面写文件,目录不存在会直接翻车。

1)一键脚本(推荐)

官方文档 写明:目前只有 deepseek-v4-flash 支持接 Codex;deepseek-v4-pro 预计 2026 年 8 月初跟上。

Windows 用 PowerShell:

irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

Mac / Linux:

bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)

脚本起来后选模型(Flash 选对应序号)

再粘贴 API Key。它会备份旧配置、写 models.json、改 config.toml,还做语法校验——写坏了会中止,不会把你现有 MCP、项目信任配置整没。

可能有人会问:以前改个 Base URL 为什么老 404?

以前卡在协议。Codex 走 Responses API,不少国内接口只聊 Chat Completions,两边不是同一套方言。Flash 这次原生支持 Responses,wire_api = "responses" 就能直连,不必再起本地协议翻译层。

配置完重开 Codex,启动横幅出现 deepseek-v4-flash(或你选的模型名),就说明 CLI 配通了。

2)不想跑脚本就手动改

两步。第一步在 ~/.codex/ 下建 models.json,内容直接复制官方文档展开块(里面带 Flash / Pro 元数据:百万级上下文、low/high/max 推理档等)。

第二步编辑同目录 config.toml

model = "deepseek-v4-flash"
model_provider = "deepseek"
preferred_auth_method = "apikey"
forced_login_method = "api"
model_reasoning_effort = "high"
model_catalog_json = "~/.codex/models.json"

[model_providers.deepseek]
name = "deepseek"
base_url = "https://api.deepseek.com/"
wire_api = "responses"
experimental_bearer_token = "<你的 DeepSeek API Key>"

关键就一行:wire_api = "responses"。Token 换成自己的 Key。保存后重启 Codex,效果和脚本一致。

想切回官方模型,再跑一遍脚本,菜单里选恢复即可。

三、Codex 桌面端换模型不用重配

ChatGPT / Codex 桌面端、VS Code 的 Codex 插件,跟 CLI 读的是同一套 ~/.codex 你在 CLI 配好 Flash,桌面端一般不用再填一遍。

打开桌面端后,模型选择器在 Mac 上常显示为 Custom;Windows 上可能是 Custom,也可能直接显示 DeepSeek-V4-Flash。看到 Custom 别慌——实际跑的就是你在配置里指定的 DeepSeek 模型。

有个小坑我踩过:切到第三方 API 之后,以前用 ChatGPT 订阅攒的会话列表像「消失」了。其实没删,只是 Codex 按登录方式分组展示。恢复旧配置,旧会话回来;DeepSeek 会话则反过来隐藏。换完记得重启客户端。

到这里,Codex 接入 DeepSeek-V4-Flash 的主链路算走通了:CLI 写代码、桌面端聊需求,账单走 DeepSeek。

四、Flash 为啥自己看不了图

官方 models.json 里写得很直白:Flash 的 input_modalities 只有 textsupports_image_detail_original 为 false。翻译成人话——眼睛没装,不是你不会用。

编程场景里看图其实挺刚需:对照 Figma 截图还原布局、根据报错弹窗找原因、读一下产品给的 UI 稿。主模型继续用 Flash 省钱没问题,但「看」这件事得外包。

思路像工地分工:Flash 当工头负责推理和改代码,旁边再雇一个专职看图的人,把画面翻译成文字交回去。下面两套方案,本质都是这件事。

五、方案一:vision-skill + qwen3-vl-flash(推荐)

Vision Skill:给没有原生识图能力的主模型外挂「眼睛」的技能包——读本地/网络图片,调视觉 API,把描述塞回对话。开源仓库:asuojun/claude-vision-skill

视觉模型我选的是通义千问的 qwen3-vl-flash:专门负责看图的 VL 模型,日常读 UI / 截图够用。官方按 token 计费(输入 0.15 元 / 百万 tokens,输出 1.5 元 / 百万 tokens),不是按张标价;我这边日常丢一张截图识图,账单大概落在 0.02 元/次左右。阿里这边更大的文本旗舰我之前写过:Qwen3.8 突然上线:2.4T、自评仅次于 Fable 5,千问想干什么——那是另一条产品线;识图别拿纯文本旗舰硬顶,用 VL 系列。

百炼控制台拿一把 DashScope API Key,然后在已经接好 Flash 的 Codex 里直接丢这段话(把 Key 换成你自己的):

全局安装 vision-skill,按 https://github.com/asuojun/claude-vision-skill 的 README 帮我配置识图

- 视觉模型用通义千问的 qwen3-vl-flash
- API Key 为 <使用你自己的 API Key>

按 README,AI 一般会把 vision.js 配好、把触发说明写进技能目录;之后你直接发图片路径或附件,它应自动走视觉模型,而不是瞎猜像素。

如果 GitHub 拉不动,先本地 clone 再让 Codex 读本地 README:

git clone https://github.com/asuojun/claude-vision-skill.git

为什么我推荐方案一:现成、可复用、Skill 机制跟 Codex 工作流合拍,维护成本低。你平时不怎么看图也可以先跳过,用到再装,不耽误写代码。

六、方案二:让 Codex 自写识图插件

有人不想依赖第三方 Skill,或者想把链路完全捏在自己手里——可以让 Codex 直接写一个「读图插件」。

原理不神秘:图片先编成 base64 → 调用 VL 视觉模型(同样建议 qwen3-vl-flash)→ 拿回文字描述 → 塞给主模型 DeepSeek-V4-Flash 继续推理、改代码。主模型始终只吃文本,视觉模型只负责「看」。

你可以在 Codex 里用类似需求开干(按你项目结构改路径):

帮我写一个 Codex 可用的识图插件:
1. 读取本地图片或用户附件,转成 base64
2. 调用阿里云百炼 OpenAI 兼容接口,模型用 qwen3-vl-flash
3. 把视觉模型返回的文字描述交给当前主对话(DeepSeek-V4-Flash)继续处理
4. 用环境变量放 API Key,不要把密钥写死进仓库

这套的好处是可控:超时、压缩、提示词模板、日志,你都能改。坏处也明显——你要自己扛兼容性、升级和权限问题。Flash 版本一变、Codex Skill/插件接口一改,可能得跟着重写。

说真的,除非你明确要定制,否则别一上来就走方案二。先把方案一跑通,再决定要不要自建。

七、两套方案怎么选,以及跑通长什么样

先把选择标准钉死:

方案 适合谁 优点 代价
方案一 vision-skill 大多数人(我推荐) 安装快、跟 Skill 生态一致 依赖开源仓库与百炼 Key
方案二 自写插件 想完全自控链路的人 可定制、可内嵌团队规范 自己维护,升级要跟

日常写码 + 偶尔看截图:直接方案一。 方案二留给「我就要自己管管道」的场景。

配好之后,丢一张界面图给 Codex,让它描述布局或指出明显问题——如果视觉模型回了靠谱描述,主模型又能据此改代码,就说明「Flash 推理 + 外挂识图」这条组合拳打通了。

OK,收束一句:Codex 接入 DeepSeek-V4-Flash 解决的是「便宜又强的 Agent 大脑」;识图外包解决的是「眼睛」——两件事别绑死在同一个模型上。 把主链路和识图外挂都配齐,日常写码才算完整。

官方接入文档会随版本更新,配置以 DeepSeek Codex 集成页 为准;vision-skill 以仓库 README 为准。


我是程序员天天困,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你这边 Codex 接入 DeepSeek-V4-Flash 之后,识图会选 vision-skill 还是自己写插件?

posted @ 2026-08-04 13:59  程序员天天困  阅读(24)  评论(0)    收藏  举报