Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
大家好,我是程序员天天困。
很多人想 Codex 接入 DeepSeek-V4-Flash,图的是便宜 Agent 大脑。我之前写过成绩单拆解:DeepSeek V4 Flash 正式版:成绩碾压 Pro 预览版,白菜价——Agent 能打、价格白菜、还原生 Responses API,确实适合塞进 Codex。
硬伤也得说清:DeepSeek-V4-Flash 是纯文本模型,不能像多模态模型那样直接读图。 你扔张 UI 截图,让它「看看图里写了什么」,它识别不出来。
那有没有办法:一边用 Flash 做便宜又强的推理,一边让 Codex 还能处理图像?还真有。下面手把手把 CLI 和桌面端配通,再给两套识图方案。
点个收藏,咱们开始~
一、先准备 DeepSeek API Key
Codex 接第三方模型,第一步永远是 Key,不是改配置文件。
打开 DeepSeek 开放平台 注册登录,进入 API keys,新建一把 Key。创建时完整字符串只显示一次,当场复制存好;丢了只能作废重建。

Flash 输出约 2 元 / 百万 token,个人日常写码一般够用。

二、Codex CLI 配置 DeepSeek
Codex CLI:OpenAI 出的终端侧 AI 编程助手,你在项目目录里跟它对话,它能读写文件、跑命令、改代码。你可以把它理解成「住在终端里的结对程序员」。
先确保本机有 Node.js,没有就去官网装个 LTS。然后全局安装:
npm install -g @openai/codex
装完输入 codex 能进对话界面就算成。首次启动会要你登录 OpenAI 账号——没订阅也没关系,接下来我们直接切到 DeepSeek。
重要前置:CLI 或桌面端至少启动过一次,让 ~/.codex(Windows 是 %USERPROFILE%\.codex\)目录先生成出来。官方脚本要往里面写文件,目录不存在会直接翻车。

1)一键脚本(推荐)
官方文档 写明:目前只有 deepseek-v4-flash 支持接 Codex;deepseek-v4-pro 预计 2026 年 8 月初跟上。
Windows 用 PowerShell:
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
Mac / Linux:
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)
脚本起来后选模型(Flash 选对应序号)

再粘贴 API Key。它会备份旧配置、写 models.json、改 config.toml,还做语法校验——写坏了会中止,不会把你现有 MCP、项目信任配置整没。

可能有人会问:以前改个 Base URL 为什么老 404?
以前卡在协议。Codex 走 Responses API,不少国内接口只聊 Chat Completions,两边不是同一套方言。Flash 这次原生支持 Responses,
wire_api = "responses"就能直连,不必再起本地协议翻译层。
配置完重开 Codex,启动横幅出现 deepseek-v4-flash(或你选的模型名),就说明 CLI 配通了。

2)不想跑脚本就手动改
两步。第一步在 ~/.codex/ 下建 models.json,内容直接复制官方文档展开块(里面带 Flash / Pro 元数据:百万级上下文、low/high/max 推理档等)。
第二步编辑同目录 config.toml:
model = "deepseek-v4-flash"
model_provider = "deepseek"
preferred_auth_method = "apikey"
forced_login_method = "api"
model_reasoning_effort = "high"
model_catalog_json = "~/.codex/models.json"
[model_providers.deepseek]
name = "deepseek"
base_url = "https://api.deepseek.com/"
wire_api = "responses"
experimental_bearer_token = "<你的 DeepSeek API Key>"
关键就一行:wire_api = "responses"。Token 换成自己的 Key。保存后重启 Codex,效果和脚本一致。
想切回官方模型,再跑一遍脚本,菜单里选恢复即可。
三、Codex 桌面端换模型不用重配
ChatGPT / Codex 桌面端、VS Code 的 Codex 插件,跟 CLI 读的是同一套 ~/.codex。 你在 CLI 配好 Flash,桌面端一般不用再填一遍。
打开桌面端后,模型选择器在 Mac 上常显示为 Custom;Windows 上可能是 Custom,也可能直接显示 DeepSeek-V4-Flash。看到 Custom 别慌——实际跑的就是你在配置里指定的 DeepSeek 模型。
有个小坑我踩过:切到第三方 API 之后,以前用 ChatGPT 订阅攒的会话列表像「消失」了。其实没删,只是 Codex 按登录方式分组展示。恢复旧配置,旧会话回来;DeepSeek 会话则反过来隐藏。换完记得重启客户端。

到这里,Codex 接入 DeepSeek-V4-Flash 的主链路算走通了:CLI 写代码、桌面端聊需求,账单走 DeepSeek。
四、Flash 为啥自己看不了图
官方 models.json 里写得很直白:Flash 的 input_modalities 只有 text,supports_image_detail_original 为 false。翻译成人话——眼睛没装,不是你不会用。
编程场景里看图其实挺刚需:对照 Figma 截图还原布局、根据报错弹窗找原因、读一下产品给的 UI 稿。主模型继续用 Flash 省钱没问题,但「看」这件事得外包。
思路像工地分工:Flash 当工头负责推理和改代码,旁边再雇一个专职看图的人,把画面翻译成文字交回去。下面两套方案,本质都是这件事。
五、方案一:vision-skill + qwen3-vl-flash(推荐)
Vision Skill:给没有原生识图能力的主模型外挂「眼睛」的技能包——读本地/网络图片,调视觉 API,把描述塞回对话。开源仓库:asuojun/claude-vision-skill。
视觉模型我选的是通义千问的 qwen3-vl-flash:专门负责看图的 VL 模型,日常读 UI / 截图够用。官方按 token 计费(输入 0.15 元 / 百万 tokens,输出 1.5 元 / 百万 tokens),不是按张标价;我这边日常丢一张截图识图,账单大概落在 0.02 元/次左右。阿里这边更大的文本旗舰我之前写过:Qwen3.8 突然上线:2.4T、自评仅次于 Fable 5,千问想干什么——那是另一条产品线;识图别拿纯文本旗舰硬顶,用 VL 系列。

百炼控制台拿一把 DashScope API Key,然后在已经接好 Flash 的 Codex 里直接丢这段话(把 Key 换成你自己的):
全局安装 vision-skill,按 https://github.com/asuojun/claude-vision-skill 的 README 帮我配置识图
- 视觉模型用通义千问的 qwen3-vl-flash
- API Key 为 <使用你自己的 API Key>
按 README,AI 一般会把 vision.js 配好、把触发说明写进技能目录;之后你直接发图片路径或附件,它应自动走视觉模型,而不是瞎猜像素。
如果 GitHub 拉不动,先本地 clone 再让 Codex 读本地 README:
git clone https://github.com/asuojun/claude-vision-skill.git

为什么我推荐方案一:现成、可复用、Skill 机制跟 Codex 工作流合拍,维护成本低。你平时不怎么看图也可以先跳过,用到再装,不耽误写代码。
六、方案二:让 Codex 自写识图插件
有人不想依赖第三方 Skill,或者想把链路完全捏在自己手里——可以让 Codex 直接写一个「读图插件」。
原理不神秘:图片先编成 base64 → 调用 VL 视觉模型(同样建议 qwen3-vl-flash)→ 拿回文字描述 → 塞给主模型 DeepSeek-V4-Flash 继续推理、改代码。主模型始终只吃文本,视觉模型只负责「看」。
你可以在 Codex 里用类似需求开干(按你项目结构改路径):
帮我写一个 Codex 可用的识图插件:
1. 读取本地图片或用户附件,转成 base64
2. 调用阿里云百炼 OpenAI 兼容接口,模型用 qwen3-vl-flash
3. 把视觉模型返回的文字描述交给当前主对话(DeepSeek-V4-Flash)继续处理
4. 用环境变量放 API Key,不要把密钥写死进仓库
这套的好处是可控:超时、压缩、提示词模板、日志,你都能改。坏处也明显——你要自己扛兼容性、升级和权限问题。Flash 版本一变、Codex Skill/插件接口一改,可能得跟着重写。
说真的,除非你明确要定制,否则别一上来就走方案二。先把方案一跑通,再决定要不要自建。
七、两套方案怎么选,以及跑通长什么样
先把选择标准钉死:
| 方案 | 适合谁 | 优点 | 代价 |
|---|---|---|---|
| 方案一 vision-skill | 大多数人(我推荐) | 安装快、跟 Skill 生态一致 | 依赖开源仓库与百炼 Key |
| 方案二 自写插件 | 想完全自控链路的人 | 可定制、可内嵌团队规范 | 自己维护,升级要跟 |
日常写码 + 偶尔看截图:直接方案一。 方案二留给「我就要自己管管道」的场景。
配好之后,丢一张界面图给 Codex,让它描述布局或指出明显问题——如果视觉模型回了靠谱描述,主模型又能据此改代码,就说明「Flash 推理 + 外挂识图」这条组合拳打通了。

OK,收束一句:Codex 接入 DeepSeek-V4-Flash 解决的是「便宜又强的 Agent 大脑」;识图外包解决的是「眼睛」——两件事别绑死在同一个模型上。 把主链路和识图外挂都配齐,日常写码才算完整。
官方接入文档会随版本更新,配置以 DeepSeek Codex 集成页 为准;vision-skill 以仓库 README 为准。
我是程序员天天困,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你这边 Codex 接入 DeepSeek-V4-Flash 之后,识图会选 vision-skill 还是自己写插件?

Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
浙公网安备 33010602011771号