DeepSeek 终于出多模态了

DeepSeek 的 API 平台上线了新模型 deepseek-v4-flash-vision-exp,一个长着眼睛的 V4-Flash。

为什么说「终于」

DeepSeek V4 是今年 4 月发布的,架构上天生支持图片输入。但发布之后 API 上只有纯文本的 V4-Pro 和 V4-Flash,视觉能力一直没用上。

社区等不及了。

Hugging Face 上冒出一堆民间方案,拿 MoonViT 之类的视觉桥接器往 V4-Flash 上焊。效果也有,但毕竟是外接设备,用起来总差点意思,而且只有动手能力强的玩家玩得转。

这次官方 API 直接原生支持视觉,等于官方亲自出手,把欠了四个月的视力补上了。

新模型强在哪

先看官方给的数据。这个新模型最核心的一点:文本能力没有缩水。官方说得很直白,它在 agent、推理、世界知识这些纯文本项上,和官方 V4-Flash 持平。

视觉这一块,跳得就很猛了:

新增的 Chartography 得分 64.3,ZeroBench(Pass@5)35.0,这些是纯视觉、多模态方向的任务。

官方原话是:在需要视觉理解的 agent 任务上,它的多模态能力已经逼近 Opus-4.8。

要知道 Opus-4.8 是什么价位,下面说。

价格:没单独定价

先看表。

deepseek-v4-flash-vision-exp(每 1M token)
输入(cache miss):$0.22(平峰)/ $0.44(高峰)
输出:$0.66 / $1.32

和 V4-Flash 一个价,没有单独给视觉多加钱。图片按尺寸折算成 token,每张图最多 384 个输入 token,这点还算厚道。

遗憾也在这。

8 月 16 号,DeepSeek 刚把整个 API 价格上调过一轮:Flash 的输入(cache miss)从 $0.14 涨到 $0.22,输出从 $0.28 涨到 $0.66,高峰时段(北京时间上午 9-12 点、下午 2-6 点)还要再翻一倍。

vision 是 8 月 21 号才上线的,恰好生在了涨价之后。

设想一下:如果它按涨价前的 $0.14 / $0.28 入场,这模型绝对无敌——多模态能力逼近 Opus-4.8,价格还是原来的地板价。现在呢,能力是真的,价格是调过一档之后的价。拉开差距,靠的是效果本身,不是差价。

你原来调 V4-Flash 的代码,把模型名换成 deepseek-v4-flash-vision-exp,传张图进去,就完事了。

怎么用

支持 JPEG、PNG、GIF、WebP。传图有三种姿势:图片转 base64 塞进请求、给一个外网图片 URL、或者先用 Files API 上传再引用 file_id。

import base64
from openai import OpenAI

client = OpenAI(api_key="<KEY>", base_url="https://api.deepseek.com")
with open("image.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode()

resp = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "这张图里有什么?"},
            {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}},
        ],
    }],
)
print(resp.choices[0].message.content)

不只有 OpenAI 那套接口,Anthropic 兼容接口、Responses API 都能传图。传的时候还能用 detail 参数控制精度:要省 token 就 low,细节敏感就 original。

顺便:Harness 也更新了

同一天,DeepSeek Harness 发布了 0.1.1。

先说背景,Harness 是「模型 + 工具 + 沙箱 + 循环」这一整套让智能体干活的框架,DeepSeek 开源把它做成了「一切皆插件」,上周刚发布就火得不行,GitHub 上 24 小时冲了几万星。

0.1.1 这版专门配合新模型:模型适配器支持原生图片请求,/goal、/plan 这些命令也能接收图文了,还修了图片文件太大、历史图片太多导致请求失败的问题。

到这里,DeepSeek 的家底算是齐了:模型有眼睛,harness 有手脚,自己就能闭环跑一圈。

最后

多模态能力没打折扣,agent 表现逼近一线闭源模型,顺带把自家 harness 也喂上了视觉。

可惜卡在了涨价后面,没能把「低价 + 多模态」这手牌凑满。愿意尝鲜的去 API 上玩玩,试错成本不高;生产环境关键链路就算了,毕竟是 exp 版本。

posted on 2026-08-21 18:24  shmiluyu  阅读(43)  评论(0)    收藏  举报