4070Ti 12G 也能流畅跑 35B 大模型?我实测了 Ornith-1.5-A3B
手里就一张 4070Ti,12G 显存,加 32G 内存。能跑的模型非常少。
后来发现 DeepReinforce 放出了 Ornith-1.5 系列,其中 35B-A3B 这个是混合专家架构,据说 12G 显存就能跑。好奇,就拉下来实战了一把。
结果有点出乎意料——170k 上下文,稳定 60 token/s 左右。
1、为什么 12G 显存能带动 35B?
先问个问题:一个 35B 参数的模型,凭什么 12G 显存能跑?
关键在于它是 MoE,也就是混合专家。MoE 全名叫 Mixture of Experts。
你可以把它理解成一家公司。公司里挂着 35 个员工的名头,但真正干活的时候,不会 35 个一起上——每次都只挑最对口的那两三个专家来。
Ornith-1.5-35B-A3B 一共 35B 参数,但每生成一个 token,真正激活的只有大约 3B。也就是「35B 的总编制,3B 的现役上岗」。
这就是它能在 12G 显存上立住脚的底层逻辑。
而「A3B」这个名字里的 3B,说的就是这个激活量。同一家厂还出了 9B 密集版和 397B 的大号,那个 397B 是给多卡服务器用的。
2、实测的部署命令拆解
我用的 llama.cpp 的 llama-server,命令是这样:
llama-server.exe -m Ornith-1.5-35B-Q4_K_M.gguf -ngl 99 --n-cpu-moe 24 \
-c 170000 -fa on --jinja -np 1 \
--cache-type-k q8_0 --cache-type-v q8_0 \
-b 2048 -ub 1024 \
--temp 0.6 --top-p 0.95 --top-k 20 \
--min-p 0.0 --presence-penalty 0.0 --repeat-penalty 1.0 \
--reasoning on
看着长,其实真正决定能不能跑起来的就三行。
第一行是 --n-cpu-moe 24。 这是整条命令的灵魂。
MoE 模型的权重大头在那些「专家」身上,但每次只激活几个。这些专家放显存里纯属浪费——留着又用不到几个,却占满了 12G。
所以我让 24 个专家住到内存里(32G 够装),显卡专心留给注意力层和最关键的 KV 缓存。这就是 12G 显存能撑起 35B 的关键一招。
第二行是 KV cache 量化成 q8_0。
--cache-type-k q8_0 --cache-type-v q8_0。上下文一拉长到 170k,KV 缓存会爆炸式占地。不量化,显存当场殉国。量化成 8bit,170k 才扛得住。
第三行是采样参数。
--temp 0.6 --top-p 0.95 --top-k 20 直接照抄模型官方推荐的采样配置。它是个带推理思考的模型,这些参数就是它说得最顺口的口味。
还有两点别漏:
--jinja必须开。它带 thinking 块,不开这个模板,思考过程会裸奔出来糊你一脸。--reasoning on,让思考内容和正文分开返回。
3、这个速度是个什么水平?
60 token/s 是什么概念?
人正常阅读速度也就每分钟几百字。一个 token 大约一个多汉字,60 token/s 换算下来,一秒六十来个字——比你读得快多了。日常聊天、写代码、让它分析代码,都丝滑。
这个速度怎么来的?我实际观察了一下,瓶颈在内存带宽。24 个专家住在内存里,每生成一个 token 都得来回搬运,双通道内存跑满也就这个量级。
所以我才说,60 就是这套 4070Ti+32G 的甜点区。想更快,要么上大显存显卡全量住 GPU,要么接受这个数字。
170k 上下文能撑住,靠的是 q8 KV 和把专家赶去内存这波搭配。真要再往上冲 256k 甚至 1M,就得开 YaRN 旋转位置编码——但那玩意是静态的,日常短输入会略伤质量,不到万不得已别开。
4、这玩意儿值不值得用?
给个明确态度:值得,但要看清它的定位。
先说它的强项。它专为编程智能体设计,SWE-bench Verified 79 分、Terminal-Bench 68.5,全面压在同体型的 Qwen3.6-35B 头上。而且它防死循环做得好,思维过程拆得清楚,不像某些 Qwen 系模型那么容易掉进反复横跳的坑。
再说它的短板。有第三方测试团队跑过浏览器智能体场景,发现它在这块并不全面碾压——Gemma 4-31B 当浏览器 planner 反而更好。所以官方那些亮眼数字,主要针对「智能体写代码」,别把它当万能钥匙。
适合谁?跟你我一样,手里只有一张消费级显卡、又想本地跑个大模型的。不适合谁? 真要吃满它的 agentic 能力去跑长任务,它 token 消耗比 Qwen3.6 多两三成,你还得盯着上下文别爆。
总的来说,Ornith-1.5-35B-A3B 是「跑起来像 3B、脑子接近 27B 密集模型」那种。对于只有 12G 显存的人来说,这是个真香的选择。
一个 35B 的模型,用一张游戏卡就能流畅带起来——放在两年前,这想都不敢想。
我现在的日常就是拿它修一些小 bug、做一些简单的探索。比如某个函数跑不动了,丢给它看两眼;或者想验证一个思路靠不靠谱,让它先跑一版草稿。这种任务它处理得又快又稳,60 token/s 的脾气也完全够用。不用开云端、不用排队,随时开个终端就能叫它上工。
不知大家跑过这个模型没?用的什么配置、什么速度?欢迎留言聊聊。
浙公网安备 33010602011771号