谷歌Gemma 4保姆级教程,看完你也能本地跑大模型
ma 4保姆级教程,看完你也能本地跑大模型
你家电脑,现在能装下
谷歌最强开源大模型了
4月3号凌晨,谷歌 DeepMind 悄悄把一颗"核弹"扔进了开源 AI 圈。
Gemma 4,正式发布了。
一个 31B 参数的模型,数学竞赛基准从上一代的 20.8% 直接打到 89.2%,编程能力 LiveCodeBench 从 29.1% 飙到 80%,在开源模型排行榜上一亮相就拿下全球第三。更关键的是:它用 Apache 2.0 完全开源协议发布——下载、修改、商用,谷歌完全管不着。
更令人兴奋的是,它可以跑在你的本地电脑上。不联网,没有 API Key,不按 Token 付钱,数据一步不出本机。这篇文章,就是手把手教你把它装起来。
先搞清楚你要装的是什么
Gemma 4 不是单一一个模型,而是一个四档覆盖全场景的矩阵,从手机到服务器各有对应:
🍃 E2B — 极轻量·端侧版
有效参数 2.3B · 128K 上下文 · 支持图片 + 音频 · 可跑在手机 / 树莓派 · 量化后不到 3GB
💻 E4B — 轻量·笔记本版
有效参数 4.5B · 128K 上下文 · 多模态 · Ollama 量化约 9.6GB · 16GB 内存笔记本可运行
⚡ 26B MoE — 性价比之王(最推荐)
总参数 252亿,推理时只激活 38亿 · 256K 超长上下文 · 量化约 14–18GB · 速度接近 4B 模型,质量接近 31B
🏆 31B Dense — 旗舰·工作站版
全量 307亿参数 · 256K 上下文 · Arena AI 开源榜 #3 · 量化约 20GB · 建议 2x RTX 4090 或 A100 80G
普通开发者和个人用户,首选 E4B 或 26B MoE。E4B 几乎任何 16GB 内存的电脑都能跑,26B MoE 需要 16–24GB 显存的独立显卡。下面以这两款为主线展开教程。
方法一:Ollama(最快,5 分钟搞定)
适合:Mac / Windows / Linux · 命令行操作 · 自带本地 API
Ollama 是目前最便捷的本地模型运行方案,安装完毕后一条命令即可拉起 Gemma 4,同时在 11434 端口暴露兼容 OpenAI 格式的 API,可直接对接任何 AI 应用。
# 第一步:安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Windows:前往 ollama.com 下载安装包 .exe 双击安装
# 第二步:拉取模型(按硬件选一个)
ollama pull gemma4 # 默认 E4B,约 9.6GB,大多数人的首选
ollama pull gemma4:e2b # E2B,2.3B 有效参数,极轻量
ollama pull gemma4:26b # 26B MoE,约 16GB,追求质量
ollama pull gemma4:31b # 31B Dense,约 20GB,旗舰
# 第三步:运行,直接开始对话
ollama run gemma4
# 验证本地 API 是否正常(端口 11434)
curl http://localhost:11434/api/generate \
-d '{"model":"gemma4","prompt":"你好,介绍一下你自己"}'
💡 注意
Ollama 默认 gemma4 tag 指向 E4B 版本(9.6GB)。想跑工作站版本需明确指定 gemma4:26b 或 gemma4:31b。下载完成后可用 ollama list 查看本地已有模型。
方法二:LM Studio(有界面,零门槛)
适合:不喜欢命令行 · 可视化管理 · 内置 ChatGPT 式对话界面
如果看到命令行就头皮发麻,LM Studio 是你的选择。漂亮的桌面 GUI,找模型、下载、对话,全靠点击。
① 下载 LM Studio
前往 lmstudio.ai,下载对应系统版本(Mac / Windows / Linux),安装后打开。
② 搜索并下载 Gemma 4
点击左侧"发现"(Discover)按钮,搜索框输入 gemma4,找到 E4B 的 Q4 量化版本点击下载。推荐选 Q4_K_M,平衡了体积和质量。
③ 加载并开始对话
下载完成后,点击左侧"对话"图标,顶部下拉菜单选择刚下载的 Gemma 4,即可开始对话。体验和 ChatGPT 网页版完全一致,只是运行在你自己的机器上。
④(可选)开启本地 API 服务器
点击左侧"开发者"图标,启动本地服务器(默认端口 1234),即可在自己代码里通过 OpenAI 兼容 API 调用 Gemma 4——和调用 ChatGPT API 写法完全一样,只是 base_url 改成 http://localhost:1234/v1。
Mac 用户专属:MLX 加速,速度暴涨
适合:Apple Silicon M 系列芯片(M1/M2/M3/M4)
如果你用的是 M 系列 Mac,有个专属工具可以让速度飞起来——mlx-vlm。发布当天,mlx-vlm v0.4.3 同步支持了 Gemma 4 全系列,社区几小时内上传了 125 个量化版本。搭配 TurboQuant KV 缓存压缩,KV 缓存内存占用从 13.3GB 压缩到 4.9GB,减少 63%,实测速度达 84+ Tokens/s。
# 安装 mlx-vlm
pip install mlx-vlm
# 运行 Gemma 4 E4B(4-bit 量化版)
python -m mlx_vlm.generate \
--model mlx-community/gemma-4-e4b-it-4bit \
--prompt "帮我解释一下 Java 中 ThreadLocal 的内存模型"
我的电脑能跑哪个版本
硬件配置推荐版本速度参考手机 / 树莓派 5E2B~7.6 t/s16GB 内存笔记本E4B10–20 t/sM4 MacBook Air 16GBE4B / 26B20–84 t/sRTX 4090 (24GB)26B MoE40+ t/sA100 / H100 80GB31B Dense满血推理* 没有独显也没关系,CPU 推理虽慢,E2B / E4B 量化版在 32GB 内存的 Mac 上速度完全可接受。31B 用 Q4_K_M 量化后,MMLU 仅下降约 1.5–2 个百分点,日常问答几乎感知不到差异。
为什么这次和以前真的不一样
你可能见过很多次"谷歌发布开源模型",下载下来却发现有各种商业限制。这次是真的不同了。
😓 以前(Gemma 1 / 2 / 3)
谷歌自定义许可协议 · 限制商业用途 · 不能用于合成数据生成 · 谷歌可随时修改条款 · 企业法务处理成本高
🎉 现在(Gemma 4)
Apache 2.0 · 完全免费商用 · 可修改再分发 · 可用于微调和合成数据 · 谷歌不能单方面反悔 · 企业可放心使用
Apache 2.0 是开源世界最宽松的协议之一,Meta 的 LLaMA 系列在月活超 7 亿后还需要向 Meta 申请额外授权——Gemma 4 没有这个问题。Hugging Face CEO Clément Delangue 在发布当天说:
"这是一个巨大的里程碑。我们非常激动能在发布首日就在 Hugging Face 上支持 Gemma 4 家族。"
—— Clément Delangue,Hugging Face 联合创始人兼 CEO
现在就可以去试试了
大多数人从来没有在本地跑过一个真正强大的 AI。
今天,谷歌把这个门槛降到了一条命令的高度。
你只需要:
ollama pull gemma4
然后按下回车键。
一年前,在本地运行一个顶级 AI 模型意味着购买数十万的硬件。
今天,它意味着你的 MacBook Air 和一条命令。
AI 真正属于每个人的时代,比我们想象的来得更

浙公网安备 33010602011771号