谷歌Gemma 4保姆级教程,看完你也能本地跑大模型

ma 4保姆级教程,看完你也能本地跑大模型

原创 九歌 九歌 星享AI笔记
 
 
在小说阅读器中沉浸阅读
 

你家电脑,现在能装下

谷歌最强开源大模型了

4月3号凌晨,谷歌 DeepMind 悄悄把一颗"核弹"扔进了开源 AI 圈。

Gemma 4,正式发布了。

一个 31B 参数的模型,数学竞赛基准从上一代的 20.8% 直接打到 89.2%,编程能力 LiveCodeBench 从 29.1% 飙到 80%,在开源模型排行榜上一亮相就拿下全球第三。更关键的是:它用 Apache 2.0 完全开源协议发布——下载、修改、商用,谷歌完全管不着。

更令人兴奋的是,它可以跑在你的本地电脑上。不联网,没有 API Key,不按 Token 付钱,数据一步不出本机。这篇文章,就是手把手教你把它装起来。

先搞清楚你要装的是什么

Gemma 4 不是单一一个模型,而是一个四档覆盖全场景的矩阵,从手机到服务器各有对应:

🍃 E2B — 极轻量·端侧版

有效参数 2.3B · 128K 上下文 · 支持图片 + 音频 · 可跑在手机 / 树莓派 · 量化后不到 3GB

💻 E4B — 轻量·笔记本版

有效参数 4.5B · 128K 上下文 · 多模态 · Ollama 量化约 9.6GB · 16GB 内存笔记本可运行

⚡ 26B MoE — 性价比之王(最推荐)

总参数 252亿,推理时只激活 38亿 · 256K 超长上下文 · 量化约 14–18GB · 速度接近 4B 模型,质量接近 31B

🏆 31B Dense — 旗舰·工作站版

全量 307亿参数 · 256K 上下文 · Arena AI 开源榜 #3 · 量化约 20GB · 建议 2x RTX 4090 或 A100 80G

普通开发者和个人用户,首选 E4B 或 26B MoE。E4B 几乎任何 16GB 内存的电脑都能跑,26B MoE 需要 16–24GB 显存的独立显卡。下面以这两款为主线展开教程。


方法一:Ollama(最快,5 分钟搞定)

适合:Mac / Windows / Linux · 命令行操作 · 自带本地 API

Ollama 是目前最便捷的本地模型运行方案,安装完毕后一条命令即可拉起 Gemma 4,同时在 11434 端口暴露兼容 OpenAI 格式的 API,可直接对接任何 AI 应用。

# 第一步:安装 Ollama

curl -fsSL https://ollama.com/install.sh | sh

# Windows:前往 ollama.com 下载安装包 .exe 双击安装

# 第二步:拉取模型(按硬件选一个)

ollama pull gemma4         # 默认 E4B,约 9.6GB,大多数人的首选

ollama pull gemma4:e2b      # E2B,2.3B 有效参数,极轻量

ollama pull gemma4:26b      # 26B MoE,约 16GB,追求质量

ollama pull gemma4:31b      # 31B Dense,约 20GB,旗舰

# 第三步:运行,直接开始对话

ollama run gemma4

# 验证本地 API 是否正常(端口 11434)

curl http://localhost:11434/api/generate \
  -d '{"model":"gemma4","prompt":"你好,介绍一下你自己"}'

💡 注意

Ollama 默认 gemma4 tag 指向 E4B 版本(9.6GB)。想跑工作站版本需明确指定 gemma4:26b 或 gemma4:31b。下载完成后可用 ollama list 查看本地已有模型。


方法二:LM Studio(有界面,零门槛)

适合:不喜欢命令行 · 可视化管理 · 内置 ChatGPT 式对话界面

如果看到命令行就头皮发麻,LM Studio 是你的选择。漂亮的桌面 GUI,找模型、下载、对话,全靠点击。


① 下载 LM Studio

前往 lmstudio.ai,下载对应系统版本(Mac / Windows / Linux),安装后打开。

② 搜索并下载 Gemma 4

点击左侧"发现"(Discover)按钮,搜索框输入 gemma4,找到 E4B 的 Q4 量化版本点击下载。推荐选 Q4_K_M,平衡了体积和质量。

③ 加载并开始对话

下载完成后,点击左侧"对话"图标,顶部下拉菜单选择刚下载的 Gemma 4,即可开始对话。体验和 ChatGPT 网页版完全一致,只是运行在你自己的机器上。

④(可选)开启本地 API 服务器

点击左侧"开发者"图标,启动本地服务器(默认端口 1234),即可在自己代码里通过 OpenAI 兼容 API 调用 Gemma 4——和调用 ChatGPT API 写法完全一样,只是 base_url 改成 http://localhost:1234/v1


Mac 用户专属:MLX 加速,速度暴涨

适合:Apple Silicon M 系列芯片(M1/M2/M3/M4)

如果你用的是 M 系列 Mac,有个专属工具可以让速度飞起来——mlx-vlm。发布当天,mlx-vlm v0.4.3 同步支持了 Gemma 4 全系列,社区几小时内上传了 125 个量化版本。搭配 TurboQuant KV 缓存压缩,KV 缓存内存占用从 13.3GB 压缩到 4.9GB,减少 63%,实测速度达 84+ Tokens/s。

# 安装 mlx-vlm

pip install mlx-vlm

# 运行 Gemma 4 E4B(4-bit 量化版)

python -m mlx_vlm.generate \
  --model mlx-community/gemma-4-e4b-it-4bit \
  --prompt "帮我解释一下 Java 中 ThreadLocal 的内存模型"


我的电脑能跑哪个版本

硬件配置推荐版本速度参考手机 / 树莓派 5E2B~7.6 t/s16GB 内存笔记本E4B10–20 t/sM4 MacBook Air 16GBE4B / 26B20–84 t/sRTX 4090 (24GB)26B MoE40+ t/sA100 / H100 80GB31B Dense满血推理

* 没有独显也没关系,CPU 推理虽慢,E2B / E4B 量化版在 32GB 内存的 Mac 上速度完全可接受。31B 用 Q4_K_M 量化后,MMLU 仅下降约 1.5–2 个百分点,日常问答几乎感知不到差异。


为什么这次和以前真的不一样

你可能见过很多次"谷歌发布开源模型",下载下来却发现有各种商业限制。这次是真的不同了。

😓 以前(Gemma 1 / 2 / 3)

谷歌自定义许可协议 · 限制商业用途 · 不能用于合成数据生成 · 谷歌可随时修改条款 · 企业法务处理成本高

🎉 现在(Gemma 4)

Apache 2.0 · 完全免费商用 · 可修改再分发 · 可用于微调和合成数据 · 谷歌不能单方面反悔 · 企业可放心使用

Apache 2.0 是开源世界最宽松的协议之一,Meta 的 LLaMA 系列在月活超 7 亿后还需要向 Meta 申请额外授权——Gemma 4 没有这个问题。Hugging Face CEO Clément Delangue 在发布当天说:

"这是一个巨大的里程碑。我们非常激动能在发布首日就在 Hugging Face 上支持 Gemma 4 家族。"

—— Clément Delangue,Hugging Face 联合创始人兼 CEO


现在就可以去试试了

大多数人从来没有在本地跑过一个真正强大的 AI。
今天,谷歌把这个门槛降到了一条命令的高度。
你只需要:

ollama pull gemma4

然后按下回车键。

一年前,在本地运行一个顶级 AI 模型意味着购买数十万的硬件。
今天,它意味着你的 MacBook Air 和一条命令。

AI 真正属于每个人的时代,比我们想象的来得更

posted @ 2026-04-07 22:12  技术颜良  阅读(3460)  评论(0)    收藏  举报