Ollama【二、硬件配置与模型】
在 OpenClaw 中配置本地 Ollama 模型时,“最佳模型”完全取决于你的电脑硬件(主要是显存 VRAM 和内存 RAM)。OpenClaw 本身只是一个连接器,模型的运行速度和稳定性由 Ollama 和你的硬件决定。
以下是根据不同硬件配置的大模型推荐清单及配置建议:
🚀 第一步:确认你的硬件配置
请先查看你的显卡显存(VRAM)或系统内存(如果没有独立显卡):
- Windows: 任务管理器 -> 性能 -> GPU -> 专用 GPU 内存。
- Mac: 点击左上角苹果图标 -> 关于本机 -> 统一内存。
- Linux: 终端输入
nvidia-smi(N卡) 或free -h(内存)。
📊 硬件配置与模型推荐对照表
1. 入门级 / 老旧电脑 / 纯 CPU 运行
-
硬件特征:
- 显存 < 4GB 或 无独立显卡
- 内存 (RAM): 8GB - 16GB
-
推荐策略: 必须使用 量化版 (Quantized) 的小参数模型,否则速度会极慢(每秒几个字)。
-
推荐模型:
模型名称 参数量 推荐版本 (Ollama Tag) 特点 适用场景 Qwen2.5-3B 3B qwen2.5:3b国产之光,中文理解极强,速度飞快 日常对话、简单翻译、摘要 Phi-3.5-mini 3.8B phi3.5:mini微软出品,逻辑推理在小模型中惊人 逻辑题、代码片段、推理 Gemma-2-2b 2B gemma2:2b谷歌出品,极轻量 极速响应、简单问答 TinyLlama 1.1B tinyllama极致小巧 极低配设备测试用 -
预期体验: 响应速度 < 2秒,生成速度 20-50 tokens/s。
2. 主流配置 / 游戏本 / 入门独显
-
硬件特征:
- 显存: 6GB - 8GB (如 RTX 3060, 4060, 4070 Laptop)
- 内存 (RAM): 16GB - 32GB
-
推荐策略: 可以流畅运行 7B - 9B 参数的模型,这是目前性价比最高的“甜点区”,智力与速度的平衡点。
-
推荐模型:
模型名称 参数量 推荐版本 (Ollama Tag) 特点 适用场景 Qwen2.5-7B 7B qwen2.5:7b首选推荐。中文能力顶级,全能型 写作、复杂对话、角色扮演 Llama-3.1-8B 8B llama3.1:8bMeta出品,英文最强,逻辑好 英文任务、通用逻辑 DeepSeek-R1-Distill-Qwen-7B 7B deepseek-r1:7b推理增强,适合做数学/逻辑题 数学解题、代码调试、深度思考 Mistral-Nemo-12B 12B mistral-nemo:12b稍大一点,但8G显存勉强能跑(需量化) 需要更长上下文的场景 -
预期体验: 响应速度 1-3秒,生成速度 15-30 tokens/s (非常流畅)。
3. 高端配置 / 台式机 / 专业工作站
-
硬件特征:
- 显存: 12GB - 16GB (如 RTX 3090, 4070Ti, 4080)
- 内存 (RAM): 32GB+
-
推荐策略: 可以运行 14B - 20B 的大模型,智力接近 GPT-3.5 水平,能处理复杂任务。
-
推荐模型:
模型名称 参数量 推荐版本 (Ollama Tag) 特点 适用场景 Qwen2.5-14B 14B qwen2.5:14b强力推荐。中文写作、代码能力极强 长文写作、复杂代码生成、数据分析 DeepSeek-V2-Lite 16B deepseek-v2-liteMoE架构,速度快,智力高 综合任务、多轮对话 Yi-1.5-34B (Q4_K_M) 34B yi-1.5-34b:q4_k_m需高显存,中文长文本极佳 长文档分析、专业领域知识 Command R 35B command-r:35b擅长 RAG (检索增强生成) 配合 OpenClaw 的文件阅读功能 -
预期体验: 响应速度 2-5秒,生成速度 8-15 tokens/s。
4. 顶配 / Mac Studio / 多卡服务器
- 硬件特征:
- 显存/统一内存: 24GB - 64GB+ (如 RTX 3090x2, 4090, Mac M2/M3 Max/Ultra)
- 推荐策略: 可以运行 30B - 70B 的超大模型,智力接近 GPT-4 水平。
- 推荐模型:
模型名称 参数量 推荐版本 (Ollama Tag) 特点 Qwen2.5-32B 32B qwen2.5:32b目前开源界最强的中文模型之一 DeepSeek-V3 (Distill) 67B+ deepseek-r1:67b顶级推理能力,需大量显存 Llama-3.1-70B 70B llama3.1:70b开源模型的天花板 Mixtral-8x22B ~140B mixtral-8x22b超大上下文,极度聪明
🛠️ 如何在 OpenClaw 中配置选好的模型
假设你选择了 Qwen2.5-7B (适合主流配置),操作步骤如下:
1. 在 Ollama 中下载模型
打开终端运行:
ollama run qwen2.5:7b
(下载完成后,输入 /bye 退出测试)
2. 在 OpenClaw 中配置
运行配置命令:
openclaw config
按提示输入:
- Provider: 选择
ollama或手动输入local。 - Base URL:
http://localhost:11434/v1(默认地址,不要改)。 - API Key: 输入
ollama(任意非空字符串即可,Ollama 不校验)。 - Model ID: 输入
qwen2.5:7b(必须与 Ollama 中下载的标签完全一致)。
或者手动编辑 ~/.openclaw/openclaw.json:
{
"providers": [
{
"id": "local-ollama",
"name": "Local Ollama",
"baseUrl": "http://localhost:11434/v1",
"apiKey": "ollama",
"type": "openai-compat",
"models": [
{
"id": "qwen2.5:7b",
"name": "Qwen 2.5 7B",
"contextWindow": 32768
}
]
}
],
"defaultProvider": "local-ollama",
"defaultModel": "qwen2.5:7b"
}
💡 避坑指南与优化技巧
-
显存不足怎么办?
- 如果运行大模型报错
OOM(Out Of Memory),请尝试更小参数的模型(如从 14B 降到 7B)。 - 或者使用量化版本:
ollama run qwen2.5:7b-q4_0(Q4 量化比默认的 Q4_K_M 更小更快,但精度微降)。
- 如果运行大模型报错
-
中文能力优先
- 强烈推荐使用 Qwen2.5 系列 (通义千问)。在同等参数量下,它的中文理解、成语运用和文化常识远超 Llama 3 和 Gemma。
- 如果是写代码,DeepSeek 系列或 Qwen2.5-Coder 是首选。
-
Mac 用户特别注意
- Mac 使用统一内存。如果你只有 16GB 内存,建议预留 4-6GB 给系统,模型最好控制在 9B 以下(如
qwen2.5:7b或llama3.1:8b),否则电脑会变卡。 - M1/M2/M3 芯片对 Ollama 优化极好,运行 7B 模型速度通常比同级别的 NVIDIA 显卡还快。
- Mac 使用统一内存。如果你只有 16GB 内存,建议预留 4-6GB 给系统,模型最好控制在 9B 以下(如
-
如何测试速度?
- 配置好后,在 OpenClaw 对话框输入:“请写一篇关于春天的短文,200字左右”。
- 观察文字生成的流式速度。如果像打字机一样流畅(>15字/秒),说明配置完美;如果卡顿明显,请换更小的模型。
总结建议:
- 不确定选哪个? 先试
qwen2.5:7b。它是目前的“万金油”,大部分 8G 显存以上的电脑都能跑,且中文效果极佳。 - 电脑很卡? 试
qwen2.5:3b或phi3.5:mini。 - 电脑很强? 直接上
qwen2.5:14b或deepseek-r1:14b。
本文来自博客园,作者:蓝迷梦,转载请注明原文链接:https://www.cnblogs.com/hewei-blogs/articles/19749467

浙公网安备 33010602011771号