【AI实战日记-手搓聊天机器人】端侧AI:尝试本地跑 LLM 模型
(以下为 deepseek AI生成)
在笔记本和树莓派上跑模型,核心思路是选对模型尺寸和做好量化。我直接给你推荐经过验证的可行方案。
一、笔记本上跑模型(推荐方案)
1. 你的笔记本是什么配置?
先快速判断一下:
| 配置类型 | 推荐模型大小 | 推荐具体模型 |
|---|---|---|
| 有 NVIDIA 显卡(4GB 显存以上) | 1B - 3B | Qwen2.5-1.5B/3B、Phi-3.5-mini |
| 有 NVIDIA 显卡(8GB 显存以上) | 7B 量化版 | DeepSeek-7B、Llama-3.1-8B(Int4) |
| 只有 CPU(16GB 内存) | 1B - 3B | Qwen2.5-1.5B、TinyLlama-1.1B |
| 只有 CPU(8GB 内存) | 0.5B - 1B | Qwen2.5-0.5B、Llama-3.2-1B |
| MacBook(M1/M2/M3,8GB+) | 3B - 7B 量化版 | 直接用 MLX 框架跑上述模型 |
2. 最推荐的几款(适合新手)
| 模型 | 大小 | 优势 | 运行工具 |
|---|---|---|---|
| Qwen2.5-1.5B-Instruct | 1.5B | 中文能力强,轻量,Intel CPU 流畅 | Ollama / LM Studio |
| Phi-3.5-mini-instruct | 3.8B | 微软出品,逻辑推理强,英文好 | Ollama / LM Studio |
| Llama-3.2-3B-Instruct | 3B | Meta 官方,对话自然,多语言 | Ollama / LM Studio |
| DeepSeek-R1-Distill-Qwen-1.5B | 1.5B | 深度求索蒸馏版,推理痕迹明显 | Ollama |
3. 最简单的运行方式(不需要懂代码)
推荐使用 Ollama(Windows/Mac/Linux 都支持):
# 1. 下载 Ollama 官网安装包
# 2. 打开终端/命令行,执行:
ollama run qwen2.5:1.5b
# 其他示例:
ollama run phi3.5:3.8b-mini-instruct
ollama run llama3.2:3b
Ollama 会自动下载模型并开始对话。Int4 量化自动完成,你无需配置任何参数。
4. 如果你想要 GUI 界面
-
LM Studio:傻瓜式图形界面,搜索模型直接下载运行
-
GPT4All:更轻量,专为 CPU 优化
二、树莓派上跑模型(挑战性方案)
1. 硬件前提
树莓派性能很弱,只有可行的组合才能跑:
| 树莓派型号 | 推荐模型 | 速度体验 |
|---|---|---|
| Raspberry Pi 5(8GB 内存) | Qwen2.5-0.5B Int4 量化 | 1-3 tokens/秒(可接受) |
| Raspberry Pi 4(4GB/8GB) | TinyLlama-1.1B Int4 | 0.5-1 tokens/秒(非常慢) |
| Raspberry Pi 3 | 不建议,基本跑不动 | — |
2. 具体推荐模型
| 模型 | 量化后大小 | 可用内存 | 推荐场景 |
|---|---|---|---|
| Qwen2.5-0.5B-Instruct | ~300 MB | 树莓派 4/5 | 中文简单问答 |
| TinyLlama-1.1B | ~600 MB | 树莓派 5 8GB | 英文简单对话 |
| Phi-2 (2.7B) 量化版 | ~1.2 GB | 树莓派 5 需大内存 | 需要更多计算力,但很慢 |
3. 树莓派上的安装步骤(推荐使用 llama.cpp)
# 1. 安装依赖
sudo apt update && sudo apt install build-essential cmake
# 2. 编译 llama.cpp(专为 CPU 优化)
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
mkdir build && cd build
cmake .. -DCMAKE_BUILD_TYPE=Release
make -j4
# 3. 下载量化好的 GGUF 模型(以 Qwen2.5-0.5B 为例)
wget https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct-GGUF/resolve/main/qwen2.5-0.5b-instruct-q4_k_m.gguf
# 4. 运行
./bin/llama-cli -m qwen2.5-0.5b-instruct-q4_k_m.gguf -n 256 --temp 0.7 -p "你好,请介绍一下你自己"
4. 更省事的方法:使用 Ollama(树莓派也支持)
Ollama 官方有 ARM 版本,树莓派 5 可以直接装:
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen2.5:0.5b
三、一句话总结建议
| 你的情况 | 最佳选择 |
|---|---|
| 笔记本,想轻松体验 | 安装 Ollama,运行 qwen2.5:1.5b |
| 笔记本有 NVIDIA 显卡 | 运行 deepseek-coder:1.3b(代码)或 llama3.2:3b |
| 想挑战树莓派 | 树莓派 5 + Ollama + qwen2.5:0.5b |
| 纯好奇心,树莓派 4 | 可以试试,但要做好“每分钟一句话”的心理准备 |
四、性能预期(真实数据)
| 设备 | 模型 | 速度 | 体验 |
|---|---|---|---|
| 笔记本(i5, 16GB) | Qwen2.5-1.5B | 10-20 tokens/秒 | 流畅 |
| 笔记本(带 RTX 3050 4GB) | Qwen2.5-3B | 30-50 tokens/秒 | 非常流畅 |
| 树莓派 5(8GB) | Qwen2.5-0.5B | 1-3 tokens/秒 | 像打字机,可接受 |
| 树莓派 4(4GB) | TinyLlama-1.1B | 0.5-1 tokens/秒 | 很慢,只适合测试 |
在笔记本和树莓派上跑模型,核心思路是选对模型尺寸和做好量化。我直接给你推荐经过验证的可行方案。
一、笔记本上跑模型(推荐方案)
1. 你的笔记本是什么配置?
先快速判断一下:
| 配置类型 | 推荐模型大小 | 推荐具体模型 |
|---|---|---|
| 有 NVIDIA 显卡(4GB 显存以上) | 1B - 3B | Qwen2.5-1.5B/3B、Phi-3.5-mini |
| 有 NVIDIA 显卡(8GB 显存以上) | 7B 量化版 | DeepSeek-7B、Llama-3.1-8B(Int4) |
| 只有 CPU(16GB 内存) | 1B - 3B | Qwen2.5-1.5B、TinyLlama-1.1B |
| 只有 CPU(8GB 内存) | 0.5B - 1B | Qwen2.5-0.5B、Llama-3.2-1B |
| MacBook(M1/M2/M3,8GB+) | 3B - 7B 量化版 | 直接用 MLX 框架跑上述模型 |
2. 最推荐的几款(适合新手)
| 模型 | 大小 | 优势 | 运行工具 |
|---|---|---|---|
| Qwen2.5-1.5B-Instruct | 1.5B | 中文能力强,轻量,Intel CPU 流畅 | Ollama / LM Studio |
| Phi-3.5-mini-instruct | 3.8B | 微软出品,逻辑推理强,英文好 | Ollama / LM Studio |
| Llama-3.2-3B-Instruct | 3B | Meta 官方,对话自然,多语言 | Ollama / LM Studio |
| DeepSeek-R1-Distill-Qwen-1.5B | 1.5B | 深度求索蒸馏版,推理痕迹明显 | Ollama |
3. 最简单的运行方式(不需要懂代码)
推荐使用 Ollama(Windows/Mac/Linux 都支持):
# 1. 下载 Ollama 官网安装包
# 2. 打开终端/命令行,执行:
ollama run qwen2.5:1.5b
# 其他示例:
ollama run phi3.5:3.8b-mini-instruct
ollama run llama3.2:3b
Ollama 会自动下载模型并开始对话。Int4 量化自动完成,你无需配置任何参数。
4. 如果你想要 GUI 界面
-
LM Studio:傻瓜式图形界面,搜索模型直接下载运行
-
GPT4All:更轻量,专为 CPU 优化
二、树莓派上跑模型(挑战性方案)
1. 硬件前提
树莓派性能很弱,只有可行的组合才能跑:
| 树莓派型号 | 推荐模型 | 速度体验 |
|---|---|---|
| Raspberry Pi 5(8GB 内存) | Qwen2.5-0.5B Int4 量化 | 1-3 tokens/秒(可接受) |
| Raspberry Pi 4(4GB/8GB) | TinyLlama-1.1B Int4 | 0.5-1 tokens/秒(非常慢) |
| Raspberry Pi 3 | 不建议,基本跑不动 | — |
2. 具体推荐模型
| 模型 | 量化后大小 | 可用内存 | 推荐场景 |
|---|---|---|---|
| Qwen2.5-0.5B-Instruct | ~300 MB | 树莓派 4/5 | 中文简单问答 |
| TinyLlama-1.1B | ~600 MB | 树莓派 5 8GB | 英文简单对话 |
| Phi-2 (2.7B) 量化版 | ~1.2 GB | 树莓派 5 需大内存 | 需要更多计算力,但很慢 |
3. 树莓派上的安装步骤(推荐使用 llama.cpp)
# 1. 安装依赖
sudo apt update && sudo apt install build-essential cmake
# 2. 编译 llama.cpp(专为 CPU 优化)
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
mkdir build && cd build
cmake .. -DCMAKE_BUILD_TYPE=Release
make -j4
# 3. 下载量化好的 GGUF 模型(以 Qwen2.5-0.5B 为例)
wget https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct-GGUF/resolve/main/qwen2.5-0.5b-instruct-q4_k_m.gguf
# 4. 运行
./bin/llama-cli -m qwen2.5-0.5b-instruct-q4_k_m.gguf -n 256 --temp 0.7 -p "你好,请介绍一下你自己"
4. 更省事的方法:使用 Ollama(树莓派也支持)
Ollama 官方有 ARM 版本,树莓派 5 可以直接装:
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen2.5:0.5b
三、一句话总结建议
| 你的情况 | 最佳选择 |
|---|---|
| 笔记本,想轻松体验 | 安装 Ollama,运行 qwen2.5:1.5b |
| 笔记本有 NVIDIA 显卡 | 运行 deepseek-coder:1.3b(代码)或 llama3.2:3b |
| 想挑战树莓派 | 树莓派 5 + Ollama + qwen2.5:0.5b |
| 纯好奇心,树莓派 4 | 可以试试,但要做好“每分钟一句话”的心理准备 |
四、性能预期(真实数据)
| 设备 | 模型 | 速度 | 体验 |
|---|---|---|---|
| 笔记本(i5, 16GB) | Qwen2.5-1.5B | 10-20 tokens/秒 | 流畅 |
| 笔记本(带 RTX 3050 4GB) | Qwen2.5-3B | 30-50 tokens/秒 | 非常流畅 |
| 树莓派 5(8GB) | Qwen2.5-0.5B | 1-3 tokens/秒 | 像打字机,可接受 |
| 树莓派 4(4GB) | TinyLlama-1.1B | 0.5-1 tokens/秒 | 很慢,只适合测试 |
如果告诉我你的笔记本具体配置(CPU/内存/显卡型号),我可以给你更精准的建议。

浙公网安备 33010602011771号