【AI实战日记-手搓聊天机器人】端侧AI:尝试本地跑 LLM 模型

(以下为 deepseek AI生成)

在笔记本和树莓派上跑模型,核心思路是选对模型尺寸做好量化。我直接给你推荐经过验证的可行方案。


一、笔记本上跑模型(推荐方案)

1. 你的笔记本是什么配置?

先快速判断一下:

配置类型 推荐模型大小 推荐具体模型
有 NVIDIA 显卡(4GB 显存以上) 1B - 3B Qwen2.5-1.5B/3B、Phi-3.5-mini
有 NVIDIA 显卡(8GB 显存以上) 7B 量化版 DeepSeek-7B、Llama-3.1-8B(Int4)
只有 CPU(16GB 内存) 1B - 3B Qwen2.5-1.5B、TinyLlama-1.1B
只有 CPU(8GB 内存) 0.5B - 1B Qwen2.5-0.5B、Llama-3.2-1B
MacBook(M1/M2/M3,8GB+) 3B - 7B 量化版 直接用 MLX 框架跑上述模型

2. 最推荐的几款(适合新手)

 
 
模型 大小 优势 运行工具
Qwen2.5-1.5B-Instruct 1.5B 中文能力强,轻量,Intel CPU 流畅 Ollama / LM Studio
Phi-3.5-mini-instruct 3.8B 微软出品,逻辑推理强,英文好 Ollama / LM Studio
Llama-3.2-3B-Instruct 3B Meta 官方,对话自然,多语言 Ollama / LM Studio
DeepSeek-R1-Distill-Qwen-1.5B 1.5B 深度求索蒸馏版,推理痕迹明显 Ollama

3. 最简单的运行方式(不需要懂代码)

推荐使用 Ollama(Windows/Mac/Linux 都支持):

bash
# 1. 下载 Ollama 官网安装包
# 2. 打开终端/命令行,执行:
ollama run qwen2.5:1.5b

# 其他示例:
ollama run phi3.5:3.8b-mini-instruct
ollama run llama3.2:3b

Ollama 会自动下载模型并开始对话。Int4 量化自动完成,你无需配置任何参数。

4. 如果你想要 GUI 界面

  • LM Studio:傻瓜式图形界面,搜索模型直接下载运行

  • GPT4All:更轻量,专为 CPU 优化


二、树莓派上跑模型(挑战性方案)

1. 硬件前提

树莓派性能很弱,只有可行的组合才能跑:

 
 
树莓派型号 推荐模型 速度体验
Raspberry Pi 5(8GB 内存) Qwen2.5-0.5B Int4 量化 1-3 tokens/秒(可接受)
Raspberry Pi 4(4GB/8GB) TinyLlama-1.1B Int4 0.5-1 tokens/秒(非常慢)
Raspberry Pi 3 不建议,基本跑不动

2. 具体推荐模型

 
 
模型 量化后大小 可用内存 推荐场景
Qwen2.5-0.5B-Instruct ~300 MB 树莓派 4/5 中文简单问答
TinyLlama-1.1B ~600 MB 树莓派 5 8GB 英文简单对话
Phi-2 (2.7B) 量化版 ~1.2 GB 树莓派 5 需大内存 需要更多计算力,但很慢

3. 树莓派上的安装步骤(推荐使用 llama.cpp)

bash
# 1. 安装依赖
sudo apt update && sudo apt install build-essential cmake

# 2. 编译 llama.cpp(专为 CPU 优化)
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
mkdir build && cd build
cmake .. -DCMAKE_BUILD_TYPE=Release
make -j4

# 3. 下载量化好的 GGUF 模型(以 Qwen2.5-0.5B 为例)
wget https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct-GGUF/resolve/main/qwen2.5-0.5b-instruct-q4_k_m.gguf

# 4. 运行
./bin/llama-cli -m qwen2.5-0.5b-instruct-q4_k_m.gguf -n 256 --temp 0.7 -p "你好,请介绍一下你自己"

4. 更省事的方法:使用 Ollama(树莓派也支持)

Ollama 官方有 ARM 版本,树莓派 5 可以直接装:

bash
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen2.5:0.5b

三、一句话总结建议

 
你的情况 最佳选择
笔记本,想轻松体验 安装 Ollama,运行 qwen2.5:1.5b
笔记本有 NVIDIA 显卡 运行 deepseek-coder:1.3b(代码)或 llama3.2:3b
想挑战树莓派 树莓派 5 + Ollama + qwen2.5:0.5b
纯好奇心,树莓派 4 可以试试,但要做好“每分钟一句话”的心理准备

四、性能预期(真实数据)

设备 模型 速度 体验
笔记本(i5, 16GB) Qwen2.5-1.5B 10-20 tokens/秒 流畅
笔记本(带 RTX 3050 4GB) Qwen2.5-3B 30-50 tokens/秒 非常流畅
树莓派 5(8GB) Qwen2.5-0.5B 1-3 tokens/秒 像打字机,可接受
树莓派 4(4GB) TinyLlama-1.1B 0.5-1 tokens/秒 很慢,只适合测试

 

在笔记本和树莓派上跑模型,核心思路是选对模型尺寸做好量化。我直接给你推荐经过验证的可行方案。


一、笔记本上跑模型(推荐方案)

1. 你的笔记本是什么配置?

先快速判断一下:

 
 
配置类型 推荐模型大小 推荐具体模型
有 NVIDIA 显卡(4GB 显存以上) 1B - 3B Qwen2.5-1.5B/3B、Phi-3.5-mini
有 NVIDIA 显卡(8GB 显存以上) 7B 量化版 DeepSeek-7B、Llama-3.1-8B(Int4)
只有 CPU(16GB 内存) 1B - 3B Qwen2.5-1.5B、TinyLlama-1.1B
只有 CPU(8GB 内存) 0.5B - 1B Qwen2.5-0.5B、Llama-3.2-1B
MacBook(M1/M2/M3,8GB+) 3B - 7B 量化版 直接用 MLX 框架跑上述模型

2. 最推荐的几款(适合新手)

 
 
模型 大小 优势 运行工具
Qwen2.5-1.5B-Instruct 1.5B 中文能力强,轻量,Intel CPU 流畅 Ollama / LM Studio
Phi-3.5-mini-instruct 3.8B 微软出品,逻辑推理强,英文好 Ollama / LM Studio
Llama-3.2-3B-Instruct 3B Meta 官方,对话自然,多语言 Ollama / LM Studio
DeepSeek-R1-Distill-Qwen-1.5B 1.5B 深度求索蒸馏版,推理痕迹明显 Ollama

3. 最简单的运行方式(不需要懂代码)

推荐使用 Ollama(Windows/Mac/Linux 都支持):

bash
# 1. 下载 Ollama 官网安装包
# 2. 打开终端/命令行,执行:
ollama run qwen2.5:1.5b

# 其他示例:
ollama run phi3.5:3.8b-mini-instruct
ollama run llama3.2:3b

Ollama 会自动下载模型并开始对话。Int4 量化自动完成,你无需配置任何参数。

4. 如果你想要 GUI 界面

  • LM Studio:傻瓜式图形界面,搜索模型直接下载运行

  • GPT4All:更轻量,专为 CPU 优化


二、树莓派上跑模型(挑战性方案)

1. 硬件前提

树莓派性能很弱,只有可行的组合才能跑:

 
 
树莓派型号 推荐模型 速度体验
Raspberry Pi 5(8GB 内存) Qwen2.5-0.5B Int4 量化 1-3 tokens/秒(可接受)
Raspberry Pi 4(4GB/8GB) TinyLlama-1.1B Int4 0.5-1 tokens/秒(非常慢)
Raspberry Pi 3 不建议,基本跑不动

2. 具体推荐模型

 
 
模型 量化后大小 可用内存 推荐场景
Qwen2.5-0.5B-Instruct ~300 MB 树莓派 4/5 中文简单问答
TinyLlama-1.1B ~600 MB 树莓派 5 8GB 英文简单对话
Phi-2 (2.7B) 量化版 ~1.2 GB 树莓派 5 需大内存 需要更多计算力,但很慢

3. 树莓派上的安装步骤(推荐使用 llama.cpp)

bash
# 1. 安装依赖
sudo apt update && sudo apt install build-essential cmake

# 2. 编译 llama.cpp(专为 CPU 优化)
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
mkdir build && cd build
cmake .. -DCMAKE_BUILD_TYPE=Release
make -j4

# 3. 下载量化好的 GGUF 模型(以 Qwen2.5-0.5B 为例)
wget https://huggingface.co/Qwen/Qwen2.5-0.5B-Instruct-GGUF/resolve/main/qwen2.5-0.5b-instruct-q4_k_m.gguf

# 4. 运行
./bin/llama-cli -m qwen2.5-0.5b-instruct-q4_k_m.gguf -n 256 --temp 0.7 -p "你好,请介绍一下你自己"

4. 更省事的方法:使用 Ollama(树莓派也支持)

Ollama 官方有 ARM 版本,树莓派 5 可以直接装:

bash
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen2.5:0.5b

三、一句话总结建议

 
 
你的情况 最佳选择
笔记本,想轻松体验 安装 Ollama,运行 qwen2.5:1.5b
笔记本有 NVIDIA 显卡 运行 deepseek-coder:1.3b(代码)或 llama3.2:3b
想挑战树莓派 树莓派 5 + Ollama + qwen2.5:0.5b
纯好奇心,树莓派 4 可以试试,但要做好“每分钟一句话”的心理准备

四、性能预期(真实数据)

 
 
设备 模型 速度 体验
笔记本(i5, 16GB) Qwen2.5-1.5B 10-20 tokens/秒 流畅
笔记本(带 RTX 3050 4GB) Qwen2.5-3B 30-50 tokens/秒 非常流畅
树莓派 5(8GB) Qwen2.5-0.5B 1-3 tokens/秒 像打字机,可接受
树莓派 4(4GB) TinyLlama-1.1B 0.5-1 tokens/秒 很慢,只适合测试

如果告诉我你的笔记本具体配置(CPU/内存/显卡型号),我可以给你更精准的建议。

 

 
posted @ 2026-04-29 00:53  FBshark  阅读(177)  评论(0)    收藏  举报