Jetson Orin Nano 刷机、Docker GPU 环境与大语言模型部署实践(Ollama / vLLM)
Jetson Orin Nano 虽然只有 8GB 内存,但仍然可以运行一些 7B 以下的大语言模型。虽然性能无法满足生产需求,但对于学习 LLM 推理原理、GPU推理框架、模型部署方式 非常有帮助。
本文记录 Jetson Orin Nano 从 刷机 → 环境配置 → Docker GPU → LLM部署(Ollama / vLLM) 的完整实践流程。
一、Jetson Orin Nano 刷机
1 进入 Recovery 模式
Jetson Orin Nano 刷机需要进入 Force Recovery Mode。
步骤:
-
短接 2号和3号针脚
-
使用 USB 数据线连接电脑
-
给 Jetson Orin Nano 上电
此时设备进入 Recovery模式,可以被电脑识别。
2 安装 SDK Manager
下载:
https://developer.nvidia.com/sdk-manager
从 SDK Manager 2.4.0 开始:
-
支持 Windows 直接刷机
-
不再必须使用 Ubuntu 主机
3 选择刷写组件
SDK Manager 会显示三个组件:
| 组件 | 作用 |
|---|---|
| Jetson Linux | Jetson 操作系统 |
| Jetson Runtime Components | AI运行库,运行 AI 推理程序 |
| Jetson SDK Components | 开发工具 |
如果只是运行模型通常只选择:Jetson Linux Jetson、Runtime Components即可。
4 刷机过程中两个提示
第一次弹窗
配置:
-
Ubuntu 用户名
-
密码
-
安装位置
推荐:NVMe 性能最好。
随后会提示 此时 SDK Manager 会提示连接中断,这是正常现象。此时需要重新给 Jetson 上电(重启设备),注意不是重新插 USB
第二次弹窗
选择网络连接方式:
推荐:USB SDK Manager 会通过 USB 虚拟网卡连接设备。
二、GPU 驱动检查
执行:
三、安装 jtop(Jetson 监控工具)
jtop 是 Jetson 平台非常常用的监控工具。
可以实时查看:
-
CPU
-
GPU
-
内存
-
温度
-
功耗
-
GPU频率
安装:
启动服务:
重启系统:
运行:
四、安装 NVIDIA Docker GPU 支持
Docker 默认 无法使用 GPU,需要安装:nvidia-container-toolkit 它的作用是允许 Docker容器访问 GPU、CUDA、驱动设备。
安装:
重启 docker:
加入 docker 用户组:
配置默认 GPU Runtime
编辑:/etc/docker/daemon.json,加入"default-runtime": "nvidia"
{
"runtimes": {
"nvidia": {
"args": [],
"path": "nvidia-container-runtime"
}
},
"default-runtime": "nvidia"
}
检查 runtime 是否生效:
docker info | grep -i runtime
五、安装 JetPack AI 软件栈
JetPack 是 NVIDIA 为 Jetson 平台提供的 官方 AI 软件栈,可以理解为 Jetson 上运行 AI 应用的完整基础环境。
JetPack 中主要包含以下核心组件:
| 组件 | 作用 |
|---|---|
| CUDA | GPU 并行计算框架 |
| cuDNN | 深度学习加速库 |
| TensorRT | 深度学习推理优化引擎 |
| VPI | 视觉处理库 |
| Multimedia API | 视频编解码与图像处理 |
这些组件共同构成 Jetson 的 AI 推理运行环境。
在运行 PyTorch、TensorRT、vLLM、Ollama 等 AI 推理程序时,都需要依赖 JetPack 中提供的 GPU 计算库。
在本文的环境中,安装 JetPack 的主要作用是:
-
提供 CUDA GPU 计算能力
-
提供 深度学习推理加速库
-
为后续 Docker GPU 容器、LLM 推理框架 提供底层支持
简单理解:JetPack = Jetson 的 AI 运行环境
安装:
sudo apt update
sudo apt install nvidia-jetpack
六、安装 jetson-containers
七、Ollama 部署大语言模型
参考:https://www.jetson-ai-lab.com/tutorials/ollama/
八、vLLM 部署大模型
官方支持:https://www.jetson-ai-lab.com/models/
Jetson 官方更推荐vLLM而不是 Ollama。
原因:
-
推理性能更高
-
支持 OpenAI API
-
支持更多模型
拉取镜像
这个镜像:
-
专门为 Jetson 编译
-
CUDA 已适配
-
支持最新 vLLM
启动 vLLM并运行模型
启动容器后运行模型
vllm serve Qwen/Qwen3-4B-AWQ --port 8000 \
--quantization awq \
--gpu-memory-utilization 0.55 \
--enforce-eager \
--max-model-len 4096
调用:
curl http://localhost:8000/v1/completions \
-H "Content-Type: application/json" \
-d '{
"model": "Qwen/Qwen3-4B-AWQ",
"prompt": "你好,请介绍一下自己",
"max_tokens": 128,
"temperature": 0.7
}'
常见参数:
| 参数 | 作用 |
|---|---|
| --runtime nvidia | 启用 GPU |
| --network host | 使用宿主机网络 |
| --shm-size | 共享内存 |
| --rm | 退出删除容器 |
| -it | 交互模式 |
| -v | 挂载目录 |
| -e | 设置环境变量 |
| --ulimit | 系统资源限制 |
例如:--shm-size=8g 用于:增加共享内存,防止模型加载失败。
vLLM 启动参数说明
参数说明:
| 参数 | 作用 |
|---|---|
| --port | API端口 |
| --tp-size | tensor parallel数量 |
| --mem-fraction-static | GPU显存使用比例 |
| --context-length | 最大上下文长度 |
高级参数:
| 参数 | 作用 |
|---|---|
| --reasoning-parser | 推理模型解析 |
| --speculative-algo | speculative decoding |
| --speculative-num-steps | 推测步数 |
这些参数主要用于:提高推理速度
HuggingFace 模型管理
安装 CLI:
登录:
常用命令:
九、Open WebUI
Open WebUI 是 Ollama 的 Web 界面。
vLLM 默认只有 API,可以使用 Open WebUI。
为Ollama启动
访问:http://JETSON_IP:8080 即可使用 Web UI。
十、Jetson Orin Nano 运行模型建议
推荐模型:
| 模型 | 推荐 |
|---|---|
| Qwen2.5-1.5B | 流畅 |
| Qwen2.5-3B | 可用 |
| Qwen2.5-7B | 勉强 |
量化版本:Q4 Q5 更适合 8GB 设备。
总结
Jetson Orin Nano 运行 LLM 的软件架构:
Jetson Linux
↓
JetPack (CUDA + TensorRT)
↓
NVIDIA Container Toolkit
↓
Docker
↓
LLM Runtime
├── Ollama
└── vLLM
| 工具 | 特点 |
|---|---|
| Ollama | 简单易用 |
| vLLM | 推理性能更强 |


浙公网安备 33010602011771号