work hard work smart

专注于AI+Java后端开发。 不断总结,举一反三。
  博客园  :: 首页  :: 新随笔  :: 联系 :: 订阅 订阅  :: 管理

LLaMA-Factory 全面指南:从入门到实战部署

Posted on 2026-10-06 10:28  work hard work smart  阅读(6)  评论(0)    收藏  举报

什么是LLaMA-Factory?

LLaMA-Factory 是一个开源的大语言模型微调框架,由清华大学KEG实验室开发。它提供了一个简单易用的平台,让用户能够轻松地对各种大语言模型进行微调训练,无需深厚的深度学习背景知识。

该框架支持多种主流大模型架构,包括但不限于:

LLaMA/LLaMA2/LLaMA3 系列
Qwen/Qwen2/Qwen3 系列
ChatGLM 系列
Baichuan 系列
Mistral 系列
以及其他多种开源模型
核心特性

统一的微调接口

LLaMA-Factory 提供了一致的API接口,无论您选择哪种模型架构,都可以使用相同的命令和配置方式进行微调。

多种训练方法支持

全量微调 (Full Fine-tuning): 更新模型的所有参数
LoRA/QLoRA: 高效的参数微调技术,大幅降低显存需求
DoRA: 改进的LoRA变体,提供更好的性能
RSLoRA: 另一种高效的低秩适应方法

丰富的数据处理能力

支持多种数据格式(JSON、CSV等)
内置数据预处理工具
支持指令跟随、对话、文本生成等多种任务类型

WebUI 界面

提供直观的图形界面,使模型微调过程更加可视化,降低使用门槛。

多平台兼容

支持Windows、Linux、macOS
支持CPU和GPU训练
提供Docker部署方案

环境准备

在开始使用LLaMA-Factory之前,您需要准备以下环境:

硬件要求

GPU: 推荐NVIDIA GPU,显存至少4GB(使用LoRA可降低至2GB)
CPU: 支持CPU训练,但速度较慢
内存: 至少8GB RAM
存储: 至少20GB可用空间

软件要求

Python 3.8+
PyTorch 1.13+
CUDA 11.7+ (如果使用GPU)
Git
Docker (可选,推荐用于简化部署)

快速开始:两种部署方式

方法一:本地pip安装(适合有Python环境的用户)

克隆仓库

git clone https://github.com/hiyouga/LLaMA-Factory.git
cd LLaMA-Factory

安装依赖

pip install -r requirements.txt

或者直接通过pip安装

pip install llamafactory

方法二:Docker部署(推荐,零基础友好)

不用自己配Python环境、不用纠结CUDA版本,一条docker-compose up就能拥有全套微调环境。

我的最终配置(可直接复制)

我选择了从Git克隆源码 + Docker Compose本地构建的方式,而不是直接pull官方镜像。好处是可以随时git pull更新,并且能自定义挂载路径。

services:
  llamafactory:
    build:
      dockerfile: ./docker/docker-cuda/Dockerfile
      context: ../..
      args:
        PIP_INDEX: https://pypi.org/simple
    container_name: llamafactory
    ports:
      - "7860:7860"
      - "8000:8000"
    ipc: host
    tty: true
    # shm_size: "16gb"  # ipc: host is set
    stdin_open: true
    command: bash
    deploy:
      resources:
        reservations:
          devices:
          - driver: nvidia
            count: "all"
            capabilities: [ gpu ]
    restart: unless-stopped
    volumes:
      - D:/ai/weitiao/llamafactory/LLaMA-Factory/data:/app/data
      - D:/ai/weitiao/model/Qwen3-0.6B:/app/models/Qwen3-0.6B
      - D:/ai/weitiao/llamafactory/saves:/app/saves

数据集目录(宿主机 → 容器)
D:/ai/weitiao/llamafactory/LLaMA-Factory/data:/app/data

本地已下载的Qwen3-0.6B模型(避免重复下载)
D:/ai/weitiao/model/Qwen3-0.6B:/app/models/Qwen3-0.6B

训练输出保存目录
D:/ai/weitiao/llamafactory/saves:/app/saves

启动步骤(已验证)

  1. 克隆LLaMA-Factory(如果你还没有)
    git clone https://github.com/hiyouga/LLaMA-Factory.git
    cd LLaMA-Factory/docker/docker-cuda

  2. 将上面的docker-compose.yml保存到当前目录

  3. 启动并进入容器
    docker-compose up -d
    docker exec -it llamafactory bash

  4. 在容器内启动WebUI
    llamafactory-cli webui

浏览器打开 http://localhost:7860 ,看到界面即成功。

总结

LLaMA-Factory 是一个功能强大且易于使用的大模型微调工具,它极大地降低了大语言模型定制的门槛。通过本文的介绍,您应该能够:

了解LLaMA-Factory的基本概念和特性
完成环境搭建和部署(本地或Docker)
无论您是选择本地安装还是Docker部署,LLaMA-Factory都提供了灵活的方案。对于初学者,我强烈推荐Docker部署方式,它可以让您专注于模型微调本身,而不是环境配置的琐碎细节。