DeepSeek复现:TinyZero项目的配置及安装

来源:

全球掀DeepSeek复现狂潮!硅谷巨头神话崩塌,30刀见证啊哈时刻




本文使用的是0.5B的大语言模型,根据上面的资料(全球掀DeepSeek复现狂潮!硅谷巨头神话崩塌,30刀见证啊哈时刻)可以知道0.5B的大模型并不会出现思维链,因此无法成功训练出解决问题的模型。


那么为什么这里不使用1.5B或者3B的大语言模型呢,答案就是0.5B的模型就用了80GB的显存,如果是1.5B或者3B的LLMs,那么这个硬件的开销是租都租不起的。


为了完成本文中给出的安装步骤,共花费80元RMB,最终结论就是大模型这东西真不是一般人可以搞的,没钱没法搞,自己贴了小一百块才配置成功环境跑了个0.5B的模型的RL训练。










1. 源码下载:

git clone https://github.com/Jiayi-Pan/TinyZero




2. 升级pip

python3 -m pip install --upgrade pip




3. 安装并配置huggingface


pip install huggingface_hub




4. 安装命令:

注意下面的环境软件版本,python版本 3.9, 3.11均测试成功。


conda create -n zero python=3.9

conda activate zero


install torch [or you can skip this step and let vllm install the correct version for you]

pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/cu121


install vllm

pip3 install vllm==0.6.3 # or you can install 0.5.4, 0.4.2 and 0.3.1


pip3 install ray


verl

pip install -e .


flash attention 2 (5090显卡下可以正常执行)

pip3 install flash-attn --no-build-isolation


quality of life

pip install wandb IPython matplotlib


多次卡死后Ctrl+C中断后重新安装成功。(5060ti显卡下可以成功执行)

pip install flash-attn==2.7.3 --no-build-isolation


安装过程中会进行编译,用时在30分钟以上,需要耐心等待。

实测,2.8.3版本的flash-attn即使安装成功运行后也会报错(5090ti显卡环境下)。


image




关于flash-attn的安装


由于多次安装flash-attn卡死,于是采用直接安装编译后版本而不是从源码开始重新编译(pip的方式为源码编译方式),源码下载地址:

https://github.com/Dao-AILab/flash-attention/releases


由于当前的 flash-attn 的稳定版本为2.8.3,于是选择该版本,同时本机的python为3.11, pytorch为2.4版本,cuda为12.1版本,于是选择具体版本为:

https://github.com/Dao-AILab/flash-attention/releases/download/v2.8.3/flash_attn-2.8.3+cu12torch2.4cxx11abiFALSE-cp311-cp311-linux_x86_64.whl



image




下载该版本到Windows主机上在通过xshell软件上传到nvidia云服务器上:


image




5. huggingface模型下载:


export HF_ENDPOINT=https://hf-mirror.com


hf download Qwen/Qwen2.5-0.5B-Instruct --local-dir Qwen2.5-0.5B-Instruct


image




6. 下载数据集:


export HF_ENDPOINT=https://hf-mirror.com


hf download Jiayi-Pan/Countdown-Tasks-3to4 --local-dir Countdown-Tasks-3to4 --repo-type dataset


image




7. 数据预处理


conda activate zero


python ./examples/data_preprocess/countdown.py --local_dir "../Countdown-Tasks-3to4"


image


image




8. 登录wandb账号


wandb login


输入API key:

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




image




8. 完整的运行命令


export N_GPUS=1
export BASE_MODEL="../Qwen2.5-0.5B-Instruct"
export DATA_DIR="../Countdown-Tasks-3to4"
export ROLLOUT_TP_SIZE=1
export EXPERIMENT_NAME=countdown-qwen2.5-0.5b
export VLLM_ATTENTION_BACKEND=XFORMERS

bash ./scripts/train_tiny_zero.sh
















显卡环境:


image



注意显存需要大于50GB,因此只能使用H800、A100 等型号显卡。



image



image



image




硬件平台上需要注意的条件是:


显卡的显存至少需要80GB,因为该程序运行过程中最高的显存需求高于70GB,虽然这个程序使用的模型是0.5B,但是该模型运行过程中加上缓存、优化器等等方面,总的显存峰值不低于70GB,也就是说这个程序你只能使用80GB的显卡来运行(再不修改默认运行参数的情况下)。


image




相关:

深度学习 —— 人工智能 —— 大语言模型(LLM) —— flash-attn 安装卡死

huggingface下载数据集报错:如何解决huggingface的网络问题 —— 代理

posted on 2026-04-04 14:20  Angry_Panda  阅读(75)  评论(0)    收藏  举报

导航