DeepSeek复现:TinyZero项目的配置及安装
来源:
全球掀DeepSeek复现狂潮!硅谷巨头神话崩塌,30刀见证啊哈时刻
本文使用的是0.5B的大语言模型,根据上面的资料(全球掀DeepSeek复现狂潮!硅谷巨头神话崩塌,30刀见证啊哈时刻)可以知道0.5B的大模型并不会出现思维链,因此无法成功训练出解决问题的模型。
那么为什么这里不使用1.5B或者3B的大语言模型呢,答案就是0.5B的模型就用了80GB的显存,如果是1.5B或者3B的LLMs,那么这个硬件的开销是租都租不起的。
为了完成本文中给出的安装步骤,共花费80元RMB,最终结论就是大模型这东西真不是一般人可以搞的,没钱没法搞,自己贴了小一百块才配置成功环境跑了个0.5B的模型的RL训练。
1. 源码下载:
git clone https://github.com/Jiayi-Pan/TinyZero
2. 升级pip
python3 -m pip install --upgrade pip
3. 安装并配置huggingface
pip install huggingface_hub
4. 安装命令:
注意下面的环境软件版本,python版本 3.9, 3.11均测试成功。
conda create -n zero python=3.9
conda activate zero
install torch [or you can skip this step and let vllm install the correct version for you]
pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/cu121
install vllm
pip3 install vllm==0.6.3 # or you can install 0.5.4, 0.4.2 and 0.3.1
pip3 install ray
verl
pip install -e .
flash attention 2 (5090显卡下可以正常执行)
pip3 install flash-attn --no-build-isolation
quality of life
pip install wandb IPython matplotlib
多次卡死后Ctrl+C中断后重新安装成功。(5060ti显卡下可以成功执行)
pip install flash-attn==2.7.3 --no-build-isolation
安装过程中会进行编译,用时在30分钟以上,需要耐心等待。
实测,2.8.3版本的flash-attn即使安装成功运行后也会报错(5090ti显卡环境下)。

关于flash-attn的安装
由于多次安装flash-attn卡死,于是采用直接安装编译后版本而不是从源码开始重新编译(pip的方式为源码编译方式),源码下载地址:
https://github.com/Dao-AILab/flash-attention/releases
由于当前的 flash-attn 的稳定版本为2.8.3,于是选择该版本,同时本机的python为3.11, pytorch为2.4版本,cuda为12.1版本,于是选择具体版本为:

下载该版本到Windows主机上在通过xshell软件上传到nvidia云服务器上:

5. huggingface模型下载:
export HF_ENDPOINT=https://hf-mirror.com
hf download Qwen/Qwen2.5-0.5B-Instruct --local-dir Qwen2.5-0.5B-Instruct

6. 下载数据集:
export HF_ENDPOINT=https://hf-mirror.com
hf download Jiayi-Pan/Countdown-Tasks-3to4 --local-dir Countdown-Tasks-3to4 --repo-type dataset

7. 数据预处理
conda activate zero
python ./examples/data_preprocess/countdown.py --local_dir "../Countdown-Tasks-3to4"


8. 登录wandb账号
wandb login
输入API key:
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

8. 完整的运行命令
export N_GPUS=1
export BASE_MODEL="../Qwen2.5-0.5B-Instruct"
export DATA_DIR="../Countdown-Tasks-3to4"
export ROLLOUT_TP_SIZE=1
export EXPERIMENT_NAME=countdown-qwen2.5-0.5b
export VLLM_ATTENTION_BACKEND=XFORMERS
bash ./scripts/train_tiny_zero.sh
显卡环境:

注意显存需要大于50GB,因此只能使用H800、A100 等型号显卡。



硬件平台上需要注意的条件是:
显卡的显存至少需要80GB,因为该程序运行过程中最高的显存需求高于70GB,虽然这个程序使用的模型是0.5B,但是该模型运行过程中加上缓存、优化器等等方面,总的显存峰值不低于70GB,也就是说这个程序你只能使用80GB的显卡来运行(再不修改默认运行参数的情况下)。

相关:
posted on 2026-04-04 14:20 Angry_Panda 阅读(75) 评论(0) 收藏 举报
浙公网安备 33010602011771号