小白攻略:从零开始微调属于你的 Qwen3.5-9B 机器人
第一步:算力租赁(AutoDL 省钱大法)
为什么选 AutoDL?新手友好!便宜、按小时计费、自带显卡。但显卡很贵,我们不要在配置环境时开着显卡烧钱!
实操步骤:
打开https://autodl.com/home创建实例。
关键省钱技巧:选择镜像后,先点击“无卡模式开机”(此时不扣费或只扣极低的存储费)。
在无卡模式下,完成下面的 2-4 步(下载安装包、下载模型)。
切回显卡:需要训练时,去控制台点击“重启实例”,选择“正常开机”(带显卡),这样显卡驱动才能被代码识别。
镜像选择,以及配置选择如下

第二步:版本适配(一定要适配!)
最容易踩的坑:Python 的依赖包版本互相打架。以下的版本组合是经过实战锁死的“黄金搭档”。
- torch==2.8.0
- torchvision==0.23.0
- torchaudio==2.8.0
- transformers==5.3.0
- vllm == 0.17.1
- ms-swift == 4.4.2
第三步:工具下载(换国内源,速度起飞)
# 安装 Swift 全家桶(如果网络报错,多试几次)
pip install 'ms-swift[all]' -U -i https://pypi.tuna.tsinghua.edu.cn/simple/
# 单独锁死 transformers 版本
pip install transformers==5.3.0 -i https://pypi.tuna.tsinghua.edu.cn/simple/
# 安装 ModelScope(魔塔社区)用来下载国内镜像的模型,比从 HuggingFace 快 10 倍
pip install modelscope
第四步:下载指定模型(注意硬盘位置!)
注意:AutoDL 的硬盘分两块,系统盘(/root)一般只有 50G,数据盘(/root/autodl-tmp)才有几百 G。
Qwen3.5-9B 模型将近 20G,必须下载到数据盘!
执行以下 Python 脚本:
from modelscope import snapshot_download
# 指定下载到数据盘
model_dir = snapshot_download('Qwen/Qwen3.5-9B', cache_dir='/root/autodl-tmp/model/')
# 打印出真实的路径,第五步会用到!
print(f"模型实际地址是: {model_dir}")
运行后,控制台会打印出一串地址,请复制这串真实地址,继续进行下一步。
第五步:部署模型(测试模型是否正常)
这一步是通过 vLLM 把模型启动成一个“网页服务器”,方便我们后面测试。
注意:这一步对显卡显存要求较高(9B模型大约需要 18-20G 显存),A100 或 RTX 4090 比较稳。
地址记得替换(请替换成你第四步打印出的真实路径):
python -m vllm.entrypoints.openai.api_server \ --model /root/autodl-tmp/model/models/Qwen--Qwen3.5-9B/snapshots/这里替换成真实的哈希值文件夹 \ --host 0.0.0.0 \ --port 6006 \ --dtype auto \ --trust-remote-code \ --max-model-len 8192 \ # 小白建议先给 8192,给 32768 容易爆显存 --gpu-memory-utilization 0.85 \ # 留 15% 显存给系统,不要拉满 0.9 --max-num-seqs 32
如果报错 OOM(显存不足):把 --max-model-len降到 4096,或者把 --gpu-memory-utilization降到 0.7试试
第六步:自我认知微调
什么是自我认知微调?就是给模型喂几百条对话数据,告诉它:“当别人问你叫什么的时候,回答test-robot;当别人问谁创造了你,回答test”。
CUDA_VISIBLE_DEVICES=0 \
swift sft \
--model /root/autodl-tmp/model/models/Qwen--Qwen3.5-9B/snapshots/master \
--tuner_type lora \
--dataset 'AI-ModelScope/alpaca-gpt4-data-zh#100' \
'AI-ModelScope/alpaca-gpt4-data-en#100' \
'swift/self-cognition#100' \
--torch_dtype float16 \
--num_train_epochs 1 \
--per_device_train_batch_size 1 \
--per_device_eval_batch_size 1 \
--learning_rate 1e-4 \
--lora_rank 8 \
--lora_alpha 32 \
--target_modules all-linear \
--gradient_accumulation_steps 16 \
--eval_steps 50 \
--save_steps 50 \
--save_total_limit 2 \
--logging_steps 5 \
--max_length 2048 \
--output_dir output \
--warmup_ratio 0.05 \
--dataloader_num_workers 4 \
--model_author 'test' \ #可自定义
--model_name 'test-robot'
训练结束后,终端会显示

第七步:测试微调效果(验收环节)
用 Swift 自带的交互式命令行来聊天,看看它有没有学会自我介绍。
命令(请将路径替换为你真实的 checkpoint 路径):
# 使用交互式命令行推理
CUDA_VISIBLE_DEVICES=0 \
swift infer \
--adapters /root/autodl-tmp/output/v7-20260809-140958/checkpoint-19 \
--stream true \
--temperature 0 \
--max_new_tokens 2048
验收测试:
启动后,在命令行输入:
“你好,你是谁创造的?”
“请介绍一下你自己。”
如果它回答包含test和test-robot,那么微调成功!

浙公网安备 33010602011771号