docker部署qwen3.5

docker run -d -v /mnt/data0:/data \
           -p 8000:8000 \
	       -e TZ=Asia/Shanghai \
	       --gpus all \
           --ipc=host \
           --name qwen35 \
           vllm/vllm-openai:latest-cu130 /data/models/Qwen3.5-35B-A3B \
	                                     --served-model-name qwen35 \
                                         --tensor-parallel-size 4 \
                                         --max-model-len 262144 \
                                         --port 8000 \
                                         --reasoning-parser qwen3 \
                                         --enable-prefix-caching \
					                     --enable-auto-tool-choice \
                                         --tool-call-parser qwen3_coder

四卡部署,支持ai agent访问

posted @ 2026-04-22 14:52  evanbp  阅读(55)  评论(0)    收藏  举报