docker部署qwen3.5
docker run -d -v /mnt/data0:/data \
-p 8000:8000 \
-e TZ=Asia/Shanghai \
--gpus all \
--ipc=host \
--name qwen35 \
vllm/vllm-openai:latest-cu130 /data/models/Qwen3.5-35B-A3B \
--served-model-name qwen35 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--port 8000 \
--reasoning-parser qwen3 \
--enable-prefix-caching \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
四卡部署,支持ai agent访问
浙公网安备 33010602011771号