大模型部署手册-英伟达
英伟达部署简单多了,没有多机(钱不够),就是vllm框架,单卡或多卡。
- 4*A40推千问2.5-14b,使用0~3卡
docker run -itd --shm-size 32g --privileged --runtime=nvidia --restart always -e NVIDIA_VISIBLE_DEVICES=0,1,2,3 --name qwen2-14b -w /app -v /app1:/app -p 8006:8000 --entrypoint "python3" 192.168.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server --served-model-name Qwen2.5-14B-Instruct --model /app/model/Qwen2.5-14B-Instruct --tensor-parallel-size 4 --max-model-len 32768 --max-num-seqs 256 --enable_chunked_prefill --trust_remote_code
- 4*A40推千问3-14b,使用4~7卡。开启工具调用。--gpu-memory-utilization 如果设置到0.95会OOM
docker run -itd --shm-size 32g --privileged --runtime=nvidia -e NVIDIA_VISIBLE_DEVICES=4,5,6,7 -e CUDA_VISIBLE_DEVICES=4,5,6,7 --name qwen3-14b --restart always -w /app -v /app2:/app -p 8007:8000 --entrypoint "python3" 192.168.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server --served-model-name qwen3-14b --model /app/model/Qwen3-14B --gpu-memory-utilization 0.9 --tensor-parallel-size 4 --max-model-len 32768 --enable_chunked_prefill --trust_remote_code --enable-auto-tool-choice --tool-call-parser hermes
- 4*A40推千问3-30b,使用4~7卡。vllm 0.20.0及以上需要nvidia driver >=580(Linux x64 (AMD64/EM64T) Display Driver 580.65.06 | Linux 64-bit | NVIDIA)。
docker run -itd --shm-size 16g --privileged=true --runtime=nvidia -e CUDA_VISIBLE_DEVICES=4,5,6,7 -e FASTAPI_TIMEOUT=600 --name qwen3-30b --restart always -w /app -v /app1/models:/models -p 8006:8000 --entrypoint "python3" 192.168.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server --served-model-name qwen3-30b --model /models/Qwen3-30B-A3B-Instruct-2507 --tensor-parallel-size 4 --trust_remote_code --max_model_len 32768 --max-num-seqs 64 --max-num-batched-tokens 131072 docker run -itd --shm-size 16g --privileged=true --runtime=nvidia -e CUDA_VISIBLE_DEVICES=4,5,6,7 -e FASTAPI_TIMEOUT=600 --name qwen3-30b --restart always -w /app -v /app1/models:/models -p 8006:8000 --entrypoint "python3" 134.175.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server --served-model-name qwen3-30b --model /models/Qwen3-30B-A3B-Instruct-2507 --tensor-parallel-size 4 --trust_remote_code --max_model_len 32768 --max-num-seqs 64 --max-num-batched-tokens 131072 --enable-auto-tool-choice --tool-call-parser hermes
- 4*A40推千问vl-4b
docker run -itd --shm-size 16g --privileged --runtime=nvidia -e CUDA_VISIBLE_DEVICES=0,1,2,3 --name qwen3-vl-4b --restart always -w /app -v /app1/models:/models -p 8007:8000 --entrypoint "python3" 192.168.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server --served-model-name qwen3-vl-4b --model /models/Qwen3-VL-4B-Instruct --tensor-parallel-size 4 --gpu-memory-utilization 0.90 --max-model-len 8192 --max-num-batched-tokens 65536 --max-num-seqs 8 --enable-auto-tool-choice --tool-call-parser hermes
浙公网安备 33010602011771号