大模型部署手册-英伟达

  英伟达部署简单多了,没有多机(钱不够),就是vllm框架,单卡或多卡。

  • 4*A40推千问2.5-14b,使用0~3卡
    docker run -itd --shm-size 32g --privileged --runtime=nvidia  --restart always -e NVIDIA_VISIBLE_DEVICES=0,1,2,3   --name qwen2-14b   -w /app   -v /app1:/app   -p 8006:8000   --entrypoint "python3"   192.168.206.2:10445/mc/vllm-openai:v0.26.0   -m vllm.entrypoints.openai.api_server   --served-model-name Qwen2.5-14B-Instruct   --model /app/model/Qwen2.5-14B-Instruct   --tensor-parallel-size 4   --max-model-len 32768   --max-num-seqs 256   --enable_chunked_prefill   --trust_remote_code
  • 4*A40推千问3-14b,使用4~7卡。开启工具调用。--gpu-memory-utilization 如果设置到0.95会OOM
    docker run -itd --shm-size 32g  --privileged --runtime=nvidia -e NVIDIA_VISIBLE_DEVICES=4,5,6,7 -e CUDA_VISIBLE_DEVICES=4,5,6,7 --name qwen3-14b --restart always -w /app -v /app2:/app -p 8007:8000 --entrypoint "python3"   192.168.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server   --served-model-name qwen3-14b   --model /app/model/Qwen3-14B --gpu-memory-utilization 0.9 --tensor-parallel-size 4   --max-model-len 32768 --enable_chunked_prefill   --trust_remote_code   --enable-auto-tool-choice   --tool-call-parser hermes
  • 4*A40推千问3-30b,使用4~7卡。vllm 0.20.0及以上需要nvidia driver >=580(Linux x64 (AMD64/EM64T) Display Driver 580.65.06 | Linux 64-bit | NVIDIA)。
    docker run -itd  --shm-size 16g  --privileged=true  --runtime=nvidia -e CUDA_VISIBLE_DEVICES=4,5,6,7  -e FASTAPI_TIMEOUT=600  --name qwen3-30b  --restart always  -w /app  -v /app1/models:/models  -p 8006:8000  --entrypoint "python3"  192.168.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server --served-model-name qwen3-30b --model /models/Qwen3-30B-A3B-Instruct-2507 --tensor-parallel-size 4 --trust_remote_code --max_model_len 32768 --max-num-seqs 64 --max-num-batched-tokens 131072 docker run -itd  --shm-size 16g  --privileged=true  --runtime=nvidia -e CUDA_VISIBLE_DEVICES=4,5,6,7  -e FASTAPI_TIMEOUT=600  --name qwen3-30b  --restart always  -w /app  -v /app1/models:/models  -p 8006:8000  --entrypoint "python3"  134.175.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server --served-model-name qwen3-30b --model /models/Qwen3-30B-A3B-Instruct-2507 --tensor-parallel-size 4 --trust_remote_code --max_model_len 32768 --max-num-seqs 64 --max-num-batched-tokens 131072 --enable-auto-tool-choice   --tool-call-parser hermes
  • 4*A40推千问vl-4b
    docker run -itd --shm-size 16g --privileged --runtime=nvidia -e CUDA_VISIBLE_DEVICES=0,1,2,3 --name qwen3-vl-4b --restart always -w /app -v /app1/models:/models -p 8007:8000 --entrypoint "python3" 192.168.206.2:10445/mc/vllm-openai:v0.26.0 -m vllm.entrypoints.openai.api_server --served-model-name qwen3-vl-4b --model /models/Qwen3-VL-4B-Instruct --tensor-parallel-size 4 --gpu-memory-utilization 0.90 --max-model-len 8192 --max-num-batched-tokens 65536 --max-num-seqs 8 --enable-auto-tool-choice   --tool-call-parser hermes
posted @ 2026-07-31 10:39  badwood  阅读(13)  评论(0)    收藏  举报
Badwood's Blog