信UOS英偉達(dá)CUDA異構(gòu)平臺下vLLM部署手冊)
部署環(huán)境說明服務(wù)器浪潮NF5468M6服務(wù)器操作系統(tǒng)UOS V2510VLLM版本0.11.2訓(xùn)練卡NVIDIA A100 X 2Python版本3.11.6大語言模型DeepSeek-R1-Distill-Qwen-1.5B部署步驟1.CUDA異構(gòu)平臺安裝部署參考統(tǒng)信UOS環(huán)境下英偉達(dá)CUDA異構(gòu)平臺部署手冊文檔完成CUDA異構(gòu)平臺安裝部署。2.物理機(jī)部署vLLM服務(wù)創(chuàng)建python虛擬環(huán)境# 安裝pip yum install python3-pip # 更新pip最新版本 pip install --upgrade pip # 創(chuàng)建虛擬環(huán)境 cd /root python3 -m venv vllm_venv #激活虛機(jī)環(huán)境 source /root/vllm_venv/bin/activate在安裝vLLM服務(wù)# 在線安裝部署vLLM服務(wù) pip install vllm0.11.2 -i https://pypi.tuna.tsinghua.edu.cn/simple #啟動vLLM服務(wù) vllm serve /root/model/DeepSeek-R1-Distill-Qwen-1.5B --served-model-name DeepSeek-R1-Distill-Qwen-1.5B --max-model-len 40960 --gpu-memory-utilization 0.8 --tensor-parallel-size 2 --api-key uniontech參數(shù)說明/root/model/DeepSeek-R1-Distill-Qwen-1.5B模型文件本地路徑served-model-nameAPI服務(wù)對應(yīng)模型名稱max-model-len上下文最大長度tensor-parallel-sizeAI訓(xùn)練卡數(shù)量api-keyvLLM服務(wù)Api的密碼gpu-memory-utilization限制GPU資源最大使用率 默認(rèn)0.9vLLM服務(wù)器驗(yàn)證curl -X POST http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -H Authorization: Bearer uniontech \ -d { model: DeepSeek-R1-Distill-Qwen-1.5B, messages: [{role: user, content: 你好請介紹一下自己}], temperature: 0.7, max_tokens: 200, stream: false }3.容器化部署vLLM服務(wù)安裝docker服務(wù)# 安裝docker yum install docker # 啟動docker服務(wù) systemctl start docker # 設(shè)置docker服務(wù)自啟動 systemctl enable docker安裝nvidia-container-toolkit參考統(tǒng)信UOS環(huán)境下英偉達(dá)CUDA異構(gòu)平臺部署手冊文檔中第八步。容器化啟動vLLM服務(wù)docker run -d \ --name vllm-openapi \ --networkhost \ --shm-size4gb \ --ulimit nofile65535:65535 \ --ulimit memlock-1:-1 \ --gpusall \ -v /data/models/:/home/models/ \ registry.uniontech.com/uos-ai/uos-server-2500-vllm-cuda-gpu:0.11.2 \ --model /home/models/DeepSeek-R1-Distill-Qwen-1.5B \ --served-model-name DeepSeek-R1-Distill-Qwen-1.5B \ --max-model-len 4096 \ --tensor-parallel-size 1 \ --gpu-memory-utilization 0.8 \ --api-key uniontech參數(shù)說明/home/model/DeepSeek-R1-Distill-Qwen-1.5B模型文件本地路徑served-model-nameAPI服務(wù)對應(yīng)模型名稱max-model-len上下文最大長度tensor-parallel-sizeAI訓(xùn)練卡數(shù)量api-keyvLLM服務(wù)Api的密碼gpu-memory-utilization限制GPU資源最大使用率 默認(rèn)0.9vLLM服務(wù)器驗(yàn)證curl -X POST http://localhost:8000/v1/chat/completions \ -H Content-Type: application/json \ -H Authorization: Bearer uniontech \ -d { model: DeepSeek-R1-Distill-Qwen-1.5B, messages: [{role: user, content: 你好請介紹一下自己}], temperature: 0.7, max_tokens: 200, stream: false }