使用 Docker 自部署 LLM 推理服务完整指南
手把手教你用 Docker + vLLM 部署大模型推理服务,支持 OpenAI 兼容 API,适合本地开发和内网使用。
2026年7月14日1 次阅读
使用 Docker 自部署 LLM 推理服务
环境准备
- Docker 24+ 和 Docker Compose V2
- NVIDIA GPU(建议 24GB+ 显存)
- Linux 或 WSL2
部署 vLLM
# docker-compose.yml
version: "3.8"
services:
vllm:
image: vllm/vllm-openai:latest
runtime: nvidia
environment:
- NVIDIA_VISIBLE_DEVICES=all
command: --model deepseek-ai/deepseek-coder-6.7b-instruct
ports:
- "8000:8000"
调用 API
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-coder","messages":[{"role":"user","content":"写一个 Python 快速排序"}]}'