Files
llm/core/deploy/docker-gpu/transformers/video.compose.yaml
T

39 lines
1.1 KiB
YAML

name: llm-transformers-video
services:
video-api:
image: ${TRANSFORMERS_IMAGE:-vllm/vllm-openai:v0.10.2}
container_name: ${TRANSFORMERS_CONTAINER_NAME:-llm-transformers-video}
restart: unless-stopped
ipc: host
ports:
- "${TRANSFORMERS_HOST_PORT:-8030}:8030"
environment:
HF_HOME: /root/.cache/huggingface
MODEL_PATH: ${MODEL_PATH:-/models/video/qwen2.5-vl-7b-instruct}
SERVED_MODEL_NAME: ${SERVED_MODEL_NAME:-qwen2.5-vl-7b-instruct}
PORT: "8030"
LOAD_ON_START: ${LOAD_ON_START:-0}
volumes:
- ${HOST_APP_DIR:-Z:/LLM/model-chat-app}:/app
- ${HOST_MODELS_DIR:-Z:/LLM/models}:/models
- ${HOST_HF_CACHE_DIR:-Z:/LLM/models/cache/huggingface}:/root/.cache/huggingface
working_dir: /app
entrypoint: python3
command:
- scripts/transformers_plugin_server.py
- --plugin
- video
- --host
- 0.0.0.0
- --port
- "8030"
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities:
- gpu