Files

39 lines
1.1 KiB
YAML

name: llm-transformers-translation
services:
translation-api:
image: ${TRANSFORMERS_IMAGE:-vllm/vllm-openai:v0.10.2}
container_name: ${TRANSFORMERS_CONTAINER_NAME:-llm-transformers-translation}
restart: unless-stopped
ipc: host
ports:
- "${TRANSFORMERS_HOST_PORT:-8010}:8010"
environment:
HF_HOME: /root/.cache/huggingface
MODEL_PATH: ${MODEL_PATH:-/models/translation/lmt-60-4b}
SERVED_MODEL_NAME: ${SERVED_MODEL_NAME:-lmt-60-4b}
PORT: "8010"
LOAD_ON_START: ${LOAD_ON_START:-0}
volumes:
- ${HOST_APP_DIR:-Z:/LLM/model-chat-app}:/app
- ${HOST_MODELS_DIR:-Z:/LLM/models}:/models
- ${HOST_HF_CACHE_DIR:-Z:/LLM/models/cache/huggingface}:/root/.cache/huggingface
working_dir: /app
entrypoint: python3
command:
- scripts/transformers_plugin_server.py
- --plugin
- translation
- --host
- 0.0.0.0
- --port
- "8010"
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities:
- gpu