name: llm-transformers-translation services: translation-api: image: ${TRANSFORMERS_IMAGE:-vllm/vllm-openai:v0.10.2} container_name: ${TRANSFORMERS_CONTAINER_NAME:-llm-transformers-translation} restart: unless-stopped ipc: host ports: - "${TRANSFORMERS_HOST_PORT:-8010}:8010" environment: HF_HOME: /root/.cache/huggingface MODEL_PATH: ${MODEL_PATH:-/models/translation/lmt-60-4b} SERVED_MODEL_NAME: ${SERVED_MODEL_NAME:-lmt-60-4b} PORT: "8010" LOAD_ON_START: ${LOAD_ON_START:-0} volumes: - ${HOST_APP_DIR:-Z:/LLM/model-chat-app}:/app - ${HOST_MODELS_DIR:-Z:/LLM/models}:/models - ${HOST_HF_CACHE_DIR:-Z:/LLM/models/cache/huggingface}:/root/.cache/huggingface working_dir: /app entrypoint: python3 command: - scripts/transformers_plugin_server.py - --plugin - translation - --host - 0.0.0.0 - --port - "8010" deploy: resources: reservations: devices: - driver: nvidia count: all capabilities: - gpu