# Copy to .env on the deployment host and adjust values there. # Do not commit real tokens, private paths, or credentials. LLAMA_CONTAINER_NAME=llm-llama-devstral-1c LLAMA_IMAGE=ghcr.io/ggml-org/llama.cpp:server-cuda LLAMA_HOST_PORT=8080 LLAMA_MODEL_PATH=/models/gguf/1c/devstral-small-2-24b-instruct-2512-q4_k_m/mistralai_Devstral-Small-2-24B-Instruct-2512-Q4_K_M.gguf LLAMA_SERVED_MODEL_NAME=devstral-1c-q4 LLAMA_CTX_SIZE=32768 LLAMA_GPU_LAYERS=999 LLAMA_THREADS=8 LLAMA_PARALLEL=1 LLAMA_FIT=off LLAMA_REASONING=off LLAMA_REASONING_FORMAT=none LLAMA_CHAT_TEMPLATE=mistral-v7-tekken HOST_MODELS_DIR=/models