5.1 KiB
5.1 KiB
Q6 LoRA Troubleshooting
Цель: короткая памятка по типовым проблемам при обучении, конвертации и публикации Qwen3-Coder Q6 с LoRA.
Main Rule
На docker-gpu training/download контейнеры должны видеть код из Z:\LLM\model-chat-app, а не напрямую из Z:\codex\LLM.
Актуальный поток такой:
- локальный репозиторий архивируется;
- архив синхронизируется в
Z:\LLM\model-chat-app; - training/download контейнеры используют этот каталог как
/workspaceили/app.
Если новые scripts, plugins или registry/model-cards не попали в model-chat-app, контейнеры будут работать на старом коде.
Quick Checks
Проверить GPU host:
powershell -NoProfile -ExecutionPolicy Bypass -File scripts/check_gpu_host.ps1 -SshTarget docker-gpu
Показать план полного пайплайна:
powershell -NoProfile -ExecutionPolicy Bypass -File scripts/train_and_publish_q6_lora.ps1 -PlanOnly
Прогнать только безопасный preflight:
powershell -NoProfile -ExecutionPolicy Bypass -File scripts/train_and_publish_q6_lora.ps1 -SkipDownload -SkipTrain -SkipConvert -SkipRestart -SkipSmoke
Common Failures
Model card not found for id qwen3-coder-30b-a3b-instruct
Причина:
- контейнер загрузки стартовал раньше, чем новый
model cardпопал вZ:\LLM\model-chat-app.
Что делать:
. .\scripts\app_archive.ps1
$archive = New-AppArchive
Test-AppArchive -Archive $archive
Sync-AppDirectory -SshTarget docker-gpu -RemoteArchive 'C:\ProgramData\LLM\model-chat-app.zip' -RemoteAppDir 'Z:\LLM\model-chat-app' -Archive $archive
docker -H ssh://docker-gpu rm -f llm-hf-range-qwen3-coder-base
powershell -NoProfile -ExecutionPolicy Bypass -File scripts\download_hf_range_gpu.ps1 -CardId qwen3-coder-30b-a3b-instruct -LocalDir /models/base/qwen3-coder-30b-a3b-instruct -Detached -ContainerName llm-hf-range-qwen3-coder-base
requirements-training.txt not found
Причина:
- training container смонтировал неправильный workspace path.
Правильное ожидание:
HOST_WORKSPACE_DIR=Z:/LLM/model-chat-app- wrapper
scripts/run_1c_lora_training_gpu.ps1сам синхронизирует текущий код вmodel-chat-appпередdocker compose up.
base model is incomplete at /models/base/qwen3-coder-30b-a3b-instruct
Причина:
- HF-база еще не скачана полностью.
Что смотреть:
docker -H ssh://docker-gpu logs -f llm-hf-range-qwen3-coder-base
docker -H ssh://docker-gpu run --rm -v Z:/LLM/models:/models alpine sh -lc "ls -lah /models/base/qwen3-coder-30b-a3b-instruct"
Хороший признак:
- в логе идут строки
OK <filename> - появились все
model-00001-of-00016.safetensors...model-00016-of-00016.safetensors
CUDA out of memory
Причина:
- слишком тяжелая конфигурация для текущего режима RTX 4090.
Что делать:
- остановить лишние тяжелые сервисы;
- убедиться, что активен только нужный training/runtime контур;
- при необходимости уменьшить training нагрузку в
plugins/1c/training/configs/qwen3-coder-30b-a3b-lora.yaml.
llama.cpp стартовал без адаптера
Причина:
- не передан
-LoraPath .ggufадаптер не был создан- опубликован не тот путь
Проверка:
docker -H ssh://docker-gpu run --rm -v Z:/LLM/models:/models alpine sh -lc "ls -lah /models/adapters/1c/qwen3-coder-30b-a3b-1c-lora-v1.gguf"
powershell -ExecutionPolicy Bypass -File scripts\manage_gpu_q6_service.ps1 -Action status -LoraPath /models/adapters/1c/qwen3-coder-30b-a3b-1c-lora-v1.gguf
Monitoring Commands
Скачивание базы:
docker -H ssh://docker-gpu logs -f llm-hf-range-qwen3-coder-base
Обучение:
docker -H ssh://docker-gpu logs -f llm-train-1c-lora
Q6 runtime:
docker -H ssh://docker-gpu logs -f llm-llama-qwen3-coder-q6-test
Endpoint check:
python scripts\check_inference_endpoint.py --base-url http://docker-gpu.cin.su:8081 --expected-model qwen3-coder-1c-q6 --print
Smoke eval:
python scripts\run_1c_smoke_eval.py --base-url http://docker-gpu.cin.su:8081 --model qwen3-coder-1c-q6
Recommended Order
- Дождаться полной загрузки HF-базы.
- Прогнать
PreflightOnly. - Запустить обучение.
- Конвертировать LoRA в GGUF.
- Перезапустить
Q6с-LoraPath. - Прогнать endpoint check и smoke eval.