Files
llm/plugins/1c/training/README.md
T

46 lines
1.9 KiB
Markdown

# 1C Training
Контур дообучения для 1С.
Рекомендуемый порядок:
1. собрать проверенные примеры;
2. удалить секреты и персональные данные;
3. привести к chat/instruction формату;
4. прогнать базовые eval-тесты;
5. обучить LoRA/adapter;
6. сравнить базовую модель, RAG и адаптер;
7. опубликовать адаптер через model card.
## Data Validation
Синтетический пример:
```powershell
python scripts/validate_1c_training_data.py plugins/1c/training/examples/instruction.examples.jsonl
python scripts/generate_1c_training_data.py
python scripts/validate_1c_training_data.py plugins/1c/training/raw/generated.instruction.jsonl
python scripts/prepare_1c_training_data.py --input plugins/1c/training/examples/instruction.examples.jsonl --output plugins/1c/training/prepared/train.chat.jsonl
```
`prepare_1c_training_data.py` автоматически добавляет `plugins/1c/training/raw/generated.instruction.jsonl`, если файл существует. `generate_1c_training_data.py` также добавляет проверенные write-route примеры из `reports/1c-sql/upo_test/write-matrix-verified-registry-*.json` и manual learning-plan примеры из `write-learning-plan-*.json`; лимиты регулируются `--max-write-records` и `--max-learning-records`. `raw` и `prepared` игнорируются git. Реальные обучающие данные должны проходить secret-scan и экспертное ревью.
## LoRA Training
Config: `plugins/1c/training/configs/qwen3-coder-30b-a3b-lora.yaml`.
Preflight:
```powershell
python scripts/preflight_1c_training.py
```
Dry run:
```powershell
python scripts/train_1c_lora.py --dry-run
```
Runbook: `docs/runbooks/1c-lora-training.md`.