Dual-LLM reinforcement learning experiments for budget allocation.
src/common: shared environment and utility functionssrc/llma/train.py: standalone LLMA trainingsrc/llmb/train.py: LLMB training with LLMA-assisted rolloutscripts/generate_dataset.py: synthetic dataset generationconfigs/config.py: centralized defaults for model path and logging config
pip install -r requirements.txtcp .env.example .envCommon variables:
DARA_MODEL_PATH(default:Qwen/Qwen2.5-3B-Instruct)WANDB_MODE(default:offline)WANDB_PROJECT(default:dara)WANDB_API_KEY(only needed for online W&B)
python scripts/generate_dataset.pypython src/llma/train.py
python src/llmb/train.py- Current defaults target research experimentation, not production training pipelines.
- Multi-GPU and
flash_attention_2settings depend on your local CUDA/PyTorch stack. - If you do not want online tracking, keep
WANDB_MODE=offline.
MIT. See LICENSE.