thu-rllab
Popular repositories Loading
Repositories
- GPS Public
[ICML 2026] Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models
- MoPPS Public
[KDD 2026] Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?
- ANQ Public
[NeurIPS 2025] Adaptive Neighborhood-Constrained Q Learning for Offline Reinforcement Learning
- PDTS_project_page Public
- PDTS Public
[ICML 2025] Fast and Robust: Task Sampling with Posterior and Diversity Synergies for Adaptive Decision-Makers in Randomized Environments
- LaRe Public
[AAAI-25] Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning.
- CFCQL Public
Code for NeurIPS2023 accepted paper: Counterfactual Conservative Q Learning for Offline Multi-agent Reinforcement Learning.
Top languages
Loading…
Most used topics
Loading…