Pinned
New Preprint Alert โฐ
Propose Dr. Post-training ๐ฉบ a Data Regularization framework, making your data more effective with ZERO overheads
Experiments demonstrate faster training convergence across SFT, RLHF, RLVR over SOTA data selection, opening up new data optimization designs!



