Pinned
[1/8] A prevailing narrative in post-training: SFT memorizes, RL generalizes.
We revisit this for reasoning SFT and find that cross-domain generalization is NOT absent, but highly conditional, jointly depending on optimization, data, and base model capability.
📄 Arxiv:





