Checkpoints for the paper SLPO: Scaling Latent Reasoning with Surrogate Policy Optimization.
Note COCONUT+SLPO (GPT-2); gate thr=0.6
Note CODI+SLPO (GPT-2); gate thr=0.7