Search papers, labs, and topics across Lattice.
Affiliation:
1
0
2
Adaptive self-distillation can boost model performance by over 23 points without extra rollouts, reshaping how we approach teacher-student dynamics in training.