Search papers, labs, and topics across Lattice.
1
0
3
12
H$^2$SD achieves superior reasoning performance by intelligently adapting teacher signals based on trajectory outcomes, leading to more effective learning in large language models.