Search papers, labs, and topics across Lattice.
2
0
5
0
Group-Calibrated On-Policy Distillation boosts long-context reasoning performance by reconciling teacher guidance with verifier feedback, achieving up to a 12-point increase in benchmark scores.
A simple data recipe can outperform complex reward engineering in enhancing long-context reasoning for large language models.