Search papers, labs, and topics across Lattice.
1
0
2
Teacher rewards can mislead learning, but R2-OPD filters out conflicting feedback to boost reasoning performance in language models.