Search papers, labs, and topics across Lattice.
1
0
2
4
Contrastive Policy Optimization reveals that distinguishing between correct and incorrect responses can significantly enhance reinforcement learning performance.