Search papers, labs, and topics across Lattice.
Affiliation:
1
0
2
A carefully designed critic can provide a stable and efficient alternative to traditional group-relative advantage estimation in reinforcement learning for language models.