Search papers, labs, and topics across Lattice.
Affiliation:
2
0
2
10
A carefully designed critic can provide a stable and efficient alternative to traditional group-relative advantage estimation in reinforcement learning for language models.
Predictive divergence masks significantly enhance the stability of RL updates in LLMs, outperforming traditional methods by aligning direction criteria with actual divergence changes.