Search papers, labs, and topics across Lattice.
1
0
2
4
Shifting regularization to the input side allows for better exploration while maintaining response stability, leading to significant performance gains in LLM policy optimization.