Search papers, labs, and topics across Lattice.
1
0
2
24
Shifting regularization to the input side allows for better exploration while maintaining response stability, leading to significant performance gains in LLM policy optimization.