Search papers, labs, and topics across Lattice.
School of Artificial Intelligence, Nanjing University
1
0
1
4
Value Flattening is identified as an important yet overlooked failure mode of critic learning in standard PPO and a simple sparse supervision strategy can mitigate it; SParse Proximal Policy Optimization is introduced, which applies the value loss to only a few well-separated states in each response to mitigate both effects.