Search papers, labs, and topics across Lattice.
Fudan University, Shanghai Innovation Institute, Tencent YoutuLab
2
0
3
Categorical value learning can significantly enhance the performance of PPO critics in reinforcement learning, leading to better calibration and lower variance in advantage estimation.
SVoT achieves a remarkable 65% accuracy boost in spatial reasoning tasks by making intermediate states verifiable and integrating transition reasoning.