Search papers, labs, and topics across Lattice.
University of Chinese Academy of Sciences
1
0
3
GRPO fails to improve performance in small language models, revealing a critical scale-dependent limitation in reinforcement learning applications.