Search papers, labs, and topics across Lattice.
Independent Researcher
1
0
3
7
GRPO fails to improve performance in small language models, revealing a critical scale-dependent limitation in reinforcement learning applications.