Search papers, labs, and topics across Lattice.
B, effective rank in the late layers tracks capability in both directions; at
1
0
3
2
GRPO fails to improve performance in small language models, revealing a critical scale-dependent limitation in reinforcement learning applications.