Search papers, labs, and topics across Lattice.
University of Chinese Academy of Sciences
2
0
5
9
GRPO fails to improve performance in small language models, revealing a critical scale-dependent limitation in reinforcement learning applications.
Forget hand-crafted rules: AutoPPA learns circuit optimization strategies directly from contrasting code examples, outperforming both human experts and existing automated methods.