Search papers, labs, and topics across Lattice.
Rice University
2
0
3
SoftmaxGRPO reallocates learning signals to improve performance on challenging prompts, achieving a 68.0% success rate on Poetry with minimal reward overhead.
Reasoning-aware retrieval can boost language model performance by surfacing diverse solution strategies that traditional methods overlook.