Search papers, labs, and topics across Lattice.
3
0
7
11
SLPO enables latent reasoning models to leverage outcome-reward learning, dramatically enhancing their performance and efficiency in complex reasoning tasks.
DRIFT achieves near real-time trajectory planning with 89.6 PDMS and 90.4 EPDMS by efficiently aggregating multiple driving behavior proposals without requiring extensive quality labels.
Intrinsic reward signals in unsupervised RL for LLMs inevitably collapse due to sharpening of the model's prior, but external rewards grounded in computational asymmetries offer a path to sustained scaling.