Search papers, labs, and topics across Lattice.
3
0
7
11
Latent reasoning can now leverage outcome-reward reinforcement learning, achieving better performance with less computational overhead than traditional methods.
DRIFT achieves near real-time trajectory planning with 89.6 PDMS and 90.4 EPDMS by efficiently aggregating multiple driving behavior proposals without requiring extensive quality labels.
Intrinsic reward signals in unsupervised RL for LLMs inevitably collapse due to sharpening of the model's prior, but external rewards grounded in computational asymmetries offer a path to sustained scaling.