Search papers, labs, and topics across Lattice.
FAIR at Meta, Inria, Sorbonne Université, Institut universitaire de France, CERMICS École des Ponts ParisTech, PSL Research University
Meta AI (FAIR)4
19
6
Feedback Distillation boosts reasoning model performance by enhancing trajectory diversity and policy entropy, outperforming traditional methods like GRPO.
Entropy regularization makes planning provably easy: SmoothCruiser achieves polynomial sample complexity in MDPs where standard methods fail.
Learning user preferences for thousands of items can be achieved with just a handful of evaluations, thanks to a novel approach that leverages effective dimension in graph-based bandit problems.
TrailBlazer offers a computationally efficient Monte-Carlo planning algorithm that drastically reduces sample complexity by focusing exploration on near-optimal state trajectories within an MDP.