Search papers, labs, and topics across Lattice.
1
0
2
Outcome-based preference optimization collapses multi-path agent reasoning into brittle single-track policies, but balancing odds across divergence trees preserves viable alternative trajectories and significantly improves error recovery.