Search papers, labs, and topics across Lattice.
2
0
3
Ride-hailing dispatchers do not need brittle reward engineering: training a preference reward model directly on implicit multi-view passenger and driver trajectories outperforms heuristic-tuned hold policies in live, city-scale deployment.