Search papers, labs, and topics across Lattice.
Affiliation:
2
0
2
3
Behavior policies trained in simulation can be robust to real-world transition uncertainties, reducing evaluation variance and reliance on costly real-world samples.
Ditching pessimism unlocks a quadratically faster, $\widetilde{\mathcal{O}}(1/n)$ sample complexity for offline learning in KL-regularized games.