Search papers, labs, and topics across Lattice.
1
0
Achieving better sample efficiency and scalability in reward learning, PreferenceEKF redefines how we approach uncertainty in reinforcement learning from human feedback.