Search papers, labs, and topics across Lattice.
1
0
3
Preference optimization boosts safe responses in banking agents from 52% to 80%, while reinforcement learning enhances edge-case performance significantly with fewer tokens generated.