Search papers, labs, and topics across Lattice.
1
0
2
The coefficient $\beta$ in DPO not only controls preference noise but also entangles optimization dynamics, leading to non-intuitive learning behaviors that can mislead model training.