Search papers, labs, and topics across Lattice.
1
0
2
Majority preferences can skew reward models in RLHF, but a new approach boosts alignment accuracy and fairness for minority voices.