Search papers, labs, and topics across Lattice.
Korea University
2
0
4
CRPO reveals that leveraging English preference data can dramatically enhance multilingual LLM performance, outperforming standard methods across diverse languages.
ACOER reduces token generation by over 60% while boosting accuracy, solving the reward collapse problem that plagues traditional efficiency training methods.