Search papers, labs, and topics across Lattice.
2
0
4
EAPO revolutionizes LLM reasoning by dynamically integrating prior experiences, leading to consistent performance gains over traditional RLVR methods.
Multimodal LLMs get a serious reasoning boost from Durian, a difficulty-aware normalization that tames the instability caused by extreme samples and noisy rewards.