Search papers, labs, and topics across Lattice.
2
0
5
8
MemTrain reveals that self-supervised memory training can outperform traditional reinforcement learning approaches in enhancing LLMs' reasoning capabilities.
TrOPD stabilizes on-policy distillation by ensuring reliable teacher supervision, leading to consistent performance improvements over existing methods.