Search papers, labs, and topics across Lattice.
1
0
2
5
Looping the middle layers of MoE Transformers can save up to 18% in training FLOPs while boosting performance beyond validation loss predictions.