Search papers, labs, and topics across Lattice.
Affiliation:
1
0
3
2
Optimal learning rates for training massive Mixture-of-Experts models can be accurately predicted from small proxy models, achieving high fidelity even at trillion-token scales.