Search papers, labs, and topics across Lattice.
1
0
2
6
Multi-Head Attention Residuals achieve superior validation loss by allowing Transformers to leverage multiple attention heads, revealing that subspace disagreement is a key factor in model performance.