Search papers, labs, and topics across Lattice.
Affiliation:
1
0
3
2
RMM reveals that optimizing attention-side computations can lead to substantial runtime gains in Transformer models without sacrificing accuracy.