Search papers, labs, and topics across Lattice.
Affiliation:
1
0
3
2
Gated Recurrent Transformers achieve 63% fewer parameters and 59% less peak memory while matching the accuracy of much larger models, redefining efficiency in language modeling.