Search papers, labs, and topics across Lattice.
2
0
3
2
Pre-attention spikes and inter-spike plateaus reveal a surprising organization in hybrid linear attention models that could redefine our understanding of activation dynamics in LLMs.
Achieving over 99% performance retention while significantly accelerating large recommendation models by intelligently merging experts based on functional similarity.