Search papers, labs, and topics across Lattice.
1
0
2
Achieving 2-3x near-lossless compression of KV caches could revolutionize the efficiency of transformer inference without sacrificing performance.