Search papers, labs, and topics across Lattice.
Nanjing University
1
0
3
High variance in draft quality is tackled head-on, leading to a remarkable 66% increase in throughput for speculative decoding in large language models.