Search papers, labs, and topics across Lattice.
Affiliation:
1
0
2
Repurposing speculative decoding backbones for output-length prediction slashes short-request latency by nearly 35%.