Search papers, labs, and topics across Lattice.
3
0
3
0
Achieving a 3.56脳 increase in decoding throughput without sacrificing accuracy, BinaryPC revolutionizes efficiency in long-context LLMs.
HyperDFlash achieves remarkable decoding speedups and accuracy improvements by aligning residual streams with the MHC architecture, outperforming existing methods.
Don't fully retrain your draft model after fine-tuning your LLM: EDA restores speculative decoding performance with significantly less compute by adapting only a small, private component and regenerating training data.