Search papers, labs, and topics across Lattice.
2
0
3
Hyper-parallel decoding on a distilled 4B LLM matches frontier model information extraction accuracy while operating at an 8% compute footprint.
Directly embedding quantile tokens into input sequences leads to sharper and more accurate distribution predictions, outperforming traditional methods by a substantial margin.