Search papers, labs, and topics across Lattice.
Huawei Technologies Co., Ltd
2
0
4
MXAttention achieves near-FP16 generation quality in video models while cutting computational costs, revolutionizing efficient attention mechanisms.
Get 80% of your prompt length back without sacrificing accuracy using a diffusion-based pruning method that can mask multiple tokens at once.