Search papers, labs, and topics across Lattice.
2
0
5
This paper proposes OmniKVQuant, a training-free framework that enables 2-bit KV caches while substantially preserving performance across seven audio-visual benchmarks and provides a fused Triton decode kernel that unpacks the 2-bit cache during attention, so no dense FP16 cache is ever built.
Phantom achieves a remarkable 27.8% increase in deepfake protection success rates while maintaining high visual fidelity, redefining standards for facial privacy safeguards.