Search papers, labs, and topics across Lattice.
Affiliation:
1
0
3
0
Joint audio-video diffusion models hallucinate not from diffuse attention noise, but because bidirectional audio-video cross-attention systematically overrides text conditioning in favor of learned canonical priors.