Search papers, labs, and topics across Lattice.
1
0
3
2
Current models falter in executing cross-modal editing instructions, revealing significant gaps in audio-visual consistency and fidelity.