Search papers, labs, and topics across Lattice.
2
0
4
Diffusion models no longer need to simultaneously plan and paint; inserting discrete "visual thought" tokens between VLMs and DiTs decouples high-level semantic reasoning from pixel synthesis for tighter alignment and direct intermediate control.
Seedance 2.0 leapfrogs existing models by unifying multi-modal inputs (text, image, audio, video) into a single architecture for generating high-quality, longer-duration audio-video content.