Search papers, labs, and topics across Lattice.
2
0
4
2
Current multimodal large language models struggle with active visual observation, achieving less than 11% accuracy on a benchmark designed to measure this critical capability.
Text-to-image models wash away the unique stylistic fingerprints of their captioning counterparts, revealing a surprising disconnect between text and image generation.