Search papers, labs, and topics across Lattice.
4
0
7
22
Captions are not just text; their quality can be dissected into Coverage and Precision, revealing distinct impacts on multimodal understanding and generation tasks.
Localized latent reasoning can slash inference latency while maintaining competitive accuracy, challenging the need for larger models or lengthy reasoning chains.
CycleGRPO achieves simultaneous region understanding and localization in MLLMs without any reliance on textual ground truths, revolutionizing multimodal task integration.
PixelEyes achieves precise visual localization by separating reasoning from perception, drastically reducing the redundancy in multi-turn visual searches.