Search papers, labs, and topics across Lattice.
Baidu Inc
4
0
7
MLLMs excel at reasoning over diagrams but falter in parsing and editing them, revealing a significant gap that needs addressing.
CogVis redefines change detection by decoupling temporal perception from semantic categorization, achieving unprecedented efficiency and accuracy across multiple benchmarks.
DIVE achieves an impressive 88.9% reduction in visual tokens without sacrificing performance, redefining efficiency in vision-language models.
Adding depthwise convolutions to Transformers can boost accuracy on downstream tasks while barely increasing model size.