Search papers, labs, and topics across Lattice.
University of British Columbia, Vector Institute
4
0
7
Training with OpenMedReason boosts VQA accuracy by 20%, showcasing a leap in reasoning capabilities for medical vision-language models.
Fine-grained preference optimization can dramatically enhance the clinical accuracy of LVLMs by correcting only the clinically erroneous spans while preserving linguistic style.
Forget painstakingly annotating real-world videos: this unified synthetic data pipeline can generate multimodal video datasets that actually *improve* model performance on downstream tasks.
VLMs selectively ignore visual information based on question framing, even when the visual reasoning task remains identical, highlighting a critical vulnerability in their grounding capabilities.