Search papers, labs, and topics across Lattice.
7
0
9
9
Real-time multilingual speech translation can now maintain speaker identity and quality even in complex, multi-speaker scenarios.
Treating tactile signals as active cues rather than passive inputs leads to a dramatic boost in manipulation success rates and accuracy in contact-rich tasks.
Forged watermarks in latent diffusion models are fundamentally limited by an irreducible distortion floor, revealing critical vulnerabilities in black-box settings.
Orca's unified world latent space enables superior performance in diverse tasks, outperforming specialized models with a single framework.
Current vision-language models falter in streaming interaction understanding, with alarming mis-calibration leading to confidently incorrect predictions.
Complex visual queries can significantly elevate the reasoning capabilities of multi-modal large language models, revealing new dimensions in AI's understanding of abstract visual content.
Strong translation quality doesn't guarantee high speech or temporal fidelity, revealing critical gaps in existing evaluation practices for speech translation systems.