Search papers, labs, and topics across Lattice.
Xi鈥檃n Jiaotong University
6
0
8
CoRe achieves a remarkable 28.2-point boost in partial accuracy for cross-image reasoning, setting a new standard for vision-language models.
DataClaw_0 can transform chaotic multimodal data into structured, high-quality datasets, enhancing AI's ability to learn from less information.
VLMs often fail at spatial reasoning because they either ignore visual cues or exhibit unstable reasoning, but a novel process-shaping framework can fix this.
RL agents can learn more robust vision-and-language navigation policies by exploring diverse trajectories and comparing their performance, even without expert demonstrations or value networks.
Ditch discrete waypoints: VLA models can now generate smooth, physically plausible robot trajectories by directly regressing continuous action functions.
Achieve stable continual learning without catastrophic forgetting by fixing classifier weights to an Equiangular Tight Frame and aligning features geometrically.