Search papers, labs, and topics across Lattice.
3
0
6
0
On-demand safety interventions can significantly improve the performance of vision-language models without sacrificing their multimodal reasoning capabilities.
SafeCap boosts LVLM safety by up to 19 points through innovative caption-mediated reinforcement learning, outpacing traditional alignment methods.
DOPD reveals that intelligently routing supervision based on advantage gaps can significantly enhance capability transfer in distillation, outperforming conventional methods.