Search papers, labs, and topics across Lattice.
2
0
5
6
Targeted interventions can significantly enhance the robustness of CLIP models against Typographic Attacks without additional training, outperforming existing defense methods.
Counterfactual examples supercharge visual in-context learning, enabling smaller vision-language models to outperform larger ones by focusing on causal relationships rather than superficial correlations.