Search papers, labs, and topics across Lattice.
1
0
3
Hierarchical cross-attention between vision encoders and LLMs unlocks superior vision-language alignment, outperforming flattened feature fusion methods on a range of benchmarks.