Search papers, labs, and topics across Lattice.
Chongqing University, Chongqing, China
2
0
3
VL-DINO outperforms existing models in zero-shot object detection by effectively integrating vision-language knowledge, achieving a remarkable 38.1 AP on the LVIS benchmark.
Outperforms existing open-vocabulary object detectors like Grounding DINO and T-Rex2 while using significantly less training data and eliminating manual data curation.