Search papers, labs, and topics across Lattice.
Affiliation:
1
0
3
Current vision-language models excel at recognizing objects but falter in capturing dynamic interactions and user intent over time, revealing critical gaps in embodied AI.