Search papers, labs, and topics across Lattice.
1
0
3
2
Despite advances in large audio language models, the best performer in temporal audio grounding only achieves a mere 31.2 mIoU, revealing critical limitations in current capabilities.