Search papers, labs, and topics across Lattice.
Warsaw University of Technology
1
0
2
DINO-A reveals that smaller patch sizes in Vision Transformers consistently yield better audio representation quality, challenging assumptions about model architecture in audio tasks.