Search papers, labs, and topics across Lattice.
Affiliation:
2
0
3
23
Achieving a staggering reduction in Word Error Rate from 12.15% to 2.79%, MiDashengLM-Gen sets a new standard for text-to-audio generation.
Finally, a single model generates realistic and coherent audio scenes from text, rivaling specialized models and even approaching real-world recordings.