Search papers, labs, and topics across Lattice.
6
0
8
A preference optimization framework with Large Audio-Language Model (LALM) feedback for controllable non-verbal vocalization (NVV) generation in continuous autoregressive speech models that enables DPO-style preference learning without explicit sequence likelihoods while preserving direct supervision on preferred realizations is proposed.
MeanVC 2 cuts voice conversion latency in half while enhancing robustness to low-quality audio references, revolutionizing real-time voice applications.
FlashTTS slashes First-Packet Latency to 325ms, revolutionizing real-time speech dialogue systems without sacrificing voice quality.