Search papers, labs, and topics across Lattice.
3
0
4
9
OmniVChat-Studio, a multi-agent data engine for synthesizing single- and multi-turn audio-visual dialogues, and OmniVChat-RL, a reinforcement learning reward design that jointly targets reply correctness, efficiency, and style in OmniVChat are presented.
LALMs face significant challenges in audio comprehension, especially in extracting relevant facts from lengthy signals, with performance deteriorating as audio duration increases.
Qwen-Music outperforms leading systems in musicality and audio quality, achieving state-of-the-art results across 13 of 16 metrics while generating songs from text and reinterpreting existing tracks.