Search papers, labs, and topics across Lattice.
Beihang University
3
0
6
Single-device benchmarks mask a critical failure mode: current GUI agents break down rapidly as soon as tasks require maintaining state and transferring intermediate results across operating systems.
Whisper's speech-centric training leaves audio-LLMs tone-deaf to music and environmental sounds, but a simple fine-tune can fix that.
Forget slow, end-to-end models: building real-time voice agents hinges on a cascaded streaming pipeline, as demonstrated by a new tutorial achieving sub-second latency.