Search papers, labs, and topics across Lattice.
4
0
6
0
Even top-performing multimodal judges fail to reliably detect errors in specific modalities, revealing hidden blind spots in their evaluations.
FilmBench reveals that leading video generation models fall short of cinematic standards, scoring significantly lower than on traditional benchmarks, which could redefine how we evaluate AI-generated video quality.
FedReLa achieves significant accuracy gains for minority classes in federated learning without requiring knowledge of global class distributions.
Existing text-to-image benchmarks miss the mark on real-world artistic creation, but Qwen-Image-Bench finally provides a creator-centric evaluation that reliably distinguishes state-of-the-art models.