Search papers, labs, and topics across Lattice.
Stony Brook University
1
0
2
6
Machine translation benchmarks have functionally saturated, but pairing human-authored failure cases with deterministic verification rules reveals critical multimodal blind spots that automated metrics consistently miss.