Search papers, labs, and topics across Lattice.
3
0
4
0
Machine translation benchmarks have functionally saturated, but pairing human-authored failure cases with deterministic verification rules reveals critical multimodal blind spots that automated metrics consistently miss.
Robustness claims in language models can be misleading when based solely on output behavior, as perturbations reveal complex, multi-level effects that traditional metrics overlook.
First-token broadcasting heads in multilingual models can dictate language output, revealing a critical mechanism behind language generation errors.