Search papers, labs, and topics across Lattice.
3
0
2
0
Machine translation benchmarks have functionally saturated, but pairing human-authored failure cases with deterministic verification rules reveals critical multimodal blind spots that automated metrics consistently miss.
LLMs, unlike humans, ironically re-literalize idiomatic expressions when post-editing human translations, revealing a surprising divergence in their understanding of translation quality.
LLMs are changing the game for machine translation quality prediction, making traditional metrics less reliable but simultaneously improving document-level consistency.