Search papers, labs, and topics across Lattice.
Huawei Translation Service Center
1
0
3
Standard metrics routinely misclassify valid real-time summarization as translation failure, but structuring LLM evaluation around deterministic MQM error penalties recovers human system rankings with up to 0.707 Kendall concordance.