Search papers, labs, and topics across Lattice.
2
0
3
0
Machine translation benchmarks have functionally saturated, but pairing human-authored failure cases with deterministic verification rules reveals critical multimodal blind spots that automated metrics consistently miss.
Language models trained in Filipino exhibit significant sexist and homophobic biases specific to the Philippine context, even when accounting for response instability across multiple seeds.