Search papers, labs, and topics across Lattice.
Affiliation:
2
0
3
Multilingual medical benchmarks penalize cross-lingual answer variation as model error, but real-world clinicians are sharply split on whether AI should enforce universal consistency or adapt to local cultural contexts.
LLMs fail spectacularly at understanding and generating Meenzerisch, a German dialect, achieving less than 10% accuracy even with targeted interventions, revealing a significant gap in their linguistic capabilities for low-resource languages.