Search papers, labs, and topics across Lattice.
2
0
5
7
Concept recoverability in AI grading systems varies significantly by architecture, revealing hidden biases that could undermine assessment fairness.
LLMs aren't equally reliable as NLG evaluators, but a Bradley-Terry extension called BT-sigma can learn judge reliability from pairwise comparisons alone, improving ranking accuracy without human supervision.