Search papers, labs, and topics across Lattice.
University of Illinois Urbana-Champaign
1
0
1
2
IRT models can mislead AI evaluations, especially when benchmarks deviate from traditional testing conditions, risking inaccurate performance assessments.