Search papers, labs, and topics across Lattice.
Johns Hopkins University
1
0
3
IRT models can mislead AI evaluations, especially when benchmarks deviate from traditional testing conditions, risking inaccurate performance assessments.