Search papers, labs, and topics across Lattice.
1
0
4
IRT models can mislead AI evaluations, especially when benchmarks deviate from traditional testing conditions, risking inaccurate performance assessments.