Search papers, labs, and topics across Lattice.
Affiliation:
2
0
3
0
TMI uncovers the hidden structure of concurrent tasks in computer-use traces, achieving unprecedented accuracy in task model induction.
Rubric-based scoring, a common evaluation method, is surprisingly bad at capturing quality in expert domains, with pairwise comparisons proving far more reliable and efficient.