Search papers, labs, and topics across Lattice.
1
0
2
3
Over 15% of benchmark failures for computer-use agents are misclassified, revealing critical flaws in current evaluation methods.