Search papers, labs, and topics across Lattice.
1
0
3
Frontier search agent performance does not require complex multi-agent swarms or test-time search verifiers: a single ReAct policy trained via iterative SFT-RL climbing hits 56.4% on Humanity's Last Exam and 92.9% on DeepSearchQA.