Search papers, labs, and topics across Lattice.
Shanghai Jiao Tong University
3
0
7
Argus achieves a 78% success rate on long-horizon reasoning tasks while using 21% fewer tokens in mature workflows, showcasing a revolutionary approach to agentic autonomy.
Despite high report quality, many models falter in citation accuracy and claim construction, exposing a disconnect between surface-level performance and deep reasoning skills.
UltraX achieves the highest average performance across datasets while using fewer training tokens, redefining efficiency in data refinement for LLMs.