Search papers, labs, and topics across Lattice.
2
0
5
47
PoTRE's innovative use of diverse reasoning agents leads to a remarkable 49.92% accuracy on Humanity's Last Exam, setting a new benchmark for LLM performance in complex reasoning tasks.
MLLMs are riddled with shared vulnerabilities across modalities, meaning a single weakness can be exploited to jailbreak safety filters, hijack instructions, or even poison training data.