Search papers, labs, and topics across Lattice.
Rutgers University
4
0
5
5
HPSE transforms how LLMs integrate new knowledge, enabling them to answer atomic questions and perform multi-hop reasoning with edited facts.
Over 15% of benchmark failures for computer-use agents are misclassified, revealing critical flaws in current evaluation methods.
By treating slide design as an inverse planning problem, SPIRE reveals latent design intents that traditional methods miss, leading to superior personalization outcomes.
Stop struggling with subjective LLM evaluation: RUBRIC-ARROW aligns models better by alternating between generating evaluation rubrics and judging against them, using only pairwise preferences.