Search papers, labs, and topics across Lattice.
McGill University
2
0
4
SR-PPO achieves significant gains in reasoning tasks by effectively assigning credit to individual tokens from a single rollout, transforming how we approach reinforcement learning in language models.
Current AI agents struggle with long-horizon professional tasks, achieving only 30% success in complex GUI workflows, revealing critical gaps in their capabilities.