Search papers, labs, and topics across Lattice.
5
0
8
5
Achieving high-quality model performance with just 10% of the required labels could revolutionize the scalability of RLVR in large language models.
Persona skills expose significant privacy risks, with existing defenses failing to adequately protect against attribute disclosure and impersonation across diverse agent architectures.
Decision-aware training signals outperform traditional next-observation predictions, leading to more effective learning in LLM agents.
Don't let valuable steps in failed trajectories go unnoticed: GraphGPO leverages state-transition graphs for fine-grained credit assignment in agentic RL, boosting performance and efficiency.
Context inconsistency in stepwise group-based RL can severely bias advantage estimation, but a hierarchical grouping strategy can fix it without extra compute.