Search papers, labs, and topics across Lattice.
Southeast University
2
0
3
Decision-aware training signals outperform traditional next-observation predictions, leading to more effective learning in LLM agents.
Don't let valuable steps in failed trajectories go unnoticed: GraphGPO leverages state-transition graphs for fine-grained credit assignment in agentic RL, boosting performance and efficiency.