Search papers, labs, and topics across Lattice.
This paper introduces RePolicy, a novel approach to enhancing safety in language model agents by employing reinforcement learning to invoke context-dependent safety policies. The method addresses the limitations of existing safeguards that rely on static prompting or supervised fine-tuning, enabling dynamic adaptation to unseen trajectories. Experimental results demonstrate that RePolicy significantly improves safety-detection performance and policy invocation across diverse safety benchmarks, showcasing its robustness in varying policy contexts.
RePolicy achieves superior safety-policy invocation in language model agents, adapting dynamically to changing contexts and unseen trajectories.
Safeguarding language model agents requires assessing complete execution trajectories under context-dependent safety policies. Existing policy-aware safeguards mainly rely on prompting or supervised fine-tuning, limiting their ability to adapt to unseen trajectories and changing policy contexts. We propose RePolicy, an agent safeguard that learns safety-policy invocation through reinforcement learning. Given an agent trajectory and a dynamic policy library, RePolicy invokes the applicable policy and uses its content to produce a policy-grounded rationale and safety judgment. We construct PolicyTraj-20K to support supervised initialization, followed by GRPO with verifiable rewards and policy-context perturbation. Experiments across six agent safety benchmarks show that RePolicy achieves strong overall safety-detection performance and robust policy invocation under varying policy contexts.