Search papers, labs, and topics across Lattice.
This paper introduces Planning Diffusion Policy Optimization (PDPO), an innovative offline-to-online reinforcement-learning framework designed for robot crowd navigation that generates short-horizon action chunks. By pretraining on collision-avoidance demonstrations and fine-tuning with Proximal Policy Optimization (PPO), PDPO effectively enhances decision-making in dynamic environments, allowing robots to navigate dense crowds more safely and efficiently. Experimental results indicate that PDPO significantly improves success rates compared to existing methods, particularly in scenarios where boundary violations are treated as collisions.
PDPO revolutionizes robot crowd navigation by generating action chunks that enhance safety and efficiency in dense human environments.
Robot crowd navigation requires safe and efficient decision-making under dense, dynamic, and multimodal human--robot interactions. Existing reinforcement-learning methods typically output a single reactive action at each timestep, which limits their ability to represent diverse short-term avoidance strategies. We propose Planning Diffusion Policy Optimization (PDPO), an offline-to-online reinforcement-learning framework that uses a diffusion policy to generate short-horizon action chunks for crowd navigation. PDPO is first pretrained on collision-avoidance demonstrations and then fine-tuned online with PPO by treating the denoising process as an internal decision process. During execution, the policy generates a five-step action chunk and applies it in a receding-horizon manner. Furthermore, we observe an evaluation artifact in common crowd-navigation benchmarks: without explicit boundary constraints, learned agents may leave the valid domain and bypass dense crowds. To address this, we introduce a setting in which boundary violations are treated as collisions. Experiments show that PDPO obtains an improved success rate over strong baselines, and ablations demonstrate that action chunks are especially important for the modified bounded benchmark.