arXiv cs.LGOctober 1, 2026
Diffusion-Augmented Markov Decision Processes for Maximum Entropy Reinforcement Learning
Excerpt
arXiv:2512.02019v4 Announce Type: replace Abstract: Diffusion models provide an expressive framework for sampling from complex, unnormalized distributions. In this work, we extend Maximum Entropy Reinforcement Learning (ME-RL) to diffusion-based policies by introducing Diffusion-Augmented Markov Decision Processes (DA-MDPs). DA-MDPs interpret each reverse-diffusion transition as an individual reinforcement-learning decision, while only the final denoised action is executed in the environment. Ou