arXiv cs.LGOctober 2, 2026
FERPO: Forward Entropy-Regularized Policy Optimization
Excerpt
arXiv:2610.02198v1 Announce Type: new Abstract: Several state-of-the-art methods for online reinforcement learning in continuous control improve policies using action gradients of a learned critic. However, critics are typically trained to predict returns, and accurate value predictions do not necessarily yield accurate action derivatives, potentially leading to unreliable policy updates. We propose Forward Entropy-Regularized Policy Optimization (FERPO), an on-policy maximum entropy reinforceme