OpenAI BlogApril 21, 2017Equivalence between policy gradients and soft Q-learningRead original article →