OpenAI BlogMarch 20, 2018Variance reduction for policy gradient with action-dependent factorized baselinesRead original article →