SOTAVerified

Policy Gradient Methods

Papers

Showing 201–250 of 382 papers

TitleStatusHype
Tesseract: Tensorised Actors for Multi-Agent Reinforcement Learning—0
Meta Learning the Step Size in Policy Gradient Methods—0
Controlling an Inverted Pendulum with Policy Gradient Methods-A Tutorial—0
On the Linear convergence of Natural Policy Gradient Algorithm—0
Semi-On-Policy Training for Sample Efficient Multi-Agent Policy Gradients—0
Model-free Policy Learning with Reward GradientsCode1
Softmax Policy Gradient Methods Can Take Exponential Time to Converge—0
Factored Policy Gradients: Leveraging Structure for Efficient Learning in MOMDPs—0
Strategic bidding in freight transport using deep reinforcement learning—0
Provably Efficient Policy Optimization for Two-Player Zero-Sum Markov Games—0
Independent Policy Gradient Methods for Competitive Reinforcement Learning—0
Self-Supervised Continuous Control without Policy Gradient—0
Incremental Policy Gradients for Online Reinforcement Learning Control—0
PGPS : Coupling Policy Gradient with Population-based Search—0
2D or not 2D? Adaptive 3D Convolution Selection for Efficient Video Recognition—0
Difference Rewards Policy Gradients—0
Model-free and Bayesian Ensembling Model-based Deep Reinforcement Learning for Particle Accelerator Control Demonstrated on the FERMI FELCode0
An Efficient Asynchronous Method for Integrating Evolutionary and Gradient-based Policy SearchCode1
Sample Complexity of Policy Gradient Finding Second-Order Stationary Points—0
Learning Multi-Agent Communication through Structured Attentive ReasoningCode1
Reinforcement Learning in Linear Quadratic Deep Structured Teams: Global Convergence of Policy Gradient Methods—0
Policy Optimization for Markovian Jump Linear Quadratic Control: Gradient-Based Methods and Global Convergence—0
Policy Gradient Methods for the Noisy Linear Quadratic Regulator over a Finite Horizon—0
Optimal Control-Based Baseline for Guided Exploration in Policy Gradient Methods—0
A Study of Policy Gradient on a Class of Exactly Solvable Models—0
Experimental design for MRI by greedy policy searchCode1
Batch Reinforcement Learning with a Nonparametric Off-Policy Policy Gradient—0
Sample Efficient Reinforcement Learning with REINFORCE—0
Rethinking Deep Policy Gradients via State-Wise Policy Improvement—0
Efficient Wasserstein Natural Gradients for Reinforcement LearningCode1
Evolutionary Selective Imitation: Interpretable Agents by Imitation Learning Without a Demonstrator—0
Approximation Benefits of Policy Gradient Methods with Aggregated States—0
On Linear Convergence of Policy Gradient Methods for Finite MDPs—0
PC-PG: Policy Cover Directed Exploration for Provable Policy Gradient LearningCode0
Lifelong Policy Gradient Learning of Factored Policies for Faster Training Without ForgettingCode1
Fast Global Convergence of Natural Policy Gradient Methods with Entropy Regularization—0
Momentum-Based Policy Gradient MethodsCode0
Policy Gradient Optimization of Thompson Sampling Policies—0
Deep Bayesian Quadrature Policy OptimizationCode1
An operator view of policy gradient methods—0
Competitive Policy OptimizationCode1
Lifelong Learning of Factored Policies via Policy Gradients—0
Zeroth-Order Supervised Policy Improvement—0
Jointly Learning Environments and Control Policies with Projected Stochastic Gradient AscentCode0
Invariant Policy Optimization: Towards Stronger Generalization in Reinforcement LearningCode1
On the Global Convergence Rates of Softmax Policy Gradient Methods—0
Improving Sample Efficiency and Multi-Agent Communication in RL-based Train Rescheduling—0
Safe Reinforcement Learning via Projection on a Safe Set: How to Achieve Optimality?—0
Exchangeable Input Representations for Reinforcement Learning—0
Stochastic Recursive Momentum for Policy Gradient Methods—0
Show:102550
← PrevPage 5 of 8Next →

No leaderboard results yet.