SOTAVerified

Policy Gradient Methods

Papers

Showing 151–200 of 382 papers

TitleStatusHype
Stochastic Second-Order Methods Improve Best-Known Sample Complexity of SGD for Gradient-Dominated Function—0
The Sufficiency of Off-Policyness and Soft Clipping: PPO is still Insufficient according to an Off-Policy MeasureCode1
Momentum-Based Policy Gradient with Second-Order Information—0
Stochastic first-order methods for average-reward Markov decision processes—0
Learning to Constrain Policy Optimization with Virtual Trust Region—0
Independent Natural Policy Gradient Methods for Potential Games: Finite-time Global Convergence with Entropy Regularization—0
Synthesis of Stabilizing Recurrent Equilibrium Network ControllersCode0
Asynchronous, Option-Based Multi-Agent Policy Gradient: A Conditional Reasoning Approach—0
Non-Parametric Stochastic Policy Gradient with Strategic Retreat for Non-Stationary Environment—0
Linear convergence of a policy gradient method for some finite horizon continuous time control problems—0
Policy Learning and Evaluation with Randomized Quasi-Monte Carlo—0
Independent Policy Gradient for Large-Scale Markov Potential Games: Sharper Rates, Function Approximation, and Game-Agnostic Convergence—0
PAGE-PG: A Simple and Loopless Variance-Reduced Policy Gradient Method with Probabilistic Gradient Estimation—0
Leveraging class abstraction for commonsense reinforcement learning via residual policy gradient methodsCode0
Homotopic Policy Mirror Descent: Policy Convergence, Implicit Regularization, and Improved Sample Complexity—0
Understanding the Effects of Second-Order Approximations in Natural Policy Gradient Reinforcement LearningCode0
On the Convergence Rates of Policy Gradient Methods—0
Reinforcement Learning based Sequential Batch-sampling for Bayesian Optimal Experimental Design—0
MDPGT: Momentum-based Decentralized Policy Gradient TrackingCode0
Episodic Policy Gradient TrainingCode1
Global Convergence Using Policy Gradient Methods for Model-free Markovian Jump Linear Quadratic Control—0
Time Discretization-Invariant Safe Action Repetition for Policy Gradient MethodsCode0
Global Optimality and Finite Sample Analysis of Softmax Off-Policy Actor Critic under State Distribution Mismatch—0
Proximal Policy Optimization with Continuous Bounded Action Space via the Beta Distribution—0
Convergence and Optimality of Policy Gradient Methods in Weakly Smooth Settings—0
Beyond Exact Gradients: Convergence of Stochastic Soft-Max Policy Gradient Methods with Entropy Regularization—0
Local Advantage Actor-Critic for Robust Multi-Agent Deep Reinforcement Learning—0
Stabilizing Dynamical Systems via Policy Gradient Methods—0
Transform2Act: Learning a Transform-and-Control Policy for Efficient Agent DesignCode1
Actor-Critic Policy Optimization in a Large-Scale Imperfect-Information Game—0
Efficient Wasserstein and Sinkhorn Policy Optimization—0
Evolution Strategies as an Alternate Learning method for Hierarchical Reinforcement Learning—0
Sample-efficient actor-critic algorithms with an etiquette for zero-sum Markov games—0
Asynchronous Multi-Agent Actor-Critic with Macro-Actions—0
Variance Reduced Domain Randomization for Policy Gradient—0
Programmatic Reinforcement Learning without Oracles—0
Theoretical Guarantees of Fictitious Discount Algorithms for Episodic Reinforcement Learning and Global Convergence of Policy Gradient Methods—0
Learning Opinion Summarizers by Selecting Informative ReviewsCode1
A general class of surrogate functions for stable and efficient reinforcement learningCode0
Value-Based Reinforcement Learning for Continuous Control Robotic Manipulation in Multi-Task Sparse Reward Settings—0
Policy Gradient Methods Find the Nash Equilibrium in N-player General-sum Linear-quadratic Games—0
Hindsight Value Function for Variance Reduction in Stochastic Dynamic EnvironmentCode0
Proximal Policy Optimization for Tracking Control Exploiting Future Reference Information—0
Greedification Operators for Policy Optimization: Investigating Forward and Reverse KL Divergences—0
Fine-Grained AutoAugmentation for Multi-Label Classification—0
Policy Gradient Methods for Distortion Risk Measures—0
Curious Explorer: a provable exploration strategy in Policy Learning—0
Modularity in Reinforcement Learning via Algorithmic Independence in Credit Assignment—0
End-to-End Neuro-Symbolic Architecture for Image-to-Image Reasoning Tasks—0
Ad Headline Generation using Self-Critical Masked Language Model—0
Show:102550
← PrevPage 4 of 8Next →

No leaderboard results yet.