SOTAVerified

Policy Gradient Methods

Papers

Showing 251–300 of 382 papers

TitleStatusHype
Stochastic first-order methods for average-reward Markov decision processes—0
Stochastic Policy Gradient Methods: Improved Sample Complexity for Fisher-non-degenerate Policies—0
Stochastic Recursive Momentum for Policy Gradient Methods—0
Stochastic Second-Order Methods Improve Best-Known Sample Complexity of SGD for Gradient-Dominated Function—0
Stochastic Variance Reduction for Policy Gradient Estimation—0
Strategic bidding in freight transport using deep reinforcement learning—0
Strongly-polynomial time and validation analysis of policy gradient methods—0
Symmetric (Optimistic) Natural Policy Gradient for Multi-agent Learning with Parameter Convergence—0
Tesseract: Tensorised Actors for Multi-Agent Reinforcement Learning—0
Theoretical Guarantees of Fictitious Discount Algorithms for Episodic Reinforcement Learning and Global Convergence of Policy Gradient Methods—0
The wisdom of the crowd: reliable deep reinforcement learning through ensembles of Q-functions—0
Token-Efficient RL for LLM Reasoning—0
Towards Adapting Reinforcement Learning Agents to New Tasks: Insights from Q-Values—0
Towards Efficient Risk-Sensitive Policy Gradient: An Iteration Complexity Analysis—0
Towards Global Optimality in Cooperative MARL with the Transformation And Distillation Framework—0
Towards Provable Log Density Policy Gradient—0
Training Diffusion Models Towards Diverse Image Generation with Reinforcement Learning—0
Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods—0
Transfer Reward Learning for Policy Gradient-Based Text Generation—0
Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach—0
Policy Gradient in Partially Observable Environments: Approximation and Convergence—0
Understanding Early Word Learning in Situated Artificial Agents—0
Understanding Grounded Language Learning Agents—0
Value-Based Reinforcement Learning for Continuous Control Robotic Manipulation in Multi-Task Sparse Reward Settings—0
Variance Reduced Domain Randomization for Policy Gradient—0
Variance Reduction for Policy-Gradient Methods via Empirical Variance Minimization—0
Variance Reduction for Policy Gradient with Action-Dependent Factorized Baselines—0
Variance Reduction for Reinforcement Learning in Input-Driven Environments—0
Variance Reduction in Actor Critic Methods (ACM)—0
When Do Off-Policy and On-Policy Policy Gradient Methods Align?—0
Diversity-Inducing Policy Gradient: Using Maximum Mean Discrepancy to Find a Set of Diverse Policies—0
Zeroth-Order Supervised Policy Improvement—0
2D or not 2D? Adaptive 3D Convolution Selection for Efficient Video Recognition—0
Accelerated Reinforcement Learning—0
Accelerating Policy Gradient by Estimating Value Function from Prior Computation in Deep Reinforcement Learning—0
Action-dependent Control Variates for Policy Optimization via Stein Identity—0
Actor-Critic Policy Optimization in a Large-Scale Imperfect-Information Game—0
Actor-Critic Reinforcement Learning with Phased Actor—0
AdaFrame: Adaptive Frame Selection for Fast Video Recognition—0
Confidence-Controlled Exploration: Efficient Sparse-Reward Policy Learning for Robot Navigation—0
Adaptive Batch Size for Safe Policy Gradients—0
Momentum-Based Policy Gradient with Second-Order Information—0
Adaptive Policy Learning to Additional Tasks—0
Adaptive Step-Size for Policy Gradient Methods—0
Ad Headline Generation using Self-Critical Masked Language Model—0
Adversarial Policy Gradient for Alternating Markov Games—0
A Hybrid Approach Between Adversarial Generative Networks and Actor-Critic Policy Gradient for Low Rate High-Resolution Image Compression—0
A K-fold Method for Baseline Estimation in Policy Gradient Algorithms—0
A Large Deviations Perspective on Policy Gradient Algorithms—0
All-Action Policy Gradient Methods: A Numerical Integration Approach—0
Show:102550
← PrevPage 6 of 8Next →

No leaderboard results yet.