SOTAVerified

OpenAI Gym

An open-source toolkit from OpenAI that implements several Reinforcement Learning benchmarks including: classic control, Atari, Robotics and MuJoCo tasks.

(Description by Evolutionary learning of interpretable decision trees)

(Image Credit: OpenAI Gym)

Papers

Showing 201–225 of 382 papers

TitleStatusHype
Off-Policy Reinforcement Learning with Loss Function Weighted by Temporal Difference Error—0
On Combining Expert Demonstrations in Imitation Learning via Optimal Transport—0
Online Robust Policy Learning in the Presence of Unknown Adversaries—0
Asymptotic Analysis of Sample-averaged Q-learning—0
Optimism is All You Need: Model-Based Imitation Learning From Observation Alone—0
Optimizing 2D+1 Packing in Constrained Environments Using Deep Reinforcement Learning—0
Optimizing Sensor Redundancy in Sequential Decision-Making Problems—0
Photonic Quantum Policy Learning in OpenAI Gym—0
Policy Gradient using Weak Derivatives for Reinforcement Learning—0
Population-coding and Dynamic-neurons improved Spiking Actor Network for Reinforcement Learning—0
Provably Efficient Convergence of Primal-Dual Actor-Critic with Nonlinear Function Approximation—0
Proximal Policy Gradient: PPO with Policy Gradient—0
Proximal Policy Optimization with Continuous Bounded Action Space via the Beta Distribution—0
Decision-Making in Reinforcement Learning—0
Qualitative Measurements of Policy Discrepancy for Return-Based Deep Q-Network—0
Quality Diversity Evolutionary Learning of Decision Trees—0
Reward Prediction Error as an Exploration Objective in Deep RL—0
RAIL: A modular framework for Reinforcement-learning-based Adversarial Imitation Learning—0
RangL: A Reinforcement Learning Competition Platform—0
The Smart Buildings Control Suite: A Diverse Open Source Benchmark to Evaluate and Scale HVAC Control Policies for Sustainability—0
Recommendation System-based Upper Confidence Bound for Online Advertising—0
A Learning Approach to Robot-Agnostic Force-Guided High Precision Assembly—0
WD3: Taming the Estimation Bias in Deep Reinforcement Learning—0
Refined Continuous Control of DDPG Actors via Parametrised Activation—0
REIN-2: Giving Birth to Prepared Reinforcement Learning Agents Using Reinforcement Learning Agents—0
Show:102550
← PrevPage 9 of 16Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1MEowAverage Return6,586.33—Unverified
2TD3Average Return5,942.55—Unverified
3SACAverage Return5,208.09—Unverified
4DDPGAverage Return1,712.12—Unverified
5PPOAverage Return608.97—Unverified
#ModelMetricClaimedVerifiedStatus
1SACAverage Return15,836.04—Unverified
2DDPGAverage Return14,934.86—Unverified
3TD3Average Return12,026.73—Unverified
4MEowAverage Return10,981.47—Unverified
5PPOAverage Return6,006.11—Unverified
#ModelMetricClaimedVerifiedStatus
1MEowAverage Return3,332.99—Unverified
2TD3Average Return3,319.98—Unverified
3SACAverage Return2,882.56—Unverified
4DDPGAverage Return1,290.24—Unverified
5PPOAverage Return790.77—Unverified
#ModelMetricClaimedVerifiedStatus
1MEowAverage Return6,923.22—Unverified
2SACAverage Return6,211.5—Unverified
3PPOAverage Return925.89—Unverified
4TD3Average Return198.44—Unverified
5DDPGAverage Return139.14—Unverified
#ModelMetricClaimedVerifiedStatus
1SACAverage Return5,745.27—Unverified
2MEowAverage Return5,526.66—Unverified
3DDPGAverage Return2,994.54—Unverified
4PPOAverage Return2,739.81—Unverified
5TD3Average Return2,612.74—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward5,163.54—Unverified
2AWRMean Reward5,067—Unverified
#ModelMetricClaimedVerifiedStatus
1Orthogonal decision treeAverage Return500—Unverified
2Oblique decision treeAverage Return500—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward9,571.99—Unverified
2AWRMean Reward9,136—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward3,458.22—Unverified
2AWRMean Reward3,405—Unverified
#ModelMetricClaimedVerifiedStatus
1Oblique decision treeAverage Return272.14—Unverified
2AWRAverage Return229—Unverified
#ModelMetricClaimedVerifiedStatus
1Orthogonal decision treeAverage Return-101.72—Unverified
2Oblique decision treeAverage Return-106.02—Unverified
#ModelMetricClaimedVerifiedStatus
1TLA with Hierarchical Reward FunctionsMean Reward-125.02—Unverified
2TLAMean Reward-154.92—Unverified
#ModelMetricClaimedVerifiedStatus
1AWRMean Reward5,813—Unverified
2TLAMean Reward3,878.41—Unverified
#ModelMetricClaimedVerifiedStatus
1AWRAverage Return4,996—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward9,356.67—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward1,000—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward93.88—Unverified