SOTAVerified

OpenAI Gym

An open-source toolkit from OpenAI that implements several Reinforcement Learning benchmarks including: classic control, Atari, Robotics and MuJoCo tasks.

(Description by Evolutionary learning of interpretable decision trees)

(Image Credit: OpenAI Gym)

Papers

Showing 151–200 of 382 papers

TitleStatusHype
Direct Mutation and Crossover in Genetic Algorithms Applied to Reinforcement Learning Tasks—0
Discovering Individual Rewards in Collective Behavior through Inverse Multi-Agent Reinforcement Learning—0
Distilling Deep RL Models Into Interpretable Neuro-Fuzzy Systems—0
Distributionally Robust Statistical Verification with Imprecise Neural Networks—0
Double A3C: Deep Reinforcement Learning on OpenAI Gym Games—0
DQN with model-based exploration: efficient learning on environments with sparse rewards—0
DriverGym: Democratising Reinforcement Learning for Autonomous Driving—0
Easy as ABCs: Unifying Boltzmann Q-Learning and Counterfactual Regret Minimization—0
EasyRL: A Simple and Extensible Reinforcement Learning Framework—0
Elastic Step DQN: A novel multi-step algorithm to alleviate overestimation in Deep QNetworks—0
Enhancing Cyber Resilience of Networked Microgrids using Vertical Federated Reinforcement Learning—0
Enhancing Hardware Fault Tolerance in Machines with Reinforcement Learning Policy Gradient Algorithms—0
Enhancing Privacy and Security of Autonomous UAV Navigation—0
Error Controlled Actor-Critic Method to Reinforcement Learning—0
Evading Web Application Firewalls with Reinforcement Learning—0
Evolutionary Selective Imitation: Interpretable Agents by Imitation Learning Without a Demonstrator—0
Interpolated Policy Gradient: Merging On-Policy and Off-Policy Gradient Estimation for Deep Reinforcement Learning—0
Investigating Reinforcement Learning Agents for Continuous State Space Environments—0
LagNetViP: A Lagrangian Neural Network for Video Prediction—0
Multitask Neuroevolution for Reinforcement Learning with Long and Short Episodes—0
Learn a Prior for RHEA for Better Online Planning—0
Learning Environment Models with Continuous Stochastic Dynamics—0
Learning from Demonstrations using Signal Temporal Logic—0
Learning Gaussian Policies from Corrective Human Feedback—0
Local Environment Poisoning Attacks on Federated Reinforcement Learning—0
Long N-step Surrogate Stage Reward to Reduce Variances of Deep Reinforcement Learning in Complex Problems—0
Optimizing with Low Budgets: a Comparison on the Black-box Optimization Benchmarking Suite and OpenAI Gym—0
Low-cost Real-world Implementation of the Swing-up Pendulum for Deep Reinforcement Learning Experiments—0
Machine Learning aided Crop Yield Optimization—0
MADRaS : Multi Agent Driving Simulator—0
MAGICS: Adversarial RL with Minimax Actors Guided by Implicit Critic Stackelberg for Convergent Neural Synthesis of Robot Safety—0
MARTI-4: new model of human brain, considering neocortex and basal ganglia -- learns to play Atari game by reinforcement learning on a single CPU—0
MDP Playground: Controlling Orthogonal Dimensions of Hardness in Toy Environments—0
Mitigating Plasticity Loss in Continual Reinforcement Learning by Reducing Churn—0
Model-based actor-critic: GAN (model generator) + DRL (actor-critic) => AGI—0
Robust Reinforcement Learning using Least Squares Policy Iteration with Provable Performance Guarantees—0
Modelling non-reinforced preferences using selective attention—0
MoET: Interpretable and Verifiable Reinforcement Learning via Mixture of Expert Trees—0
MR-iNet Gym: Framework for Edge Deployment of Deep Reinforcement Learning on Embedded Software Defined Radio—0
Multi-Agent Reinforcement Learning via Adaptive Kalman Temporal Difference and Successor Representation—0
MultiSlot ReRanker: A Generic Model-based Re-Ranking Framework in Recommendation Systems—0
Compositional Q-learning for electrolyte repletion with imbalanced patient sub-populations—0
Nested Policy Reinforcement Learning for Clinical Decision Support—0
Neural architecture impact on identifying temporally extended Reinforcement Learning tasks—0
Neural Episodic Control with State Abstraction—0
Neuron as an Agent—0
Noisy Spiking Actor Network for Exploration—0
Non-Markovian Control with Gated End-to-End Memory Policy Networks—0
Offline Inverse Reinforcement Learning—0
Off-OAB: Off-Policy Policy Gradient Method with Optimal Action-Dependent Baseline—0
Show:102550
← PrevPage 4 of 8Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1MEowAverage Return6,586.33—Unverified
2TD3Average Return5,942.55—Unverified
3SACAverage Return5,208.09—Unverified
4DDPGAverage Return1,712.12—Unverified
5PPOAverage Return608.97—Unverified
#ModelMetricClaimedVerifiedStatus
1SACAverage Return15,836.04—Unverified
2DDPGAverage Return14,934.86—Unverified
3TD3Average Return12,026.73—Unverified
4MEowAverage Return10,981.47—Unverified
5PPOAverage Return6,006.11—Unverified
#ModelMetricClaimedVerifiedStatus
1MEowAverage Return3,332.99—Unverified
2TD3Average Return3,319.98—Unverified
3SACAverage Return2,882.56—Unverified
4DDPGAverage Return1,290.24—Unverified
5PPOAverage Return790.77—Unverified
#ModelMetricClaimedVerifiedStatus
1MEowAverage Return6,923.22—Unverified
2SACAverage Return6,211.5—Unverified
3PPOAverage Return925.89—Unverified
4TD3Average Return198.44—Unverified
5DDPGAverage Return139.14—Unverified
#ModelMetricClaimedVerifiedStatus
1SACAverage Return5,745.27—Unverified
2MEowAverage Return5,526.66—Unverified
3DDPGAverage Return2,994.54—Unverified
4PPOAverage Return2,739.81—Unverified
5TD3Average Return2,612.74—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward5,163.54—Unverified
2AWRMean Reward5,067—Unverified
#ModelMetricClaimedVerifiedStatus
1Orthogonal decision treeAverage Return500—Unverified
2Oblique decision treeAverage Return500—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward9,571.99—Unverified
2AWRMean Reward9,136—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward3,458.22—Unverified
2AWRMean Reward3,405—Unverified
#ModelMetricClaimedVerifiedStatus
1Oblique decision treeAverage Return272.14—Unverified
2AWRAverage Return229—Unverified
#ModelMetricClaimedVerifiedStatus
1Orthogonal decision treeAverage Return-101.72—Unverified
2Oblique decision treeAverage Return-106.02—Unverified
#ModelMetricClaimedVerifiedStatus
1TLA with Hierarchical Reward FunctionsMean Reward-125.02—Unverified
2TLAMean Reward-154.92—Unverified
#ModelMetricClaimedVerifiedStatus
1AWRMean Reward5,813—Unverified
2TLAMean Reward3,878.41—Unverified
#ModelMetricClaimedVerifiedStatus
1AWRAverage Return4,996—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward9,356.67—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward1,000—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward93.88—Unverified