SOTAVerified

OpenAI Gym

An open-source toolkit from OpenAI that implements several Reinforcement Learning benchmarks including: classic control, Atari, Robotics and MuJoCo tasks.

(Description by Evolutionary learning of interpretable decision trees)

(Image Credit: OpenAI Gym)

Papers

Showing 351–382 of 382 papers

TitleStatusHype
BF++: a language for general-purpose program synthesisCode0
Reinforcement Learning for Improving Agent DesignCode0
Deep Reinforcement Learning for General Video Game AICode0
Multi-Goal Reinforcement Learning: Challenging Robotics Environments and Request for ResearchCode0
Analyzing Reinforcement Learning Benchmarks with Random Weight GuessingCode0
MVFST-RL: An Asynchronous RL Framework for Congestion Control with Delayed ActionsCode0
Deep Q-learning: a robust control approachCode0
Amortized Variational Deep Q NetworkCode0
Benchmark Environments for Multitask Learning in Continuous DomainsCode0
Reinforcement Learning with Quantum Variational CircuitsCode0
Relative Entropy Regularized Policy IterationCode0
Deep Ordinal Reinforcement LearningCode0
Neuroevolution of Recurrent Architectures on Control TasksCode0
Neurogenetic Programming Framework for Explainable Reinforcement LearningCode0
Adaptively Calibrated Critic Estimates for Deep Reinforcement LearningCode0
Deep Active LocalizationCode0
AIXIjs: A Software Demo for General Reinforcement LearningCode0
Repairing Learning-Enabled Controllers While Preserving What WorksCode0
Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLMCode0
Deconfounding Reinforcement Learning in Observational SettingsCode0
Resolving Implicit Coordination in Multi-Agent Deep Reinforcement Learning with Deep Q-Networks & Game TheoryCode0
TorchBeast: A PyTorch Platform for Distributed RLCode0
Decision Making in Non-Stationary Environments with Policy-Augmented SearchCode0
Beating Atari with Natural Language Guided Reinforcement LearningCode0
Arena: a toolkit for Multi-Agent Reinforcement LearningCode0
Risk-Aware Reward Shaping of Reinforcement Learning Agents for Autonomous DrivingCode0
Creating Hierarchical Dispositions of Needs in an AgentCode0
Optimality-based Analysis of XCSF Compaction in Discrete Reinforcement LearningCode0
MobILE: Model-Based Imitation Learning From Observation AloneCode0
Towards a Reinforcement Learning Environment Toolbox for Intelligent Electric Motor ControlCode0
Robust Policy Optimization in Deep Reinforcement LearningCode0
Efficient Parallel Reinforcement Learning Framework using the Reactor ModelCode0
Show:102550
← PrevPage 8 of 8Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1MEowAverage Return6,586.33—Unverified
2TD3Average Return5,942.55—Unverified
3SACAverage Return5,208.09—Unverified
4DDPGAverage Return1,712.12—Unverified
5PPOAverage Return608.97—Unverified
#ModelMetricClaimedVerifiedStatus
1SACAverage Return15,836.04—Unverified
2DDPGAverage Return14,934.86—Unverified
3TD3Average Return12,026.73—Unverified
4MEowAverage Return10,981.47—Unverified
5PPOAverage Return6,006.11—Unverified
#ModelMetricClaimedVerifiedStatus
1MEowAverage Return3,332.99—Unverified
2TD3Average Return3,319.98—Unverified
3SACAverage Return2,882.56—Unverified
4DDPGAverage Return1,290.24—Unverified
5PPOAverage Return790.77—Unverified
#ModelMetricClaimedVerifiedStatus
1MEowAverage Return6,923.22—Unverified
2SACAverage Return6,211.5—Unverified
3PPOAverage Return925.89—Unverified
4TD3Average Return198.44—Unverified
5DDPGAverage Return139.14—Unverified
#ModelMetricClaimedVerifiedStatus
1SACAverage Return5,745.27—Unverified
2MEowAverage Return5,526.66—Unverified
3DDPGAverage Return2,994.54—Unverified
4PPOAverage Return2,739.81—Unverified
5TD3Average Return2,612.74—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward5,163.54—Unverified
2AWRMean Reward5,067—Unverified
#ModelMetricClaimedVerifiedStatus
1Orthogonal decision treeAverage Return500—Unverified
2Oblique decision treeAverage Return500—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward9,571.99—Unverified
2AWRMean Reward9,136—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward3,458.22—Unverified
2AWRMean Reward3,405—Unverified
#ModelMetricClaimedVerifiedStatus
1Oblique decision treeAverage Return272.14—Unverified
2AWRAverage Return229—Unverified
#ModelMetricClaimedVerifiedStatus
1Orthogonal decision treeAverage Return-101.72—Unverified
2Oblique decision treeAverage Return-106.02—Unverified
#ModelMetricClaimedVerifiedStatus
1TLA with Hierarchical Reward FunctionsMean Reward-125.02—Unverified
2TLAMean Reward-154.92—Unverified
#ModelMetricClaimedVerifiedStatus
1AWRMean Reward5,813—Unverified
2TLAMean Reward3,878.41—Unverified
#ModelMetricClaimedVerifiedStatus
1AWRAverage Return4,996—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward9,356.67—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward1,000—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward93.88—Unverified