SOTAVerified

OpenAI Gym

An open-source toolkit from OpenAI that implements several Reinforcement Learning benchmarks including: classic control, Atari, Robotics and MuJoCo tasks.

(Description by Evolutionary learning of interpretable decision trees)

(Image Credit: OpenAI Gym)

Papers

Showing 176–200 of 382 papers

TitleStatusHype
Beating Atari with Natural Language Guided Reinforcement LearningCode0
Deep Ordinal Reinforcement LearningCode0
Deep Q-learning: a robust control approachCode0
SIMILE: Introducing Sequential Information towards More Effective Imitation Learning—0
skrl: Modular and Flexible Library for Reinforcement Learning—0
Soft Actor-Critic with Inhibitory Networks for Faster Retraining—0
State Distribution-aware Sampling for Deep Q-learning—0
Statistically Efficient Variance Reduction with Double Policy Estimation for Off-Policy Evaluation in Sequence-Modeled Reinforcement Learning—0
Stealing That Free Lunch: Exposing the Limits of Dyna-Style Reinforcement Learning—0
STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation—0
Structured Evolution with Compact Architectures for Scalable Policy Optimization—0
Sufficient Exploration for Convex Q-learning—0
SURREAL-System: Fully-Integrated Stack for Distributed Deep Reinforcement Learning—0
Switching Isotropic and Directional Exploration with Parameter Space Noise in Deep Reinforcement Learning—0
Taming an autonomous surface vehicle for path following and collision avoidance using deep reinforcement learning—0
Teaching a Robot to Walk Using Reinforcement Learning—0
Towards Brain-inspired System: Deep Recurrent Reinforcement Learning for Simulated Self-driving Agent—0
Towards Characterizing Divergence in Deep Q-Learning—0
Towards Combining On-Off-Policy Methods for Real-World Applications—0
Towards Physically Safe Reinforcement Learning under Supervision—0
Traffic control using intelligent timing of traffic lights with reinforcement learning technique and real-time processing of surveillance camera images—0
Transferring Domain Knowledge with an Adviser in Continuous Tasks—0
Untangling Braids with Multi-agent Q-Learning—0
Utilizing Skipped Frames in Action Repeats via Pseudo-Actions—0
Value-Based Deep RL Scales Predictably—0
Show:102550
← PrevPage 8 of 16Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1MEowAverage Return6,586.33—Unverified
2TD3Average Return5,942.55—Unverified
3SACAverage Return5,208.09—Unverified
4DDPGAverage Return1,712.12—Unverified
5PPOAverage Return608.97—Unverified
#ModelMetricClaimedVerifiedStatus
1SACAverage Return15,836.04—Unverified
2DDPGAverage Return14,934.86—Unverified
3TD3Average Return12,026.73—Unverified
4MEowAverage Return10,981.47—Unverified
5PPOAverage Return6,006.11—Unverified
#ModelMetricClaimedVerifiedStatus
1MEowAverage Return3,332.99—Unverified
2TD3Average Return3,319.98—Unverified
3SACAverage Return2,882.56—Unverified
4DDPGAverage Return1,290.24—Unverified
5PPOAverage Return790.77—Unverified
#ModelMetricClaimedVerifiedStatus
1MEowAverage Return6,923.22—Unverified
2SACAverage Return6,211.5—Unverified
3PPOAverage Return925.89—Unverified
4TD3Average Return198.44—Unverified
5DDPGAverage Return139.14—Unverified
#ModelMetricClaimedVerifiedStatus
1SACAverage Return5,745.27—Unverified
2MEowAverage Return5,526.66—Unverified
3DDPGAverage Return2,994.54—Unverified
4PPOAverage Return2,739.81—Unverified
5TD3Average Return2,612.74—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward5,163.54—Unverified
2AWRMean Reward5,067—Unverified
#ModelMetricClaimedVerifiedStatus
1Orthogonal decision treeAverage Return500—Unverified
2Oblique decision treeAverage Return500—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward9,571.99—Unverified
2AWRMean Reward9,136—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward3,458.22—Unverified
2AWRMean Reward3,405—Unverified
#ModelMetricClaimedVerifiedStatus
1Oblique decision treeAverage Return272.14—Unverified
2AWRAverage Return229—Unverified
#ModelMetricClaimedVerifiedStatus
1Orthogonal decision treeAverage Return-101.72—Unverified
2Oblique decision treeAverage Return-106.02—Unverified
#ModelMetricClaimedVerifiedStatus
1TLA with Hierarchical Reward FunctionsMean Reward-125.02—Unverified
2TLAMean Reward-154.92—Unverified
#ModelMetricClaimedVerifiedStatus
1AWRMean Reward5,813—Unverified
2TLAMean Reward3,878.41—Unverified
#ModelMetricClaimedVerifiedStatus
1AWRAverage Return4,996—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward9,356.67—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward1,000—Unverified
#ModelMetricClaimedVerifiedStatus
1TLAMean Reward93.88—Unverified