SOTAVerified

Reinforcement Learning (RL)

Reinforcement Learning (RL) involves training an agent to take actions in an environment to maximize a cumulative reward signal. The agent interacts with the environment and learns by receiving feedback in the form of rewards or punishments for its actions. The goal of reinforcement learning is to find the optimal policy or decision-making strategy that maximizes the long-term reward.

Papers

Showing 1177611800 of 15113 papers

TitleStatusHype
Value-Added Chemical Discovery Using Reinforcement Learning0
Minimalistic Attacks: How Little it Takes to Fool a Deep Reinforcement Learning Policy0
Worst Cases Policy Gradients0
Hierarchical Reinforcement Learning Method for Autonomous Vehicle Behavior Planning0
Learning to reinforcement learn for Neural Architecture SearchCode0
Fully Bayesian Recurrent Neural Networks for Safe Reinforcement Learning0
Contrastive Multi-document Question GenerationCode0
Option Compatible Reward Inverse Reinforcement Learning0
H_ Model-free Reinforcement Learning with Robust Stability GuaranteeCode0
Experience Sharing Between Cooperative Reinforcement Learning Agents0
Distributional Reward Decomposition for Reinforcement Learning0
Improving reinforcement learning algorithms: towards optimal learning rate policiesCode0
Optimizing the Factual Correctness of a Summary: A Study of Summarizing Radiology Reports0
MBCAL: Sample Efficient and Variance Reduced Reinforcement Learning for Recommender Systems0
Quinoa: a Q-function You Infer Normalized Over Actions0
Robo-advising: Learning Investors' Risk Preferences via Portfolio Choices0
Gym-Ignition: Reproducible Robotic Simulations for Reinforcement LearningCode0
DeepRacer: Educational Autonomous Racing Platform for Experimentation with Sim2Real Reinforcement Learning0
Fully Parameterized Quantile Function for Distributional Reinforcement LearningCode0
An End-to-End Deep RL Framework for Task Arrangement in Crowdsourcing Platforms0
Robotic Tracking Control with Kernel Trick-based Reinforcement Learning0
Problem Dependent Reinforcement Learning Bounds Which Can Identify Bandit Structure in MDPs0
Online Robustness Training for Deep Reinforcement Learning0
Maximum Entropy Diverse Exploration: Disentangling Maximum Entropy Reinforcement Learning0
Non-Cooperative Inverse Reinforcement Learning0
Show:102550
← PrevPage 472 of 605Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1PPGMean Normalized Performance0.76Unverified
2PPOMean Normalized Performance0.58Unverified