SOTAVerified

MuJoCo

Papers

Showing 501–550 of 677 papers

TitleStatusHype
Fine-Tuning Offline Reinforcement Learning with Model-Based Policy Optimization—0
Practical Marginalized Importance Sampling with the Successor Representation—0
CAT-SAC: Soft Actor-Critic with Curiosity-Aware Entropy Temperature—0
Adaptive N-step Bootstrapping with Off-policy Data—0
Intrinsically Guided Exploration in Meta Reinforcement Learning—0
Invariant Representations for Reinforcement Learning without Reconstruction—0
TEAC: Intergrating Trust Region and Max Entropy Actor Critic for Continuous ControlCode0
PGPS : Coupling Policy Gradient with Population-based Search—0
Locally Persistent Exploration in Continuous Control Tasks with Sparse RewardsCode0
OPAC: Opportunistic Actor-Critic—0
Offline Imitation Learning with a Misspecified Simulator—0
Continuous Transition: Improving Sample Efficiency for Continuous Control Problems via MixUpCode0
Weighted Entropy Modification for Soft Actor-Critic—0
Proximal Policy Optimization via Enhanced Exploration Efficiency—0
Sim2Sim Evaluation of a Novel Data-Efficient Differentiable Physics Engine for Tensegrity Robots—0
Learning to Utilize Shaping Rewards: A New Approach of Reward Shaping—0
Cooperative Heterogeneous Deep Reinforcement Learning—0
Can Reinforcement Learning for Continuous Control Generalize Across Physics Engines?—0
Robust Constrained Reinforcement Learning for Continuous Control with Model Misspecification—0
Human-guided Robot Behavior Learning: A GAN-assisted Preference-based Reinforcement Learning ApproachCode0
Self-Imitation Learning for Robot Tasks with Sparse and Delayed RewardsCode0
Balancing Constraints and Rewards with Meta-Gradient D4PG—0
Hindsight Experience Replay with Kronecker Product Approximate Curvature—0
Learning Intrinsic Symbolic Rewards in Reinforcement Learning—0
What About Taking Policy as Input of Value Function: Policy-extended Value Function Approximator—0
Population-Guided Imitation Learning—0
Soft policy optimization using dual-track advantage estimator—0
Constrained Markov Decision Processes via Backward Value Functions—0
Adversarial Imitation Learning via Random Search—0
Forward and inverse reinforcement learning sharing network weights and hyperparameters—0
Overcoming Model Bias for Robust Offline Deep Reinforcement Learning—0
Follow the Object: Curriculum Learning for Manipulation Tasks with Imagined Goals—0
Weak Human Preference Supervision For Deep Reinforcement LearningCode0
Learning to Play Cup-and-Ball with Noisy Camera ObservationsCode0
CoNES: Convex Natural Evolutionary Strategies—0
Inverse Reinforcement Learning from a Gradient-based Learner—0
Regularly Updated Deterministic Policy Gradient Algorithm—0
DDPG++: Striving for Simplicity in Continuous-control Off-Policy Reinforcement Learning—0
SOAC: The Soft Option Actor-Critic Architecture—0
ELSIM: End-to-end learning of reusable skills through intrinsic motivation—0
dm_control: Software and Tasks for Continuous Control—0
Non-local Policy Optimization via Diversity-regularized Collaborative Exploration—0
Continuous Control for Searching and Planning with a Learned Model—0
Decorrelated Double Q-learning—0
From proprioception to long-horizon planning in novel environments: A hierarchical RL model—0
Primal Wasserstein Imitation LearningCode0
Cross-Domain Imitation Learning with a Dual Structure—0
Gradient Monitored Reinforcement Learning—0
Novel Policy Seeking with Constrained OptimizationCode0
Stealthy and Efficient Adversarial Attacks against Deep Reinforcement Learning—0
Show:102550
← PrevPage 11 of 14Next →

No leaderboard results yet.