SOTAVerified

Offline RL

Papers

Showing 351–375 of 755 papers

TitleStatusHype
Deploying Offline Reinforcement Learning with Human Feedback—0
Measurement Scheduling for ICU Patients with Offline Reinforcement Learning—0
Large-Scale Retrieval for Reinforcement Learning—0
Delphic Offline Reinforcement Learning under Nonidentifiable Hidden Confounding—0
Bi-Level Offline Policy Optimization with Limited Exploration—0
Minimax-Optimal Reward-Agnostic Exploration in Reinforcement Learning—0
Offline Actor-Critic Reinforcement Learning Scales to Large Models—0
Offline Guarded Safe Reinforcement Learning for Medical Treatment Optimization Strategies—0
Offline Policy Optimization with Variance Regularization—0
Diffusion Policies for Out-of-Distribution Generalization in Offline Reinforcement Learning—0
Large Language Model driven Policy Exploration for Recommender Systems—0
A Dual Approach to Imitation Learning from Observations with Offline Datasets—0
Language-Conditioned Offline RL for Multi-Robot Navigation—0
Model-Based Offline Reinforcement Learning with Adversarial Data Augmentation—0
DeepThermal: Combustion Optimization for Thermal Power Generating Units Using Offline Reinforcement Learning—0
Koopman Q-learning: Offline Reinforcement Learning via Symmetries of Dynamics—0
Model-enhanced Contrastive Reinforcement Learning for Sequential Recommendation—0
Discovering Multiple Solutions from a Single Task in Offline Reinforcement Learning—0
Know Your Boundaries: The Necessity of Explicit Behavioral Cloning in Offline RL—0
Deep RL with Hierarchical Action Exploration for Dialogue Generation—0
KAN v.s. MLP for Offline Reinforcement Learning—0
MOORL: A Framework for Integrating Offline-Online Reinforcement Learning—0
Is Pessimism Provably Efficient for Offline RL?—0
Deep Offline Reinforcement Learning for Real-world Treatment Optimization Applications—0
Addressing Distribution Shift in Online Reinforcement Learning with Offline Datasets—0
Show:102550
← PrevPage 15 of 31Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1KFCAverage Reward81.8—Unverified
2ADMPOAverage Reward81—Unverified
3Decision Transformer (DT)Average Reward73.5—Unverified
#ModelMetricClaimedVerifiedStatus
1ParPID4RL Normalized Score151.4—Unverified