SOTAVerified

Offline RL

Papers

Showing 376–400 of 755 papers

TitleStatusHype
Contrastive Value Learning: Implicit Models for Simple Offline RL—0
Corruption-Robust Offline Reinforcement Learning—0
CrowdPlay: Crowdsourcing human demonstration data for offline learning in Atari games—0
CtRL-Sim: Reactive and Controllable Driving Agents with Offline Reinforcement Learning—0
CUDC: A Curiosity-Driven Unsupervised Data Collection Method with Adaptive Temporal Distances for Offline Reinforcement Learning—0
Curriculum Offline Imitating Learning—0
D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning—0
DARA: Dynamics-Aware Reward Augmentation in Offline Reinforcement Learning—0
Data Center Cooling System Optimization Using Offline Reinforcement Learning—0
Data-Efficient Pipeline for Offline Reinforcement Learning with Limited Data—0
Data Sharing without Rewards in Multi-Task Offline Reinforcement Learning—0
Consistent time travel for realistic interactions with historical data: reinforcement learning for market making—0
Decision SpikeFormer: Spike-Driven Transformer for Decision Making—0
Deep Offline Reinforcement Learning for Real-world Treatment Optimization Applications—0
Deep RL with Hierarchical Action Exploration for Dialogue Generation—0
DeepThermal: Combustion Optimization for Thermal Power Generating Units Using Offline Reinforcement Learning—0
Delphic Offline Reinforcement Learning under Nonidentifiable Hidden Confounding—0
Deploying Offline Reinforcement Learning with Human Feedback—0
Design from Policies: Conservative Test-Time Adaptation for Offline Policy Optimization—0
Development and Validation of Heparin Dosing Policies Using an Offline Reinforcement Learning Algorithm—0
Dialogue Evaluation with Offline Reinforcement Learning—0
DIAR: Diffusion-model-guided Implicit Q-learning with Adaptive Revaluation—0
DiffPoGAN: Diffusion Policies with Generative Adversarial Networks for Offline Reinforcement Learning—0
DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching—0
Diffused Task-Agnostic Milestone Planner—0
Show:102550
← PrevPage 16 of 31Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1KFCAverage Reward81.8—Unverified
2ADMPOAverage Reward81—Unverified
3Decision Transformer (DT)Average Reward73.5—Unverified
#ModelMetricClaimedVerifiedStatus
1ParPID4RL Normalized Score151.4—Unverified