SOTAVerified

Offline RL

Papers

Showing 201–250 of 755 papers

TitleStatusHype
Exclusively Penalized Q-learning for Offline Reinforcement Learning—0
Offline Reinforcement Learning from Datasets with Structured Non-StationarityCode0
Offline RL via Feature-Occupancy Gradient Ascent—0
Efficient Imitation Learning with Conservative World Models—0
Is Mamba Compatible with Trajectory Optimization in Offline Reinforcement Learning?Code0
Towards Robust Policy: Enhancing Offline Reinforcement Learning with Adversarial Attacks and Defenses—0
Reinformer: Max-Return Sequence Modeling for Offline RLCode1
Ensemble Successor Representations for Task Generalization in Offline-to-Online Reinforcement Learning—0
LTLDoG: Satisfying Temporally-Extended Symbolic Constraints for Safe Diffusion-based PlanningCode1
Improving Offline Reinforcement Learning with Inaccurate Simulators—0
Out-of-Distribution Adaptation in Offline RL: Counterfactual Reasoning via Causal Normalizing Flows—0
Robot Air Hockey: A Manipulation Testbed for Robot Learning with Reinforcement Learning—0
Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement LearningCode1
Generalize by Touching: Tactile Ensemble Skill Transfer for Robotic Furniture Assembly—0
Offline Reinforcement Learning with Behavioral Supervisor Tuning—0
An Offline Reinforcement Learning Algorithm Customized for Multi-Task Fusion in Large-Scale Recommender Systems—0
Data-Incremental Continual Offline Reinforcement Learning—0
TrajDeleter: Enabling Trajectory Forgetting in Offline Reinforcement Learning AgentsCode0
Offline Trajectory Generalization for Offline Reinforcement Learning—0
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL—0
Leveraging Domain-Unlabeled Data in Offline Reinforcement Learning across Two Domains—0
Generative Probabilistic Planning for Optimizing Supply Chain Networks—0
Compositional Conservatism: A Transductive Approach in Offline Reinforcement LearningCode0
CtRL-Sim: Reactive and Controllable Driving Agents with Offline Reinforcement Learning—0
Scaling Vision-and-Language Navigation With Offline RL—0
Uncertainty-aware Distributional Offline Reinforcement Learning—0
Reinforcement Learning-based Recommender Systems with Large Language Models for State Reward and Action Modeling—0
The Value of Reward Lookahead in Reinforcement Learning—0
Minimax Optimal and Computationally Efficient Algorithms for Distributionally Robust Offline Reinforcement Learning—0
Towards Optimizing Human-Centric Objectives in AI-Assisted Decision-Making With Offline Reinforcement Learning—0
Why Online Reinforcement Learning is Causal—0
Offline Fictitious Self-Play for Competitive Games—0
Unsupervised Zero-Shot Reinforcement Learning via Functional Reward EncodingsCode2
Trajectory-wise Iterative Reinforcement Learning Framework for Auto-bidding—0
Deep Generative Models for Offline Policy Learning: Tutorial, Survey, and Perspectives on Future DirectionsCode2
MORE-3S:Multimodal-based Offline Reinforcement Learning with Shared Semantic SpacesCode0
Align Your Intents: Offline Imitation Learning via Optimal Transport—0
Offline Multi-task Transfer RL with Representational Penalization—0
Learning Goal-Conditioned Policies from Sub-Optimal Offline Data via Metric Learning—0
Universal Black-Box Reward Poisoning Attack against Offline Reinforcement Learning—0
Measurement Scheduling for ICU Patients with Offline Reinforcement Learning—0
Stitching Sub-Trajectories with Conditional Diffusion Model for Goal-Conditioned Offline RLCode1
More Benefits of Being Distributional: Second-Order Bounds for Reinforcement Learning—0
Federated Offline Reinforcement Learning: Collaborative Single-Policy Coverage Suffices—0
Real-World Fluid Directed Rigid Body Control via Deep Reinforcement Learning—0
Offline Actor-Critic Reinforcement Learning Scales to Large Models—0
A Primal-Dual Algorithm for Offline Constrained Reinforcement Learning with Linear MDPs—0
Entropy-regularized Diffusion Policy with Q-Ensembles for Offline Reinforcement LearningCode1
SEABO: A Simple Search-Based Method for Offline Imitation LearningCode1
Contrastive Diffuser: Planning Towards High Return States via Contrastive Learning—0
Show:102550
← PrevPage 5 of 16Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1KFCAverage Reward81.8—Unverified
2ADMPOAverage Reward81—Unverified
3Decision Transformer (DT)Average Reward73.5—Unverified
#ModelMetricClaimedVerifiedStatus
1ParPID4RL Normalized Score151.4—Unverified