SOTAVerified

Offline RL

Papers

Showing 251–300 of 755 papers

TitleStatusHype
Energy-Weighted Flow Matching for Offline Reinforcement Learning—0
Scalable Decision-Making in Stochastic Environments through Learned Temporal AbstractionCode0
Yes, Q-learning Helps Offline In-Context RL—0
Enhancing Offline Model-Based RL via Active Model Selection: A Bayesian Optimization Perspective—0
Which Features are Best for Successor Features?—0
Diverse Transformer Decoding for Offline Reinforcement Learning Using Financial Algorithmic Approaches—0
Active Advantage-Aligned Online Reinforcement Learning with Offline DataCode0
Enhancing Pre-Trained Decision Transformers with Prompt-Tuning Bandits—0
Behavioral Entropy-Guided Dataset Generation for Offline Reinforcement Learning—0
OmniRL: In-Context Reinforcement Learning by Large-Scale Meta-Training in Randomized Worlds—0
Policy-Guided Causal State Representation for Offline Reinforcement Learning Recommendation—0
Resilient UAV Trajectory Planning via Few-Shot Meta-Offline Reinforcement Learning—0
Flexible Blood Glucose Control: Offline Reinforcement Learning from Human Feedback—0
Data Center Cooling System Optimization Using Offline Reinforcement Learning—0
Fat-to-Thin Policy Optimization: Offline RL with Sparse PoliciesCode0
Large Language Model driven Policy Exploration for Recommender Systems—0
DRDT3: Diffusion-Refined Decision Test-Time Training Model—0
SR-Reward: Taking The Path More Traveled—0
On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures—0
Goal-Conditioned Data Augmentation for Offline Reinforcement Learning—0
Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RLCode0
Improving Multi-Step Reasoning Abilities of Large Language Models with Direct Advantage Policy Optimization—0
AdaCred: Adaptive Causal Decision Transformers with Feature Crediting—0
Latent Safety-Constrained Policy Approach for Safe Offline Reinforcement LearningCode0
Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone—0
Reinforcement Learning: An Overview—0
Finer Behavioral Foundation Models via Auto-Regressive Features and Advantage Weighting—0
Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback—0
Robust Offline Reinforcement Learning with Linearly Structured f-Divergence Regularization—0
LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble—0
PROGRESSOR: A Perceptually Guided Reward Estimator with Self-Supervised Online Refinement—0
Continual Task Learning through Adaptive Policy Self-CompositionCode0
Preserving Expert-Level Privacy in Offline Reinforcement Learning—0
Navigation with QPHIL: Quantizing Planner for Hierarchical Implicit Q-Learning—0
Streetwise Agents: Empowering Offline RL Policies to Outsmart Exogenous Stochastic Disturbances in RTC—0
OffLight: An Offline Multi-Agent Reinforcement Learning Framework for Traffic Signal Control—0
Real-World Offline Reinforcement Learning from Vision Language Model Feedback—0
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning—0
Uncertainty-based Offline Variational Bayesian Reinforcement Learning for Robustness under Diverse Data CorruptionsCode0
Offline Reinforcement Learning and Sequence Modeling for Downlink Link Adaptation—0
NetworkGym: Reinforcement Learning Environments for Multi-Access Traffic Management in Network SimulationCode0
Learning Versatile Skills with Curriculum MaskingCode0
Offline reinforcement learning for job-shop scheduling problems—0
Solving Continual Offline RL through Selective Weights Activation on Aligned Spaces—0
Off-dynamics Conditional Diffusion Planners—0
Bayes Adaptive Monte Carlo Tree Search for Offline Model-based Reinforcement LearningCode0
Diffusion-Based Offline RL for Improved Decision-Making in Augmented ARC Task—0
DIAR: Diffusion-model-guided Implicit Q-learning with Adaptive Revaluation—0
Multi-Objective-Optimization Multi-AUV Assisted Data Collection Framework for IoUT Based on Offline Reinforcement Learning—0
Integrating Reinforcement Learning and Large Language Models for Crop Production Process Management Optimization and Control through A New Knowledge-Based Deep Learning Paradigm—0
Show:102550
← PrevPage 6 of 16Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1KFCAverage Reward81.8—Unverified
2ADMPOAverage Reward81—Unverified
3Decision Transformer (DT)Average Reward73.5—Unverified
#ModelMetricClaimedVerifiedStatus
1ParPID4RL Normalized Score151.4—Unverified