SOTAVerified

Offline RL

Papers

Showing 251–260 of 755 papers

TitleStatusHype
End-to-End Offline Goal-Oriented Dialog Policy Learning via Policy Gradient—0
ComaDICE: Offline Cooperative Multi-Agent Reinforcement Learning with Stationary Distribution Shift Regularization—0
From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning—0
Enabling A Network AI Gym for Autonomous Cyber Agents—0
Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL—0
Augmenting Offline RL with Unlabeled Data—0
EMaQ: Expected-Max Q-Learning Operator for Simple Yet Effective Offline and Online RL—0
CLUE: Calibrated Latent Guidance for Offline Reinforcement Learning—0
Efficient Online RL Fine Tuning with Offline Pre-trained Policy Only—0
A Fast Convergence Theory for Offline Decision Making—0
Show:102550
← PrevPage 26 of 76Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1KFCAverage Reward81.8—Unverified
2ADMPOAverage Reward81—Unverified
3Decision Transformer (DT)Average Reward73.5—Unverified
#ModelMetricClaimedVerifiedStatus
1ParPID4RL Normalized Score151.4—Unverified