SOTAVerified

Continuous Control

Continuous control in the context of playing games, especially within artificial intelligence (AI) and machine learning (ML), refers to the ability to make a series of smooth, ongoing adjustments or actions to control a game or a simulation. This is in contrast to discrete control, where the actions are limited to a set of specific, distinct choices. Continuous control is crucial in environments where precision, timing, and the magnitude of actions matter, such as driving a car in a racing game, controlling a character in a simulation, or managing the flight of an aircraft in a flight simulator.

Papers

Showing 1–50 of 1161 papers

TitleStatusHype
CALE: Continuous Arcade Learning EnvironmentCode7
Diffusion Policy Policy OptimizationCode4
SINERGYM -- A virtual testbed for building energy optimization with Reinforcement LearningCode3
MyoSuite -- A contact-rich simulation suite for musculoskeletal motor controlCode3
Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous controlCode2
Diffusion-based Reinforcement Learning via Q-weighted Variational Policy OptimizationCode2
REBEL: Reinforcement Learning via Regressing Relative RewardsCode2
EfficientZero V2: Mastering Discrete and Continuous Control with Limited DataCode2
TD-MPC2: Scalable, Robust World Models for Continuous ControlCode2
RLtools: A Fast, Portable Deep Reinforcement Learning Library for Continuous ControlCode2
Discovering Evolution Strategies via Meta-Black-Box OptimizationCode2
Challenges and Opportunities in Offline Reinforcement Learning from Visual ObservationsCode2
Temporal Difference Learning for Model Predictive ControlCode2
Smooth Exploration for Robotic Reinforcement LearningCode2
Proximal Policy Optimization AlgorithmsCode2
Benchmarking Deep Reinforcement Learning for Continuous ControlCode2
RLBenchNet: The Right Network for the Right Reinforcement Learning TaskCode1
Bootstrapped Model Predictive ControlCode1
Discrete Codebook World Models for Continuous ControlCode1
Langevin Soft Actor-Critic: Efficient Exploration through Uncertainty-Driven Critic LearningCode1
Diffusing States and Matching Scores: A New Framework for Imitation LearningCode1
C-MORL: Multi-Objective Reinforcement Learning through Efficient Discovery of Pareto FrontCode1
DMC-VB: A Benchmark for Representation Learning for Control with Visual DistractorsCode1
Model-Based Transfer Learning for Contextual Reinforcement LearningCode1
Aligning Diffusion Behaviors with Q-functions for Efficient Continuous ControlCode1
RobocupGym: A challenging continuous control benchmark in RobocupCode1
Discovering Minimal Reinforcement Learning EnvironmentsCode1
EvIL: Evolution Strategies for Generalisable Imitation LearningCode1
RRLS : Robust Reinforcement Learning SuiteCode1
PlanDQ: Hierarchical Plan Orchestration via D-Conductor and Q-PerformerCode1
Amortizing intractable inference in diffusion models for vision, language, and controlCode1
How to Leverage Diverse Demonstrations in Offline Imitation LearningCode1
OLLIE: Imitation Learning from Offline Pretraining to Online FinetuningCode1
Quality-Diversity Actor-Critic: Learning High-Performing and Diverse Behaviors via Value and Successor Features CriticsCode1
SplAgger: Split Aggregation for Meta-Reinforcement LearningCode1
PRISE: LLM-Style Sequence Compression for Learning Temporal Action Abstractions in ControlCode1
Hybrid Inverse Reinforcement LearningCode1
Premier-TACO is a Few-Shot Policy Learner: Pretraining Multitask Representation via Temporal Action-Driven Contrastive LossCode1
FedAA: A Reinforcement Learning Perspective on Adaptive Aggregation for Fair and Robust Federated LearningCode1
The Definitive Guide to Policy Gradients in Deep Reinforcement Learning: Theory, Algorithms and ImplementationsCode1
World Models via Policy-Guided Trajectory DiffusionCode1
DrM: Mastering Visual Reinforcement Learning through Dormant Ratio MinimizationCode1
Reduced Policy Optimization for Continuous Control with Hard ConstraintsCode1
Boosting Continuous Control with Consistency PolicyCode1
Learning Shared Safety Constraints from Multi-task DemonstrationsCode1
TACO: Temporal Latent Action-Driven Contrastive Loss for Visual Reinforcement LearningCode1
Seizing Serendipity: Exploiting the Value of Past Success in Off-Policy Actor-CriticCode1
For SALE: State-Action Representation Learning for Deep Reinforcement LearningCode1
Conditional Mutual Information for Disentangled Representations in Reinforcement LearningCode1
Policy Representation via Diffusion Probability Model for Reinforcement LearningCode1
Show:102550
← PrevPage 1 of 24Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn3,459—Unverified
2TD3 gSDEReturn3,267—Unverified
3TD3Return2,865—Unverified
4SACReturn2,859—Unverified
5PPO gSDEReturn2,587—Unverified
6A2C gSDEReturn2,560—Unverified
7PPOReturn2,160—Unverified
8A2CReturn1,967—Unverified
#ModelMetricClaimedVerifiedStatus
1SACReturn2,883—Unverified
2SAC gSDEReturn2,850—Unverified
3PPO + gSDEReturn2,760—Unverified
4TD3Return2,687—Unverified
5TD3 gSDEReturn2,578—Unverified
6PPOReturn2,254—Unverified
7A2C + gSDEReturn2,028—Unverified
8A2CReturn1,652—Unverified
#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn2,646—Unverified
2PPO gSDEReturn2,508—Unverified
3SACReturn2,477—Unverified
4TD3Return2,470—Unverified
5TD3 gSDEReturn2,353—Unverified
6PPOReturn1,622—Unverified
7A2CReturn1,559—Unverified
8A2C gSDEReturn1,448—Unverified
#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn2,341—Unverified
2SACReturn2,215—Unverified
3TD3Return2,106—Unverified
4TD3 gSDEReturn1,989—Unverified
5PPO gSDEReturn1,776—Unverified
6PPOReturn1,238—Unverified
7A2C gSDEReturn694—Unverified
8A2CReturn443—Unverified
#ModelMetricClaimedVerifiedStatus
1DreamerV1Return800—Unverified
2SLACReturn700—Unverified
3DrQReturn660—Unverified
4PlaNetReturn650—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn998.14—Unverified
2DREAMERReturn853—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn868.87—Unverified
2MuZero UnpluggedReturn594.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn914.39—Unverified
2MuZero UnpluggedReturn869.9—Unverified
#ModelMetricClaimedVerifiedStatus
1DrQReturn963—Unverified
2PlaNetReturn914—Unverified
#ModelMetricClaimedVerifiedStatus
1DrQReturn921—Unverified
2PlaNetReturn890—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn963.07—Unverified
2MuZero UnpluggedReturn759—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn987.79—Unverified
2MuZero UnpluggedReturn887.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn975.46—Unverified
2MuZero UnpluggedReturn949.5—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,353.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-326—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-83.3—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-149.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn417.52—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-170.9—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore730.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-0.4—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn977.38—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore769—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore959—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn984.86—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4,869.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore960.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore606.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore980.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MACScore178.3—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore582—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore841—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn846.91—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore299—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore518—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4,412.4—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn986.38—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore767—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore926—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn972.53—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn681.6—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore287—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,914—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,183.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn528.24—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn926.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn643.1—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore247.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4.5—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore10.4—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore14.1—Unverified
#ModelMetricClaimedVerifiedStatus
1MACScore163.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn659.2—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn556—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-61.7—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-64.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-60.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-61.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn837.76—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn923.54—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn933.77—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn982.26—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore538—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore929—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn971.53—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore269.7—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore96—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn931.06—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore403—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore902—Unverified