SOTAVerified

Continuous Control

Continuous control in the context of playing games, especially within artificial intelligence (AI) and machine learning (ML), refers to the ability to make a series of smooth, ongoing adjustments or actions to control a game or a simulation. This is in contrast to discrete control, where the actions are limited to a set of specific, distinct choices. Continuous control is crucial in environments where precision, timing, and the magnitude of actions matter, such as driving a car in a racing game, controlling a character in a simulation, or managing the flight of an aircraft in a flight simulator.

Papers

Showing 101–150 of 1161 papers

TitleStatusHype
Generalized Decision Transformer for Offline Hindsight Information MatchingCode1
On Effective Scheduling of Model-based Reinforcement LearningCode1
Curriculum Offline Imitation LearningCode1
URLB: Unsupervised Reinforcement Learning BenchmarkCode1
Towards Robust Bisimulation Metric LearningCode1
Recurrent Off-policy Baselines for Memory-based Continuous ControlCode1
Hierarchical Skills for Efficient ExplorationCode1
Planning from Pixels in Environments with Combinatorially Hard Search SpacesCode1
Cross-Domain Imitation Learning via Optimal TransportCode1
Continuous-Time Fitted Value Iteration for Robust PoliciesCode1
Mastering Visual Continuous Control: Improved Data-Augmented Reinforcement LearningCode1
Shortest-Path Constrained Reinforcement Learning for Sparse Reward TasksCode1
Towards Better Laplacian Representation in Reinforcement Learning with Generalized Graph DrawingCode1
Sample Efficient Reinforcement Learning via Model-Ensemble Exploration and ExploitationCode1
Coarse-to-Fine Q-attention: Efficient Learning for Visual Robotic Manipulation via DiscretisationCode1
IQ-Learn: Inverse soft-Q Learning for ImitationCode1
Towards Safe Reinforcement Learning via Constraining Conditional Value at RiskCode1
Towards Automatic Actor-Critic Solutions to Continuous ControlCode1
Solving Continuous Control with Episodic MemoryCode1
TempoRL: Learning When to ActCode1
Dynamic Sparse Training for Deep Reinforcement LearningCode1
Learning Markov State Abstractions for Deep Reinforcement LearningCode1
Efficient Continuous Control with Double Actors and Regularized CriticsCode1
Mitigating Covariate Shift in Imitation Learning via Offline Data Without Great CoverageCode1
Robust Value Iteration for Continuous Control TasksCode1
Mitigating Covariate Shift in Imitation Learning via Offline Data With Partial CoverageCode1
Online and Offline Reinforcement Learning by Planning with a Learned ModelCode1
TAAC: Temporally Abstract Actor-Critic for Continuous ControlCode1
Muesli: Combining Improvements in Policy OptimizationCode1
Benchmarks for Deep Off-Policy EvaluationCode1
Character Controllers Using Motion VAEsCode1
Solving Compositional Reinforcement Learning Problems via Task ReductionCode1
Generalizable Episodic Memory for Deep Reinforcement LearningCode1
Reinforcement Learning with Prototypical RepresentationsCode1
Model-free Policy Learning with Reward GradientsCode1
Latent Imagination Facilitates Zero-Shot Transfer in Autonomous RacingCode1
Analysis and Assessment of Controllability of an Expressive Deep Learning-based TTS systemCode1
Reinforcement Learning with Prototypical RepresentationsCode1
Tactical Optimism and Pessimism for Deep Reinforcement LearningCode1
OffCon^3: What is state of the art anyway?Code1
Robust Reinforcement Learning on State Observations with Learned Optimal AdversaryCode1
Reinforcement Learning with Latent FlowCode1
An Efficient Asynchronous Method for Integrating Evolutionary and Gradient-based Policy SearchCode1
World Model as a Graph: Learning Latent Landmarks for PlanningCode1
Tonic: A Deep Reinforcement Learning Library for Fast Prototyping and BenchmarkingCode1
Few-shot Object Grounding and Mapping for Natural Language Robot Instruction FollowingCode1
PLAS: Latent Action Space for Offline Reinforcement LearningCode1
Hamilton-Jacobi Deep Q-Learning for Deterministic Continuous-Time Systems with Lipschitz Continuous ControlsCode1
Iterative Amortized Policy OptimizationCode1
Softmax Deep Double Deterministic Policy GradientsCode1
Show:102550
← PrevPage 3 of 24Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn3,459—Unverified
2TD3 gSDEReturn3,267—Unverified
3TD3Return2,865—Unverified
4SACReturn2,859—Unverified
5PPO gSDEReturn2,587—Unverified
6A2C gSDEReturn2,560—Unverified
7PPOReturn2,160—Unverified
8A2CReturn1,967—Unverified
#ModelMetricClaimedVerifiedStatus
1SACReturn2,883—Unverified
2SAC gSDEReturn2,850—Unverified
3PPO + gSDEReturn2,760—Unverified
4TD3Return2,687—Unverified
5TD3 gSDEReturn2,578—Unverified
6PPOReturn2,254—Unverified
7A2C + gSDEReturn2,028—Unverified
8A2CReturn1,652—Unverified
#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn2,646—Unverified
2PPO gSDEReturn2,508—Unverified
3SACReturn2,477—Unverified
4TD3Return2,470—Unverified
5TD3 gSDEReturn2,353—Unverified
6PPOReturn1,622—Unverified
7A2CReturn1,559—Unverified
8A2C gSDEReturn1,448—Unverified
#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn2,341—Unverified
2SACReturn2,215—Unverified
3TD3Return2,106—Unverified
4TD3 gSDEReturn1,989—Unverified
5PPO gSDEReturn1,776—Unverified
6PPOReturn1,238—Unverified
7A2C gSDEReturn694—Unverified
8A2CReturn443—Unverified
#ModelMetricClaimedVerifiedStatus
1DreamerV1Return800—Unverified
2SLACReturn700—Unverified
3DrQReturn660—Unverified
4PlaNetReturn650—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn998.14—Unverified
2DREAMERReturn853—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn868.87—Unverified
2MuZero UnpluggedReturn594.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn914.39—Unverified
2MuZero UnpluggedReturn869.9—Unverified
#ModelMetricClaimedVerifiedStatus
1DrQReturn963—Unverified
2PlaNetReturn914—Unverified
#ModelMetricClaimedVerifiedStatus
1DrQReturn921—Unverified
2PlaNetReturn890—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn963.07—Unverified
2MuZero UnpluggedReturn759—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn987.79—Unverified
2MuZero UnpluggedReturn887.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn975.46—Unverified
2MuZero UnpluggedReturn949.5—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,353.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-326—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-83.3—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-149.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn417.52—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-170.9—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore730.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-0.4—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn977.38—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore769—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore959—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn984.86—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4,869.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore960.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore606.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore980.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MACScore178.3—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore582—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore841—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn846.91—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore299—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore518—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4,412.4—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn986.38—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore767—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore926—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn972.53—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn681.6—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore287—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,914—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,183.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn528.24—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn926.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn643.1—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore247.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4.5—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore10.4—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore14.1—Unverified
#ModelMetricClaimedVerifiedStatus
1MACScore163.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn659.2—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn556—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-61.7—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-64.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-60.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-61.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn837.76—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn923.54—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn933.77—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn982.26—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore538—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore929—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn971.53—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore269.7—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore96—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn931.06—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore403—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore902—Unverified