SOTAVerified

Continuous Control

Continuous control in the context of playing games, especially within artificial intelligence (AI) and machine learning (ML), refers to the ability to make a series of smooth, ongoing adjustments or actions to control a game or a simulation. This is in contrast to discrete control, where the actions are limited to a set of specific, distinct choices. Continuous control is crucial in environments where precision, timing, and the magnitude of actions matter, such as driving a car in a racing game, controlling a character in a simulation, or managing the flight of an aircraft in a flight simulator.

Papers

Showing 301–350 of 1161 papers

TitleStatusHype
Diminishing Return of Value Expansion Methods in Model-Based Reinforcement LearningCode1
MAESTRO: Open-Ended Environment Design for Multi-Agent Reinforcement Learning—0
Swim: A General-Purpose, High-Performing, and Efficient Activation Function for Locomotion Control TasksCode0
Offline Imitation Learning with Suboptimal Demonstrations via Relaxed Distribution Matching—0
CFlowNets: Continuous Control with Generative Flow NetworksCode0
Guarded Policy Optimization with Imperfect Online Demonstrations—0
Planning and Control of Uncertain Cooperative Mobile Manipulator-Endowed Systems under Temporal-Logic Tasks—0
Resource-Constrained Station-Keeping for Helium Balloons using Reinforcement Learning—0
Hallucinated Adversarial Control for Conservative Offline Policy EvaluationCode0
LS-IQ: Implicit Reward Regularization for Inverse Reinforcement LearningCode1
Auxiliary Task-based Deep Reinforcement Learning for Quantum Control—0
CrystalBox: Future-Based Explanations for Input-Driven Deep RL SystemsCode0
Continuous descriptor-based control for deep audio synthesisCode1
Diffusion Model-Augmented Behavioral Cloning—0
Model-Based Uncertainty in Value FunctionsCode1
To the Noise and Back: Diffusion for Shared Autonomy—0
Universal Morphology Control via Contextual ModulationCode1
Improving Deep Policy Gradients with Value Function Search—0
When Demonstrations Meet Generative World Models: A Maximum Likelihood Framework for Offline Inverse Reinforcement LearningCode1
CLARE: Conservative Model-Based Reward Learning for Offline Inverse Reinforcement Learning—0
Zero-shot Sim2Real Adaptation Across Environments—0
Attacking Cooperative Multi-Agent Reinforcement Learning by Adversarial Minority InfluenceCode1
A Strong Baseline for Batch Imitation Learning—0
ReLOAD: Reinforcement Learning with Optimistic Ascent-Descent for Last-Iterate Convergence in Constrained MDPs—0
Optimal Transport Perturbations for Safe Reinforcement Learning with Robustness GuaranteesCode1
Revisiting Estimation Bias in Policy Gradients for Deep Reinforcement Learning—0
On The Fragility of Learned Reward Functions—0
Centralized Cooperative Exploration Policy for Continuous Control TasksCode0
Learning Goal-Conditioned Policies Offline with Self-Supervised Reward ShapingCode1
Robust Control for Dynamical Systems With Non-Gaussian Noise via Formal AbstractionsCode0
Imitation Learning As State Matching via Differentiable Physics—0
Offline Policy Optimization in RL with Variance Regularizaton—0
Invariance to Quantile Selection in Distributional Continuous Control—0
Temporally Layered Architecture for Adaptive, Distributed and Continuous Control—0
Variational Quantum Soft Actor-Critic for Robotic Arm Control—0
Managing Temporal Resolution in Continuous Value Estimation: A Fundamental Trade-off—0
A Simple Decentralized Cross-Entropy MethodCode0
Robust Policy Optimization in Deep Reinforcement LearningCode0
PPO-UE: Proximal Policy Optimization via Uncertainty-Aware Exploration—0
On the Sensitivity of Reward Inference to Misspecified Human Models—0
Accelerating Self-Imitation Learning from Demonstrations via Policy Constraints and Q-Ensemble—0
First Go, then Post-Explore: the Benefits of Post-Exploration in Intrinsic Motivation—0
Dynamic Decision Frequency with Continuous OptionsCode0
Q-Pensieve: Boosting Sample Efficiency of Multi-Objective RL Through Memory Sharing of Q-SnapshotsCode0
Policy Learning for Active Target Tracking over Continuous SE(3) TrajectoriesCode1
STL-Based Synthesis of Feedback Controllers Using Reinforcement LearningCode0
Quadratic Programming for Continuous Control of Safety-Critical Multi-Agent Systems Under Uncertainty—0
Continuous Neural Algorithmic Planners—0
Learning from Good Trajectories in Offline Multi-Agent Reinforcement Learning—0
Hypernetworks for Zero-shot Transfer in Reinforcement Learning—0
Show:102550
← PrevPage 7 of 24Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn3,459—Unverified
2TD3 gSDEReturn3,267—Unverified
3TD3Return2,865—Unverified
4SACReturn2,859—Unverified
5PPO gSDEReturn2,587—Unverified
6A2C gSDEReturn2,560—Unverified
7PPOReturn2,160—Unverified
8A2CReturn1,967—Unverified
#ModelMetricClaimedVerifiedStatus
1SACReturn2,883—Unverified
2SAC gSDEReturn2,850—Unverified
3PPO + gSDEReturn2,760—Unverified
4TD3Return2,687—Unverified
5TD3 gSDEReturn2,578—Unverified
6PPOReturn2,254—Unverified
7A2C + gSDEReturn2,028—Unverified
8A2CReturn1,652—Unverified
#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn2,646—Unverified
2PPO gSDEReturn2,508—Unverified
3SACReturn2,477—Unverified
4TD3Return2,470—Unverified
5TD3 gSDEReturn2,353—Unverified
6PPOReturn1,622—Unverified
7A2CReturn1,559—Unverified
8A2C gSDEReturn1,448—Unverified
#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn2,341—Unverified
2SACReturn2,215—Unverified
3TD3Return2,106—Unverified
4TD3 gSDEReturn1,989—Unverified
5PPO gSDEReturn1,776—Unverified
6PPOReturn1,238—Unverified
7A2C gSDEReturn694—Unverified
8A2CReturn443—Unverified
#ModelMetricClaimedVerifiedStatus
1DreamerV1Return800—Unverified
2SLACReturn700—Unverified
3DrQReturn660—Unverified
4PlaNetReturn650—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn998.14—Unverified
2DREAMERReturn853—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn868.87—Unverified
2MuZero UnpluggedReturn594.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn914.39—Unverified
2MuZero UnpluggedReturn869.9—Unverified
#ModelMetricClaimedVerifiedStatus
1DrQReturn963—Unverified
2PlaNetReturn914—Unverified
#ModelMetricClaimedVerifiedStatus
1DrQReturn921—Unverified
2PlaNetReturn890—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn963.07—Unverified
2MuZero UnpluggedReturn759—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn987.79—Unverified
2MuZero UnpluggedReturn887.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn975.46—Unverified
2MuZero UnpluggedReturn949.5—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,353.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-326—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-83.3—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-149.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn417.52—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-170.9—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore730.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-0.4—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn977.38—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore769—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore959—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn984.86—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4,869.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore960.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore606.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore980.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MACScore178.3—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore582—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore841—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn846.91—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore299—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore518—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4,412.4—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn986.38—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore767—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore926—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn972.53—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn681.6—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore287—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,914—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,183.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn528.24—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn926.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn643.1—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore247.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4.5—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore10.4—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore14.1—Unverified
#ModelMetricClaimedVerifiedStatus
1MACScore163.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn659.2—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn556—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-61.7—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-64.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-60.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-61.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn837.76—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn923.54—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn933.77—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn982.26—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore538—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore929—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn971.53—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore269.7—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore96—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn931.06—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore403—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore902—Unverified