SOTAVerified

Continuous Control

Continuous control in the context of playing games, especially within artificial intelligence (AI) and machine learning (ML), refers to the ability to make a series of smooth, ongoing adjustments or actions to control a game or a simulation. This is in contrast to discrete control, where the actions are limited to a set of specific, distinct choices. Continuous control is crucial in environments where precision, timing, and the magnitude of actions matter, such as driving a car in a racing game, controlling a character in a simulation, or managing the flight of an aircraft in a flight simulator.

Papers

Showing 601–650 of 1161 papers

TitleStatusHype
Evolving Pareto-Optimal Actor-Critic Algorithms for Generalizability and Stability—0
Automating Reinforcement Learning with Example-based ResetsCode0
Continuously Discovering Novel Strategies via Reward-Switching Policy Optimization—0
Remember and Forget Experience Replay for Multi-Agent Reinforcement Learning—0
Multitask Neuroevolution for Reinforcement Learning with Long and Short Episodes—0
Temporal Abstractions-Augmented Temporally Contrastive Learning: An Alternative to the Laplacian in RL—0
Multiscale Sensor Fusion and Continuous Control with Neural CDEs—0
Provably Efficient Convergence of Primal-Dual Actor-Critic with Nonlinear Function Approximation—0
Policy Learning and Evaluation with Randomized Quasi-Monte Carlo—0
Strategy Discovery and Mixture in Lifelong Learning from Heterogeneous Demonstration—0
Robust Learning from Observation with Model MisspecificationCode0
Uncertainty Aware System Identification with Universal Policies—0
Imitation Learning by State-Only Distribution MatchingCode0
Exploration with Multi-Sample Target Values for Distributional Reinforcement Learning—0
Approximate Policy Iteration with Bisimulation MetricsCode0
Adversarial Imitation Learning from Video using a State Observer—0
You May Not Need Ratio Clipping in PPO—0
DNS: Determinantal Point Process Based Neural Network Sampler for Ensemble Reinforcement LearningCode0
Zeroth-Order Actor-Critic: An Evolutionary Framework for Sequential Decision ProblemsCode0
Robust Imitation Learning from Corrupted Demonstrations—0
Overcoming Exploration: Deep Reinforcement Learning for Continuous Control in Cluttered Environments from Temporal Logic Specifications—0
State-Conditioned Adversarial Subgoal Generation—0
Recursive Least Squares Advantage Actor-Critic Algorithms—0
Evolutionary Action Selection for Gradient-based Policy Learning—0
Toward Causal-Aware RL: State-Wise Action-Refined Temporal DifferenceCode0
A Surrogate-Assisted Controller for Expensive Evolutionary Reinforcement Learning—0
Single-Shot Pruning for Offline Reinforcement Learning—0
Multiagent Model-based Credit Assignment for Continuous Control—0
Value Activation for Bias Alleviation: Generalized-activated Deep Double Deterministic Policy GradientsCode0
Model-Based Safe Reinforcement Learning with Time-Varying State and Control Constraints: An Application to Intelligent Vehicles—0
CEM-GD: Cross-Entropy Method with Gradient Descent Planner for Model-Based Reinforcement LearningCode0
Dynamic Exploitation Gaussian Bare-Bones Bat Algorithm for Optimal Reactive Power Dispatch to Improve the Safety and Stability of Power System—0
Zero-Shot Uncertainty-Aware Deployment of Simulation Trained Policies on Real-World Robots—0
More Control for Free! Image Synthesis with Semantic Diffusion Guidance—0
CoMPS: Continual Meta Policy Search—0
MESA: Offline Meta-RL for Safe Adaptation and Fault Tolerance—0
ED2: Environment Dynamics Decomposition World Models for Continuous ControlCode0
Curriculum Offline Imitating Learning—0
Wish you were here: Hindsight Goal Selection for long-horizon dexterous manipulation—0
CO-PILOT: COllaborative Planning and reInforcement Learning On sub-Task curriculumCode0
Continuous Control With Ensemble Deep Deterministic Policy GradientsCode0
Adaptively Calibrated Critic Estimates for Deep Reinforcement LearningCode0
Learning State Representations via Retracing in Reinforcement LearningCode0
Uncertainty-aware Low-Rank Q-Matrix Estimation for Deep Reinforcement Learning—0
Aggressive Q-Learning with Ensembles: Achieving Both High Sample Efficiency and High Asymptotic Performance—0
GRI: General Reinforced Imitation and its Application to Vision-Based Autonomous Driving—0
Obstacle Avoidance for UAS in Continuous Action Space Using Deep Reinforcement Learning—0
AWD3: Dynamic Reduction of the Estimation Bias—0
Smooth Imitation Learning via Smooth Costs and Smooth Policies—0
Is Bang-Bang Control All You Need? Solving Continuous Control with Bernoulli Policies—0
Show:102550
← PrevPage 13 of 24Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn3,459—Unverified
2TD3 gSDEReturn3,267—Unverified
3TD3Return2,865—Unverified
4SACReturn2,859—Unverified
5PPO gSDEReturn2,587—Unverified
6A2C gSDEReturn2,560—Unverified
7PPOReturn2,160—Unverified
8A2CReturn1,967—Unverified
#ModelMetricClaimedVerifiedStatus
1SACReturn2,883—Unverified
2SAC gSDEReturn2,850—Unverified
3PPO + gSDEReturn2,760—Unverified
4TD3Return2,687—Unverified
5TD3 gSDEReturn2,578—Unverified
6PPOReturn2,254—Unverified
7A2C + gSDEReturn2,028—Unverified
8A2CReturn1,652—Unverified
#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn2,646—Unverified
2PPO gSDEReturn2,508—Unverified
3SACReturn2,477—Unverified
4TD3Return2,470—Unverified
5TD3 gSDEReturn2,353—Unverified
6PPOReturn1,622—Unverified
7A2CReturn1,559—Unverified
8A2C gSDEReturn1,448—Unverified
#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn2,341—Unverified
2SACReturn2,215—Unverified
3TD3Return2,106—Unverified
4TD3 gSDEReturn1,989—Unverified
5PPO gSDEReturn1,776—Unverified
6PPOReturn1,238—Unverified
7A2C gSDEReturn694—Unverified
8A2CReturn443—Unverified
#ModelMetricClaimedVerifiedStatus
1DreamerV1Return800—Unverified
2SLACReturn700—Unverified
3DrQReturn660—Unverified
4PlaNetReturn650—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn998.14—Unverified
2DREAMERReturn853—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn868.87—Unverified
2MuZero UnpluggedReturn594.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn914.39—Unverified
2MuZero UnpluggedReturn869.9—Unverified
#ModelMetricClaimedVerifiedStatus
1DrQReturn963—Unverified
2PlaNetReturn914—Unverified
#ModelMetricClaimedVerifiedStatus
1DrQReturn921—Unverified
2PlaNetReturn890—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn963.07—Unverified
2MuZero UnpluggedReturn759—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn987.79—Unverified
2MuZero UnpluggedReturn887.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn975.46—Unverified
2MuZero UnpluggedReturn949.5—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,353.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-326—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-83.3—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-149.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn417.52—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-170.9—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore730.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-0.4—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn977.38—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore769—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore959—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn984.86—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4,869.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore960.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore606.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore980.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MACScore178.3—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore582—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore841—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn846.91—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore299—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore518—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4,412.4—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn986.38—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore767—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore926—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn972.53—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn681.6—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore287—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,914—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,183.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn528.24—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn926.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn643.1—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore247.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4.5—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore10.4—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore14.1—Unverified
#ModelMetricClaimedVerifiedStatus
1MACScore163.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn659.2—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn556—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-61.7—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-64.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-60.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-61.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn837.76—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn923.54—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn933.77—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn982.26—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore538—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore929—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn971.53—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore269.7—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore96—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn931.06—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore403—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore902—Unverified