SOTAVerified

Continuous Control

Continuous control in the context of playing games, especially within artificial intelligence (AI) and machine learning (ML), refers to the ability to make a series of smooth, ongoing adjustments or actions to control a game or a simulation. This is in contrast to discrete control, where the actions are limited to a set of specific, distinct choices. Continuous control is crucial in environments where precision, timing, and the magnitude of actions matter, such as driving a car in a racing game, controlling a character in a simulation, or managing the flight of an aircraft in a flight simulator.

Papers

Showing 551–600 of 1161 papers

TitleStatusHype
MO2: Model-Based Offline Options—0
Normality-Guided Distributional Reinforcement Learning for Continuous Control—0
Improvement of Sliding Mode Control Strategy Founded on Cascaded Doubly Fed Induction Generator Powered by a Matrix Converter—0
Cooperative guidance of multiple missiles: a hybrid co-evolutionary approach—0
DDX7: Differentiable FM Synthesis of Musical Instrument Sounds—0
Sequence Model Imitation Learning with Unobserved ContextsCode0
Mitigating Off-Policy Bias in Actor-Critic Methods with One-Step Q-learning: A Novel Correction ApproachCode0
Meta Reinforcement Learning with Successor Feature Based Context—0
Distributional Actor-Critic Ensemble for Uncertainty-Aware Continuous Control—0
Safe and Robust Experience Sharing for Deterministic Policy Gradient AlgorithmsCode0
Live in the Moment: Learning Dynamics Model Adapted to Evolving PolicyCode0
Learn Continuously, Act Discretely: Hybrid Action-Space Reinforcement Learning For Optimal Execution—0
Minimum Description Length Control—0
Contextual Bandits with Smooth Regret: Efficient Learning in Continuous Action SpacesCode0
Learning Bellman Complete Representations for Offline Policy EvaluationCode0
Compactly Restrictable Metric Policy Optimization Problems—0
Learning Temporally Extended Skills in Continuous Domains as Symbolic Actions for Planning—0
Robust Reinforcement Learning in Continuous Control Tasks with Uncertainty Set RegularizationCode0
General Policy Evaluation and Improvement by Learning to Identify Few But Crucial StatesCode0
Offline Policy Optimization with Eligible ActionsCode0
Depth-CUPRL: Depth-Imaged Contrastive Unsupervised Prioritized Representations in Reinforcement Learning for Mapless Navigation of Unmanned Aerial Vehicles—0
Guided Exploration in Reinforcement Learning via Monte Carlo Critic OptimizationCode0
Walk the Random Walk: Learning to Discover and Reach Goals Without Supervision—0
Fighting Fire with Fire: Avoiding DNN Shortcuts through Priming—0
Generalised Policy Improvement with Geometric Policy Composition—0
Mean-Semivariance Policy Optimization via Risk-Averse Reinforcement Learning—0
Regularizing a Model-based Policy Stationary Distribution to Stabilize Offline Reinforcement LearningCode0
Defending Observation Attacks in Deep Reinforcement Learning via Detection and DenoisingCode0
Relative Policy-Transition Optimization for Fast Policy Transfer—0
Dealing with Sparse Rewards in Continuous Control Robotics via Heavy-Tailed Policies—0
Model-based Offline Imitation Learning with Non-expert Data—0
Overcoming the Spectral Bias of Neural Value Approximation—0
Action Noise in Off-Policy Deep Reinforcement Learning: Impact on Exploration and Performance—0
ARC -- Actor Residual Critic for Adversarial Imitation Learning—0
Posterior Coreset Construction with Kernelized Stein Discrepancy for Model-Based Reinforcement Learning—0
Minimax Optimal Online Imitation Learning via Replay EstimationCode0
TaSIL: Taylor Series Imitation LearningCode0
Frustratingly Easy Regularization on Representation Can Boost Deep Reinforcement Learning—0
Multi-Source Transfer Learning for Deep Model-Based Reinforcement Learning—0
SFP: State-free Priors for Exploration in Off-Policy Reinforcement Learning—0
Skill Machines: Temporal Logic Skill Composition in Reinforcement LearningCode0
Efficient Reinforcement Learning from Demonstration Using Local Ensemble and Reparameterization with Split and Merge of Expert Policies—0
IL-flOw: Imitation Learning from Observation using Normalizing Flows—0
Neighborhood Mixup Experience Replay: Local Convex Interpolation for Improved Sample Efficiency in Continuous Control TasksCode0
A cGAN Ensemble-based Uncertainty-aware Surrogate Model for Offline Model-based Optimization in Industrial Control Problems—0
A State-Distribution Matching Approach to Non-Episodic Reinforcement LearningCode0
Simultaneous Double Q-learning with Conservative Advantage Learning for Actor-Critic MethodsCode0
Skill-based Meta-Reinforcement Learning—0
Revisiting Gaussian mixture critics in off-policy reinforcement learning: a sample-based approach—0
SAAC: Safe Reinforcement Learning as an Adversarial Game of Actor-Critics—0
Show:102550
← PrevPage 12 of 24Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn3,459—Unverified
2TD3 gSDEReturn3,267—Unverified
3TD3Return2,865—Unverified
4SACReturn2,859—Unverified
5PPO gSDEReturn2,587—Unverified
6A2C gSDEReturn2,560—Unverified
7PPOReturn2,160—Unverified
8A2CReturn1,967—Unverified
#ModelMetricClaimedVerifiedStatus
1SACReturn2,883—Unverified
2SAC gSDEReturn2,850—Unverified
3PPO + gSDEReturn2,760—Unverified
4TD3Return2,687—Unverified
5TD3 gSDEReturn2,578—Unverified
6PPOReturn2,254—Unverified
7A2C + gSDEReturn2,028—Unverified
8A2CReturn1,652—Unverified
#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn2,646—Unverified
2PPO gSDEReturn2,508—Unverified
3SACReturn2,477—Unverified
4TD3Return2,470—Unverified
5TD3 gSDEReturn2,353—Unverified
6PPOReturn1,622—Unverified
7A2CReturn1,559—Unverified
8A2C gSDEReturn1,448—Unverified
#ModelMetricClaimedVerifiedStatus
1SAC gSDEReturn2,341—Unverified
2SACReturn2,215—Unverified
3TD3Return2,106—Unverified
4TD3 gSDEReturn1,989—Unverified
5PPO gSDEReturn1,776—Unverified
6PPOReturn1,238—Unverified
7A2C gSDEReturn694—Unverified
8A2CReturn443—Unverified
#ModelMetricClaimedVerifiedStatus
1DreamerV1Return800—Unverified
2SLACReturn700—Unverified
3DrQReturn660—Unverified
4PlaNetReturn650—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn998.14—Unverified
2DREAMERReturn853—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn868.87—Unverified
2MuZero UnpluggedReturn594.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn914.39—Unverified
2MuZero UnpluggedReturn869.9—Unverified
#ModelMetricClaimedVerifiedStatus
1DrQReturn963—Unverified
2PlaNetReturn914—Unverified
#ModelMetricClaimedVerifiedStatus
1DrQReturn921—Unverified
2PlaNetReturn890—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn963.07—Unverified
2MuZero UnpluggedReturn759—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn987.79—Unverified
2MuZero UnpluggedReturn887.2—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn975.46—Unverified
2MuZero UnpluggedReturn949.5—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,353.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-326—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-83.3—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-149.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn417.52—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-170.9—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore730.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-0.4—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn977.38—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore769—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore959—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn984.86—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4,869.8—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore960.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore606.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore980.3—Unverified
#ModelMetricClaimedVerifiedStatus
1MACScore178.3—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore582—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore841—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn846.91—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore299—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore518—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4,412.4—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn986.38—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore767—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore926—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn972.53—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn681.6—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore287—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,914—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore1,183.3—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn528.24—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn926.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn643.1—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore247.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore4.5—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore10.4—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore14.1—Unverified
#ModelMetricClaimedVerifiedStatus
1MACScore163.5—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn659.2—Unverified
#ModelMetricClaimedVerifiedStatus
1MuZero UnpluggedReturn556—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-61.7—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-64.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-60.2—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore-61.6—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn837.76—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn923.54—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn933.77—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn982.26—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore538—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore929—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn971.53—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore269.7—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore96—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1TRPOScore0—Unverified
#ModelMetricClaimedVerifiedStatus
1SMuZeroReturn931.06—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore403—Unverified
#ModelMetricClaimedVerifiedStatus
1CURLScore902—Unverified