Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 51–75 of 1262 papers

Title	Date	Tasks	Status
Adaptive, Robust and Scalable Bayesian Filtering for Online Learning	May 12, 2025	Continual LearningMulti-Armed Bandits	—Unverified
Active Velocity Estimation using Light Curtains via Self-Supervised Multi-Armed Bandits	Feb 24, 2023	Multi-Armed BanditsNavigate	—Unverified
ADARES: Adaptive Resource Management for Virtual Machines	Dec 5, 2018	ManagementMulti-Armed Bandits	—Unverified
AdaLinUCB: Opportunistic Learning for Contextual Bandits	Feb 20, 2019	Multi-Armed Bandits	—Unverified
A Decision-Language Model (DLM) for Dynamic Restless Multi-Armed Bandit Tasks in Public Health	Feb 22, 2024	Language ModelingLanguage Modelling	—Unverified
Bandits with Knapsacks beyond the Worst-Case	Feb 1, 2020	Multi-Armed Bandits	—Unverified
Adversarial Attacks on Adversarial Bandits	Jan 30, 2023	Multi-Armed BanditsRecommendation Systems	—Unverified
Adapting Bandit Algorithms for Settings with Sequentially Available Arms	Sep 30, 2021	ManagementMulti-Armed Bandits	—Unverified
Adversarial Attacks on Cooperative Multi-agent Bandits	Nov 3, 2023	Multi-Armed Bandits	—Unverified
Adversarial Attacks on Linear Contextual Bandits	Feb 10, 2020	Multi-Armed BanditsRecommendation Systems	—Unverified
Adversarial Bandits with Knapsacks	Nov 28, 2018	Multi-Armed BanditsScheduling	—Unverified
Adversarial Contextual Bandits Go Kernelized	Oct 2, 2023	Decision MakingMulti-Armed Bandits	—Unverified
Active Search for High Recall: a Non-Stationary Extension of Thompson Sampling	Dec 27, 2017	Multi-Armed BanditsThompson Sampling	—Unverified
Adaptively Learning to Select-Rank in Online Platforms	Jun 7, 2024	Multi-Armed BanditsThompson Sampling	—Unverified
A Central Limit Theorem, Loss Aversion and Multi-Armed Bandits	Jun 10, 2021	Multi-Armed Bandits	—Unverified
Analysis of Thompson Sampling for Partially Observable Contextual Multi-Armed Bandits	Oct 23, 2021	Decision MakingMulti-Armed Bandits	—Unverified
A Near-Optimal Change-Detection Based Algorithm for Piecewise-Stationary Combinatorial Semi-Bandits	Aug 27, 2019	Change DetectionMulti-Armed Bandits	—Unverified
Active Reinforcement Learning: Observing Rewards at a Cost	Nov 13, 2020	Multi-Armed Banditsreinforcement-learning	—Unverified
Adaptive Learning Rate for Follow-the-Regularized-Leader: Competitive Analysis and Best-of-Both-Worlds	Mar 1, 2024	Decision MakingMulti-Armed Bandits	—Unverified
Almost Optimal Batch-Regret Tradeoff for Batch Linear Contextual Bandits	Oct 15, 2021	Multi-Armed Bandits	—Unverified
Active Inference for Autonomous Decision-Making with Contextual Multi-Armed Bandits	Sep 19, 2022	Decision MakingDecision Making Under Uncertainty	—Unverified
Adaptive Exploration in Linear Contextual Bandit	Oct 15, 2019	Decision MakingMulti-Armed Bandits	—Unverified
Accurate and Fast Federated Learning via Combinatorial Multi-Armed Bandits	Dec 6, 2020	BIG-bench Machine LearningFederated Learning	—Unverified
A Model Selection Approach for Corruption Robust Reinforcement Learning	Oct 7, 2021	Model SelectionMulti-Armed Bandits	—Unverified
A Bandit Approach to Sequential Experimental Design with False Discovery Control	Dec 1, 2018	Drug DiscoveryExperimental Design	—Unverified

Show:10 25 50

← PrevPage 3 of 51Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	NeuralLinear FullPosterior-MR	Cumulative regret	1.92	—	Unverified
2	Linear FullPosterior-MR	Cumulative regret	1.82	—	Unverified