Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 151–200 of 1262 papers

Title	Date	Tasks	Status
Bandit Regret Scaling with the Effective Loss Range	May 15, 2017	Multi-Armed Bandits	—Unverified
Bandits Don't Follow Rules: Balancing Multi-Facet Machine Translation with Multi-Armed Bandits	Oct 13, 2021	Machine TranslationMulti-Armed Bandits	—Unverified
Bandits Don’t Follow Rules: Balancing Multi-Facet Machine Translation with Multi-Armed Bandits	Nov 1, 2021	Machine TranslationMulti-Armed Bandits	—Unverified
Bandits for Learning to Explain from Explanations	Feb 7, 2021	Gaussian ProcessesMulti-Armed Bandits	—Unverified
Bandits meet Computer Architecture: Designing a Smartly-allocated Cache	Jan 31, 2016	Multi-Armed Bandits	—Unverified
Bandit Social Learning: Exploration under Myopic Behavior	Feb 15, 2023	Multi-Armed Bandits	—Unverified
Bandits Warm-up Cold Recommender Systems	Jul 10, 2014	Multi-Armed BanditsRecommendation Systems	—Unverified
Preferences Evolve And So Should Your Bandits: Bandits with Evolving States for Online Platforms	Jul 21, 2023	Multi-Armed BanditsRecommendation Systems	—Unverified
Bandits with Knapsacks beyond the Worst Case	Dec 1, 2021	Multi-Armed Bandits	—Unverified
Bandits with Partially Observable Confounded Data	Jun 11, 2020	Multi-Armed Bandits	—Unverified
Bandits with Temporal Stochastic Constraints	Nov 22, 2018	Multi-Armed Bandits	—Unverified
Banker Online Mirror Descent	Jun 16, 2021	Multi-Armed Bandits	—Unverified
Banker Online Mirror Descent: A Universal Approach for Delayed Online Bandit Learning	Jan 25, 2023	Multi-Armed Bandits	—Unverified
Batched Bandits with Crowd Externalities	Sep 29, 2021	Multi-Armed Bandits	—Unverified
Batched Coarse Ranking in Multi-Armed Bandits	Dec 1, 2020	Multi-Armed Bandits	—Unverified
Almost Optimal Batch-Regret Tradeoff for Batch Linear Contextual Bandits	Oct 15, 2021	Multi-Armed Bandits	—Unverified
Regret Bounds for Batched Bandits	Oct 11, 2019	Multi-Armed Bandits	—Unverified
Batched Nonparametric Bandits via k-Nearest Neighbor UCB	May 15, 2025	Decision MakingMarketing	—Unverified
Breaking the (1/Δ_2) Barrier: Better Batched Best Arm Identification with Adaptive Grids	Jan 29, 2025	Multi-Armed Bandits	—Unverified
Batched Online Contextual Sparse Bandits with Sequential Inclusion of Features	Sep 13, 2024	Decision MakingFairness	—Unverified
Batched Thompson Sampling	Oct 1, 2021	Multi-Armed BanditsThompson Sampling	—Unverified
Batched Thompson Sampling for Multi-Armed Bandits	Aug 15, 2021	Multi-Armed BanditsThompson Sampling	—Unverified
Batch Ensemble for Variance Dependent Regret in Stochastic Bandits	Sep 13, 2024	Multi-Armed BanditsReinforcement Learning (RL)	—Unverified
Towards Bayesian Data Selection	Jun 18, 2024	Active LearningAdditive models	—Unverified
Bayesian decision-making under misspecified priors with applications to meta-learning	Jul 3, 2021	Decision MakingMeta-Learning	—Unverified
An Analysis of Reinforcement Learning for Malaria Control	Jul 19, 2021	Multi-Armed BanditsOpenAI Gym	—Unverified
An Analysis of the Value of Information when Exploring Stochastic, Discrete Multi-Armed Bandits	Oct 8, 2017	Multi-Armed Bandits	—Unverified
BEACON: Balancing Convenience and Nutrition in Meals With Long-Term Group Recommendations and Reasoning on Multimodal Recipes	Jun 19, 2024	Multi-Armed BanditsNutrition	—Unverified
Beam Learning -- Using Machine Learning for Finding Beam Directions	Jun 11, 2019	BIG-bench Machine LearningMulti-Armed Bandits	—Unverified
Be Greedy in Multi-Armed Bandits	Jan 4, 2021	Multi-Armed Bandits	—Unverified
Efficient Prompt Optimization Through the Lens of Best Arm Identification	Feb 15, 2024	Instruction FollowingMulti-Armed Bandits	—Unverified
Quantile Multi-Armed Bandits: Optimal Best-Arm Identification and a Differentially Private Scheme	Jun 11, 2020	Multi-Armed Bandits	—Unverified
Balancing Act: Prioritization Strategies for LLM-Designed Restless Bandit Rewards	Aug 22, 2024	Language ModelingLanguage Modelling	—Unverified
Best Arm Identification in Linked Bandits	Nov 19, 2018	Multi-Armed Bandits	—Unverified
A Gang of Bandits	Jun 4, 2013	ClusteringMulti-Armed Bandits	—Unverified
Best Arm Identification in Restless Markov Multi-Armed Bandits	Mar 29, 2022	Multi-Armed Bandits	—Unverified
Best Arm Identification in Stochastic Bandits: Beyond β-optimality	Jan 10, 2023	Computational EfficiencyMulti-Armed Bandits	—Unverified
Best Arm Identification under Additive Transfer Bandits	Dec 8, 2021	Multi-Armed BanditsTransfer Learning	—Unverified
An Empirical Evaluation of Thompson Sampling	Dec 1, 2011	Multi-Armed BanditsThompson Sampling	—Unverified
Best-of-Both-Worlds Algorithms for Linear Contextual Bandits	Dec 24, 2023	Multi-Armed Bandits	—Unverified
Best-of-Both-Worlds Linear Contextual Bandits	Dec 27, 2023	Multi-Armed Bandits	—Unverified
Better Algorithms for Stochastic Bandits with Adversarial Corruptions	Feb 22, 2019	Multi-Armed Bandits	—Unverified
Beyond the Hazard Rate: More Perturbation Algorithms for Adversarial Multi-armed Bandits	Feb 17, 2017	Multi-Armed Bandits	—Unverified
Beyond UCB: Optimal and Efficient Contextual Bandits with Regression Oracles	Feb 12, 2020	Multi-Armed Banditsregression	—Unverified
Bi-Criteria Optimization for Combinatorial Bandits: Sublinear Regret and Constraint Violation under Bandit Feedback	Mar 15, 2025	Multi-Armed Bandits	—Unverified
BISTRO: An Efficient Relaxation-Based Method for Contextual Bandits	Feb 6, 2016	Multi-Armed Bandits	—Unverified
BOF-UCB: A Bayesian-Optimistic Frequentist Algorithm for Non-Stationary Contextual Bandits	Jul 7, 2023	Decision MakingMulti-Armed Bandits	—Unverified
Boltzmann Exploration Done Right	May 29, 2017	Decision MakingDecision Making Under Uncertainty	—Unverified
A framework for optimizing COVID-19 testing policy using a Multi Armed Bandit approach	Jul 28, 2020	Decision MakingMulti-Armed Bandits	—Unverified
Balanced Linear Contextual Bandits	Dec 15, 2018	Causal InferenceMulti-Armed Bandits	—Unverified

Show:10 25 50

← PrevPage 4 of 26Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	NeuralLinear FullPosterior-MR	Cumulative regret	1.92	—	Unverified
2	Linear FullPosterior-MR	Cumulative regret	1.82	—	Unverified