Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1151–1200 of 1262 papers

Title	Date	Tasks	Status
Banker Online Mirror Descent: A Universal Approach for Delayed Online Bandit Learning	Jan 25, 2023	Multi-Armed Bandits	—Unverified
Batched Bandits with Crowd Externalities	Sep 29, 2021	Multi-Armed Bandits	—Unverified
Batched Coarse Ranking in Multi-Armed Bandits	Dec 1, 2020	Multi-Armed Bandits	—Unverified
Regret Bounds for Batched Bandits	Oct 11, 2019	Multi-Armed Bandits	—Unverified
Batched Nonparametric Bandits via k-Nearest Neighbor UCB	May 15, 2025	Decision MakingMarketing	—Unverified
Batched Nonparametric Contextual Bandits	Feb 27, 2024	Multi-Armed Bandits	—Unverified
Batched Online Contextual Sparse Bandits with Sequential Inclusion of Features	Sep 13, 2024	Decision MakingFairness	—Unverified
Batched Thompson Sampling	Oct 1, 2021	Multi-Armed BanditsThompson Sampling	—Unverified
Batched Thompson Sampling for Multi-Armed Bandits	Aug 15, 2021	Multi-Armed BanditsThompson Sampling	—Unverified
Batch Ensemble for Variance Dependent Regret in Stochastic Bandits	Sep 13, 2024	Multi-Armed BanditsReinforcement Learning (RL)	—Unverified
Towards Bayesian Data Selection	Jun 18, 2024	Active LearningAdditive models	—Unverified
Bayesian decision-making under misspecified priors with applications to meta-learning	Jul 3, 2021	Decision MakingMeta-Learning	—Unverified
BEACON: Balancing Convenience and Nutrition in Meals With Long-Term Group Recommendations and Reasoning on Multimodal Recipes	Jun 19, 2024	Multi-Armed BanditsNutrition	—Unverified
Beam Learning -- Using Machine Learning for Finding Beam Directions	Jun 11, 2019	BIG-bench Machine LearningMulti-Armed Bandits	—Unverified
Be Greedy in Multi-Armed Bandits	Jan 4, 2021	Multi-Armed Bandits	—Unverified
Efficient Prompt Optimization Through the Lens of Best Arm Identification	Feb 15, 2024	Instruction FollowingMulti-Armed Bandits	—Unverified
Quantile Multi-Armed Bandits: Optimal Best-Arm Identification and a Differentially Private Scheme	Jun 11, 2020	Multi-Armed Bandits	—Unverified
Best-Arm Identification in Correlated Multi-Armed Bandits	Sep 10, 2021	Multi-Armed Bandits	—Unverified
Best Arm Identification in Linked Bandits	Nov 19, 2018	Multi-Armed Bandits	—Unverified
Best arm identification in multi-armed bandits with delayed feedback	Mar 29, 2018	Hyperparameter OptimizationMulti-Armed Bandits	—Unverified
Best Arm Identification in Restless Markov Multi-Armed Bandits	Mar 29, 2022	Multi-Armed Bandits	—Unverified
Best Arm Identification in Stochastic Bandits: Beyond β-optimality	Jan 10, 2023	Computational EfficiencyMulti-Armed Bandits	—Unverified
Best Arm Identification under Additive Transfer Bandits	Dec 8, 2021	Multi-Armed BanditsTransfer Learning	—Unverified
Best-of-Both-Worlds Algorithms for Linear Contextual Bandits	Dec 24, 2023	Multi-Armed Bandits	—Unverified
Best-of-Both-Worlds Linear Contextual Bandits	Dec 27, 2023	Multi-Armed Bandits	—Unverified
Better Algorithms for Stochastic Bandits with Adversarial Corruptions	Feb 22, 2019	Multi-Armed Bandits	—Unverified
Beyond the Hazard Rate: More Perturbation Algorithms for Adversarial Multi-armed Bandits	Feb 17, 2017	Multi-Armed Bandits	—Unverified
Beyond UCB: Optimal and Efficient Contextual Bandits with Regression Oracles	Feb 12, 2020	Multi-Armed Banditsregression	—Unverified
Bi-Criteria Optimization for Combinatorial Bandits: Sublinear Regret and Constraint Violation under Bandit Feedback	Mar 15, 2025	Multi-Armed Bandits	—Unverified
BISTRO: An Efficient Relaxation-Based Method for Contextual Bandits	Feb 6, 2016	Multi-Armed Bandits	—Unverified
BOF-UCB: A Bayesian-Optimistic Frequentist Algorithm for Non-Stationary Contextual Bandits	Jul 7, 2023	Decision MakingMulti-Armed Bandits	—Unverified
Boltzmann Exploration Done Right	May 29, 2017	Decision MakingDecision Making Under Uncertainty	—Unverified
Bootstrapping Upper Confidence Bound	Jun 12, 2019	Decision MakingMulti-Armed Bandits	—Unverified
Boundary Crossing Probabilities for General Exponential Families	May 24, 2017	Multi-Armed Bandits	—Unverified
Bounded Regret for Finitely Parameterized Multi-Armed Bandits	Mar 3, 2020	Multi-Armed Bandits	—Unverified
Breaking the (1/Δ_2) Barrier: Better Batched Best Arm Identification with Adaptive Grids	Jan 29, 2025	Multi-Armed Bandits	—Unverified
Breaking the T Barrier: Instance-Independent Logarithmic Regret in Stochastic Contextual Linear Bandits	May 19, 2022	Multi-Armed Banditsparameter estimation	—Unverified
Bridging Offline Reinforcement Learning and Imitation Learning: A Tale of Pessimism	Mar 22, 2021	Imitation LearningMulti-Armed Bandits	—Unverified
Budget-Constrained Multi-Armed Bandits with Multiple Plays	Nov 16, 2017	Multi-Armed Bandits	—Unverified
Budgeted Combinatorial Multi-Armed Bandits	Feb 8, 2022	Multi-Armed Bandits	—Unverified
Budgeted Recommendation with Delayed Feedback	May 19, 2024	Decision MakingMulti-Armed Bandits	—Unverified
Building Bridges: Viewing Active Learning from the Multi-Armed Bandit Lens	Sep 26, 2013	Active LearningBinary Classification	—Unverified
Bypassing the Monster: A Faster and Simpler Optimal Algorithm for Contextual Bandits under Realizability	Mar 28, 2020	Multi-Armed Banditsregression	—Unverified
Bypassing the Simulator: Near-Optimal Adversarial Linear Contextual Bandits	Sep 2, 2023	Computational EfficiencyMulti-Armed Bandits	—Unverified
Byzantine-Resilient Decentralized Multi-Armed Bandits	Oct 11, 2023	Multi-Armed BanditsRecommendation Systems	—Unverified
Catoni Contextual Bandits are Robust to Heavy-tailed Rewards	Feb 4, 2025	Multi-Armed Bandits	—Unverified
Causal Bandits: Online Decision-Making in Endogenous Settings	Nov 16, 2022	Decision MakingMulti-Armed Bandits	—Unverified
Causal Contextual Bandits with Targeted Interventions	Sep 29, 2021	Multi-Armed Bandits	—Unverified
Causal Feature Selection Method for Contextual Multi-Armed Bandits in Recommender System	Sep 20, 2024	feature selectionMulti-Armed Bandits	—Unverified
Censored Semi-Bandits for Resource Allocation	Apr 12, 2021	Multi-Armed Bandits	—Unverified

Show:10 25 50

← PrevPage 24 of 26Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	NeuralLinear FullPosterior-MR	Cumulative regret	1.92	—	Unverified
2	Linear FullPosterior-MR	Cumulative regret	1.82	—	Unverified