Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 176–200 of 1262 papers

Title	Date	Tasks	Status
An Analysis of Reinforcement Learning for Malaria Control	Jul 19, 2021	Multi-Armed BanditsOpenAI Gym	—Unverified
An Analysis of the Value of Information when Exploring Stochastic, Discrete Multi-Armed Bandits	Oct 8, 2017	Multi-Armed Bandits	—Unverified
BEACON: Balancing Convenience and Nutrition in Meals With Long-Term Group Recommendations and Reasoning on Multimodal Recipes	Jun 19, 2024	Multi-Armed BanditsNutrition	—Unverified
Beam Learning -- Using Machine Learning for Finding Beam Directions	Jun 11, 2019	BIG-bench Machine LearningMulti-Armed Bandits	—Unverified
Be Greedy in Multi-Armed Bandits	Jan 4, 2021	Multi-Armed Bandits	—Unverified
Efficient Prompt Optimization Through the Lens of Best Arm Identification	Feb 15, 2024	Instruction FollowingMulti-Armed Bandits	—Unverified
Quantile Multi-Armed Bandits: Optimal Best-Arm Identification and a Differentially Private Scheme	Jun 11, 2020	Multi-Armed Bandits	—Unverified
Best-Arm Identification in Correlated Multi-Armed Bandits	Sep 10, 2021	Multi-Armed Bandits	—Unverified
Best Arm Identification in Linked Bandits	Nov 19, 2018	Multi-Armed Bandits	—Unverified
A Gang of Bandits	Jun 4, 2013	ClusteringMulti-Armed Bandits	—Unverified
Best Arm Identification in Restless Markov Multi-Armed Bandits	Mar 29, 2022	Multi-Armed Bandits	—Unverified
Best Arm Identification in Stochastic Bandits: Beyond β-optimality	Jan 10, 2023	Computational EfficiencyMulti-Armed Bandits	—Unverified
Best Arm Identification under Additive Transfer Bandits	Dec 8, 2021	Multi-Armed BanditsTransfer Learning	—Unverified
An Empirical Evaluation of Thompson Sampling	Dec 1, 2011	Multi-Armed BanditsThompson Sampling	—Unverified
Best-of-Both-Worlds Algorithms for Linear Contextual Bandits	Dec 24, 2023	Multi-Armed Bandits	—Unverified
Best-of-Both-Worlds Linear Contextual Bandits	Dec 27, 2023	Multi-Armed Bandits	—Unverified
Better Algorithms for Stochastic Bandits with Adversarial Corruptions	Feb 22, 2019	Multi-Armed Bandits	—Unverified
Beyond the Hazard Rate: More Perturbation Algorithms for Adversarial Multi-armed Bandits	Feb 17, 2017	Multi-Armed Bandits	—Unverified
Beyond UCB: Optimal and Efficient Contextual Bandits with Regression Oracles	Feb 12, 2020	Multi-Armed Banditsregression	—Unverified
Bi-Criteria Optimization for Combinatorial Bandits: Sublinear Regret and Constraint Violation under Bandit Feedback	Mar 15, 2025	Multi-Armed Bandits	—Unverified
BISTRO: An Efficient Relaxation-Based Method for Contextual Bandits	Feb 6, 2016	Multi-Armed Bandits	—Unverified
BOF-UCB: A Bayesian-Optimistic Frequentist Algorithm for Non-Stationary Contextual Bandits	Jul 7, 2023	Decision MakingMulti-Armed Bandits	—Unverified
Boltzmann Exploration Done Right	May 29, 2017	Decision MakingDecision Making Under Uncertainty	—Unverified
Balanced off-policy evaluation in general action spaces	Jun 9, 2019	Binary Classificationcounterfactual	—Unverified
Balanced Linear Contextual Bandits	Dec 15, 2018	Causal InferenceMulti-Armed Bandits	—Unverified

Show:10 25 50

← PrevPage 8 of 51Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	NeuralLinear FullPosterior-MR	Cumulative regret	1.92	—	Unverified
2	Linear FullPosterior-MR	Cumulative regret	1.82	—	Unverified