Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 276–300 of 1262 papers

Title	Date	Tasks	Status
Top-k Combinatorial Bandits with Full-Bandit Feedback	May 28, 2019	Multi-Armed Bandits	—Unverified
A Provably Efficient Model-Free Posterior Sampling Method for Episodic Reinforcement Learning	Aug 23, 2022	Multi-Armed Banditsreinforcement-learning	—Unverified
Communication-Efficient Collaborative Regret Minimization in Multi-Armed Bandits	Jan 26, 2023	Multi-agent Reinforcement LearningMulti-Armed Bandits	—Unverified
Adversarial Attacks on Adversarial Bandits	Jan 30, 2023	Multi-Armed BanditsRecommendation Systems	—Unverified
Adapting Bandit Algorithms for Settings with Sequentially Available Arms	Sep 30, 2021	ManagementMulti-Armed Bandits	—Unverified
Collaborative Multi-Agent Heterogeneous Multi-Armed Bandits	May 30, 2023	Multi-Armed Bandits	—Unverified
Collaborative Min-Max Regret in Grouped Multi-Armed Bandits	Jun 12, 2025	Multi-Armed Bandits	—Unverified
Approximately Stationary Bandits with Knapsacks	Feb 28, 2023	Multi-Armed Bandits	—Unverified
Collaborative Learning with Limited Interaction: Tight Bounds for Distributed Exploration in Multi-Armed Bandits	Apr 5, 2019	Multi-Armed Bandits	—Unverified
Parallel Best Arm Identification in Heterogeneous Environments	Jul 16, 2022	Multi-Armed Bandits	—Unverified
Approximate Function Evaluation via Multi-Armed Bandits	Mar 18, 2022	Multi-Armed Bandits	—Unverified
Bandits with Knapsacks beyond the Worst-Case	Feb 1, 2020	Multi-Armed Bandits	—Unverified
COBRA: Contextual Bandit Algorithm for Ensuring Truthful Strategic Agents	May 29, 2025	Multi-Armed Bandits	—Unverified
Clustered Linear Contextual Bandits with Knapsacks	Aug 21, 2023	EconometricsMulti-Armed Bandits	—Unverified
A One-Size-Fits-All Solution to Conservative Bandit Problems	Dec 14, 2020	AllMulti-Armed Bandits	—Unverified
Classical Bandit Algorithms for Entanglement Detection in Parameterized Qubit States	Jun 28, 2024	Multi-Armed Bandits	—Unverified
Censored Semi-Bandits for Resource Allocation	Apr 12, 2021	Multi-Armed Bandits	—Unverified
A Decision-Language Model (DLM) for Dynamic Restless Multi-Armed Bandit Tasks in Public Health	Feb 22, 2024	Language ModelingLanguage Modelling	—Unverified
AdaptEx: A Self-Service Contextual Bandit Platform	Aug 8, 2023	Multi-Armed BanditsThompson Sampling	—Unverified
Achieving User-Side Fairness in Contextual Bandits	Oct 22, 2020	FairnessMulti-Armed Bandits	—Unverified
Context in Public Health for Underserved Communities: A Bayesian Approach to Online Restless Bandits	Feb 7, 2024	Multi-Armed BanditsReinforcement Learning (RL)	—Unverified
Causal Feature Selection Method for Contextual Multi-Armed Bandits in Recommender System	Sep 20, 2024	feature selectionMulti-Armed Bandits	—Unverified
Causal Contextual Bandits with Targeted Interventions	Sep 29, 2021	Multi-Armed Bandits	—Unverified
A Novel Approach to Balance Convenience and Nutrition in Meals With Long-Term Group Recommendations and Reasoning on Multimodal Recipes and its Implementation in BEACON	Dec 23, 2024	Multi-Armed BanditsNutrition	—Unverified
Causal Bandits: Online Decision-Making in Endogenous Settings	Nov 16, 2022	Decision MakingMulti-Armed Bandits	—Unverified

Show:10 25 50

← PrevPage 12 of 51Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	NeuralLinear FullPosterior-MR	Cumulative regret	1.92	—	Unverified
2	Linear FullPosterior-MR	Cumulative regret	1.82	—	Unverified