SOTAVerified|Agents Browse Leaderboard About

Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 501–525 of 1262 papers

Title	Date	Tasks	Status
Finite-Horizon Single-Pull Restless Bandits: An Efficient Index Policy For Scarce Resource Allocation	Jan 10, 2025	Multi-Armed Bandits	—Unverified
Decision Making in Changing Environments: Robustness, Query-Based Learning, and Differential Privacy	Jan 24, 2025	Decision MakingMulti-Armed Bandits	—Unverified
Scalable Decision-Focused Learning in Restless Multi-Armed Bandits with Application to Maternal and Child Health	Feb 2, 2022	Multi-Armed BanditsScheduling	—Unverified
Finite-Time Analysis of Whittle Index based Q-Learning for Restless Multi-Armed Bandits with Neural Network Function Approximation	Oct 3, 2023	Multi-Armed BanditsQ-Learning	—Unverified
Batched Thompson Sampling for Multi-Armed Bandits	Aug 15, 2021	Multi-Armed BanditsThompson Sampling	—Unverified
First- and Second-Order Bounds for Adversarial Linear Contextual Bandits	May 1, 2023	Multi-Armed Bandits	—Unverified
Fixed-Budget Best-Arm Identification in Structured Bandits	Jun 9, 2021	Multi-Armed Bandits	—Unverified
FLASH: Federated Learning Across Simultaneous Heterogeneities	Feb 13, 2024	Federated LearningMulti-Armed Bandits	—Unverified
Flexible and Efficient Contextual Bandits with Heterogeneous Treatment Effect Oracles	Mar 30, 2022	Decision MakingHeterogeneous Treatment Effect Estimation	—Unverified
Follow-ups Also Matter: Improving Contextual Bandits via Post-serving Contexts	Sep 25, 2023	LEMMAMulti-Armed Bandits	—Unverified
Decision Automation for Electric Power Network Recovery	Oct 1, 2019	Decision MakingMulti-Armed Bandits	—Unverified
Decentralized Smart Charging of Large-Scale EVs using Adaptive Multi-Agent Multi-Armed Bandits	Jul 20, 2023	FairnessMulti-Armed Bandits	—Unverified
Batched Thompson Sampling	Oct 1, 2021	Multi-Armed BanditsThompson Sampling	—Unverified
An Adaptive Method for Contextual Stochastic Multi-armed Bandits with Rewards Generated by a Linear Dynamical System	Jun 14, 2024	Multi-Armed Bandits	—Unverified
Decentralized Multi-player Multi-armed Bandits with No Collision Information	Feb 29, 2020	Multi-Armed Bandits	—Unverified
Decentralized Upper Confidence Bound Algorithms for Homogeneous Multi-Agent Multi-Armed Bandits	Nov 22, 2021	Multi-Armed Bandits	—Unverified
Batched Online Contextual Sparse Bandits with Sequential Inclusion of Features	Sep 13, 2024	Decision MakingFairness	—Unverified
Decentralized Exploration in Multi-Armed Bandits -- Extended version	Nov 19, 2018	Multi-Armed Bandits	—Unverified
Batched Nonparametric Contextual Bandits	Feb 27, 2024	Multi-Armed Bandits	—Unverified
Decentralized Cooperative Reinforcement Learning with Hierarchical Information Structure	Nov 1, 2021	Multi-agent Reinforcement LearningMulti-Armed Bandits	—Unverified
DBA bandits: Self-driving index tuning under ad-hoc, analytical workloads with safety guarantees	Oct 19, 2020	AttributeDecision Making	—Unverified
Data Poisoning Attacks on Stochastic Bandits	May 16, 2019	Data PoisoningMulti-Armed Bandits	—Unverified
Batched Nonparametric Bandits via k-Nearest Neighbor UCB	May 15, 2025	Decision MakingMarketing	—Unverified
Regret Bounds for Batched Bandits	Oct 11, 2019	Multi-Armed Bandits	—Unverified
A Model Selection Approach for Corruption Robust Reinforcement Learning	Oct 7, 2021	Model SelectionMulti-Armed Bandits	—Unverified

Show:10 25 50

← PrevPage 21 of 51Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	NeuralLinear FullPosterior-MR	Cumulative regret	1.92	—	Unverified
2	Linear FullPosterior-MR	Cumulative regret	1.82	—	Unverified