Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 1001–1050 of 1262 papers

Title	Date	Tasks	Status
PAC Reinforcement Learning with Rich Observations	Feb 8, 2016	Decision MakingMulti-Armed Bandits	—Unverified
Pairwise Elimination with Instance-Dependent Guarantees for Bandits with Cost Subsidy	Jan 17, 2025	Multi-Armed Bandits	—Unverified
Parallel Contextual Bandits in Wireless Handover Optimization	Jan 21, 2019	Multi-Armed BanditsThompson Sampling	—Unverified
Parallelizing Contextual Bandits	May 21, 2021	Decision MakingDecision Making Under Uncertainty	—Unverified
Parameterized Exploration	Jul 13, 2019	Multi-Armed Bandits	—Unverified
Partial Bandit and Semi-Bandit: Making the Most Out of Scarce Users' Feedback	Sep 16, 2020	Multi-Armed BanditsRecommendation Systems	—Unverified
Partially Observable Contextual Bandits with Linear Payoffs	Sep 17, 2024	Decision MakingMulti-Armed Bandits	—Unverified
Personalization Paradox in Behavior Change Apps: Lessons from a Social Comparison-Based Personalized App for Physical Activity	Jan 25, 2021	Multi-Armed Bandits	—Unverified
Personalized Course Sequence Recommendations	Dec 30, 2015	Multi-Armed Bandits	—Unverified
Perturbed-History Exploration in Stochastic Multi-Armed Bandits	Feb 26, 2019	Multi-Armed Bandits	—Unverified
Pessimism for Offline Linear Contextual Bandits using _p Confidence Sets	May 21, 2022	Multi-Armed Bandits	—Unverified
PG-TS: Improved Thompson Sampling for Logistic Contextual Bandits	May 18, 2018	Multi-Armed BanditsThompson Sampling	—Unverified
Phasic Diversity Optimization for Population-Based Reinforcement Learning	Mar 17, 2024	DiversityMuJoCo	—Unverified
Non-Stationary Off-Policy Optimization	Jun 15, 2020	Multi-Armed Bandits	—Unverified
Player Modeling via Multi-Armed Bandits	Feb 10, 2021	Multi-Armed Bandits	—Unverified
Policy Gradients for Contextual Recommendations	Feb 12, 2018	Decision MakingMulti-Armed Bandits	—Unverified
Practical Algorithms for Best-K Identification in Multi-Armed Bandits	May 19, 2017	Multi-Armed Bandits	—Unverified
Practical Contextual Bandits with Regression Oracles	Mar 3, 2018	General ClassificationMulti-Armed Bandits	—Unverified
Preference-based Online Learning with Dueling Bandits: A Survey	Jul 30, 2018	Multi-Armed BanditsSurvey	—Unverified
Preference-centric Bandits: Optimality of Mixtures and Regret-efficient Algorithms	Apr 29, 2025	Multi-Armed BanditsNavigate	—Unverified
Privacy Amplification via Shuffling for Linear Contextual Bandits	Dec 11, 2021	Multi-Armed Bandits	—Unverified
Privacy-Preserving Communication-Efficient Federated Multi-Armed Bandits	Nov 2, 2021	Decision MakingMulti-Armed Bandits	—Unverified
Privacy-Preserving Multi-Party Contextual Bandits	Oct 11, 2019	Multi-Armed BanditsPrivacy Preserving	—Unverified
Problem Dependent Reinforcement Learning Bounds Which Can Identify Bandit Structure in MDPs	Nov 3, 2019	Multi-Armed Banditsreinforcement-learning	—Unverified
Productization Challenges of Contextual Multi-Armed Bandits	Jul 10, 2019	Multi-Armed Bandits	—Unverified
Proportional Response: Contextual Bandits for Simple and Cumulative Regret Minimization	Jul 5, 2023	Multi-Armed Bandits	—Unverified
Provable Benefits of Policy Learning from Human Preferences in Contextual Bandit Problems	Jul 24, 2023	Decision MakingMulti-Armed Bandits	—Unverified
Provable General Function Class Representation Learning in Multitask Bandits and MDPs	May 31, 2022	Multi-Armed BanditsReinforcement Learning (RL)	—Unverified
Provably and Practically Efficient Neural Contextual Bandits	May 31, 2022	Multi-Armed Bandits	—Unverified
Provably Efficient High-Dimensional Bandit Learning with Batched Feedbacks	Nov 22, 2023	Multi-Armed Bandits	—Unverified
Transfer Learning with Partially Observable Offline Data via Causal Bounds	Aug 7, 2023	Multi-Armed BanditsTransfer Learning	—Unverified
Provably Efficient Reinforcement Learning for Adversarial Restless Multi-Armed Bandits with Unknown Transitions and Bandit Feedback	May 2, 2024	Multi-Armed BanditsSequential Decision Making	—Unverified
Provably Efficient RLHF Pipeline: A Unified View from Contextual Bandits	Feb 11, 2025	Computational EfficiencyMulti-Armed Bandits	—Unverified
Provably Optimal Algorithms for Generalized Linear Contextual Bandits	Feb 28, 2017	Multi-Armed BanditsNews Recommendation	—Unverified
Pure Exploration in Asynchronous Federated Bandits	Oct 17, 2023	Multi-Armed Bandits	—Unverified
Pure exploration in multi-armed bandits with low rank structure using oblivious sampler	Jun 28, 2023	Multi-Armed Bandits	—Unverified
Combinatorial Pure Exploration of Causal Bandits	Jun 16, 2022	Causal InferenceMulti-Armed Bandits	—Unverified
Pure Exploration under Mediators' Feedback	Aug 29, 2023	Decision MakingMulti-Armed Bandits	—Unverified
QoS-Aware Multi-Armed Bandits	Feb 28, 2017	Decision MakingMulti-Armed Bandits	—Unverified
Quantile Multi-Armed Bandits with 1-bit Feedback	Feb 10, 2025	Multi-Armed Bandits	—Unverified
Quantum contextual bandits and recommender systems for quantum data	Jan 31, 2023	Multi-Armed BanditsRecommendation Systems	—Unverified
Quantum Heavy-tailed Bandits	Jan 23, 2023	Multi-Armed Bandits	—Unverified
Quantum Multi-Armed Bandits and Stochastic Linear Bandits Enjoy Logarithmic Regrets	May 30, 2022	Multi-Armed Banditsreinforcement-learning	—Unverified
Query-Efficient Correlation Clustering with Noisy Oracle	Feb 2, 2024	ClusteringMulti-Armed Bandits	—Unverified
Queue Scheduling with Adversarial Bandit Learning	Mar 3, 2023	Multi-Armed BanditsScheduling	—Unverified
Quick-Draw Bandits: Quickly Optimizing in Nonstationary Environments with Extremely Many Arms	May 30, 2025	Multi-Armed Bandits	—Unverified
Raising Student Completion Rates with Adaptive Curriculum and Contextual Bandits	Jul 28, 2022	Model-based Reinforcement LearningMulti-Armed Bandits	—Unverified
Random Effect Bandits	Jun 23, 2021	Multi-Armed BanditsThompson Sampling	—Unverified
Randomized Allocation with Nonparametric Estimation for Contextual Multi-Armed Bandits with Delayed Rewards	Feb 3, 2019	Multi-Armed Bandits	—Unverified
Randomized Greedy Learning for Non-monotone Stochastic Submodular Maximization Under Full-bandit Feedback	Feb 2, 2023	Multi-Armed Bandits	—Unverified

Show:10 25 50

← PrevPage 21 of 26Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	NeuralLinear FullPosterior-MR	Cumulative regret	1.92	—	Unverified
2	Linear FullPosterior-MR	Cumulative regret	1.82	—	Unverified