SOTAVerified

Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Showing 151–200 of 1262 papers

TitleStatusHype
Contextual Bandits with Stochastic ExpertsCode0
Decentralized Cooperative Stochastic BanditsCode0
Efficient Kernel UCB for Contextual BanditsCode0
Empirical Likelihood for Contextual BanditsCode0
Adaptive Data Depth via Multi-Armed BanditsCode0
Estimation of Warfarin Dosage with Reinforcement LearningCode0
Evolutionary Multi-Armed Bandits with Genetic Thompson SamplingCode0
Fairness of Exposure in Online Restless Multi-armed BanditsCode0
Finding All ε-Good Arms in Stochastic BanditsCode0
Finite-time Analysis of Globally Nonstationary Multi-Armed BanditsCode0
Flooding with Absorption: An Efficient Protocol for Heterogeneous Bandits over Complex NetworksCode0
Gaussian Gated Linear NetworksCode0
(Almost) Free Incentivized Exploration from Decentralized Learning AgentsCode0
Harnessing the Power of Federated Learning in Federated Contextual BanditsCode0
Conditionally Risk-Averse Contextual BanditsCode0
Batched Multi-armed Bandits ProblemCode0
Combinatorial Multi-armed Bandits for Resource AllocationCode0
Combinatorial Bandits under Strategic ManipulationsCode0
Combining Diverse Information for Coordinated Action: Stochastic Bandit Algorithms for Heterogeneous AgentsCode0
Confidence Intervals for Policy Evaluation in Adaptive ExperimentsCode0
Causal Contextual Bandits with Adaptive ContextCode0
Incorporating Multi-armed Bandit with Local Search for MaxSATCode0
Infinite Action Contextual Bandits with Reusable Data ExhaustCode0
Online SuBmodular + SuPermodular (BP) Maximization with Bandit FeedbackCode0
Cascading Bandits for Large-Scale Recommendation ProblemsCode0
Bayesian Design Principles for Frequentist Sequential LearningCode0
Bayesian Optimisation over Multiple Continuous and Categorical InputsCode0
Kernel Conditional Moment Constraints for Confounding Robust InferenceCode0
Scalable Exploration via Ensemble++Code0
Causally Abstracted Multi-armed BanditsCode0
Learning Contextual Bandits in a Non-stationary EnvironmentCode0
Learning Structural Weight Uncertainty for Sequential Decision-MakingCode0
Locally Differentially Private (Contextual) Bandits LearningCode0
Locally Private Nonparametric Contextual Multi-armed BanditsCode0
Budgeted Multi-Armed Bandits with Asymmetric Confidence IntervalsCode0
Low-Rank Bandits via Tight Two-to-Infinity Singular Subspace RecoveryCode0
Adaptive Linear Estimating EquationsCode0
Master-slave Deep Architecture for Top-K Multi-armed Bandits with Non-linear Bandit Feedback and Diversity ConstraintsCode0
Best Arm Identification with Fixed Budget: A Large Deviation PerspectiveCode0
Meta-in-context learning in large language modelsCode0
Empirical analysis of representation learning and exploration in neural kernel banditsCode0
Multi-agent Multi-armed Bandits with Minimum Reward Guarantee FairnessCode0
Distribution oblivious, risk-aware algorithms for multi-armed bandits with unbounded rewardsCode0
Multi-Armed Bandits in Brain-Computer InterfacesCode0
Bandit-Based Monte Carlo Optimization for Nearest NeighborsCode0
Multi-Armed Bandits with Network InterferenceCode0
An Experimental Design for Anytime-Valid Causal Inference on Multi-Armed BanditsCode0
Myopic Bayesian Design of Experiments via Posterior Sampling and Probabilistic ProgrammingCode0
Model selection for contextual banditsCode0
Censored Semi-Bandits: A Framework for Resource Allocation with Censored FeedbackCode0
Show:102550
← PrevPage 4 of 26Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1NeuralLinear FullPosterior-MRCumulative regret1.92—Unverified
2Linear FullPosterior-MRCumulative regret1.82—Unverified