SOTAVerified

Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Showing 376–400 of 1262 papers

TitleStatusHype
Distributed Multi-Task Learning for Stochastic Bandits with Context Distribution and Stage-wise Constraints—0
Distributed Online Learning via Cooperative Contextual Bandits—0
Distributed Optimization via Kernelized Multi-armed Bandits—0
Efficient Prompt Optimization Through the Lens of Best Arm Identification—0
An efficient algorithm for contextual bandits with knapsacks, and an extension to concave objectives—0
Distributionally Robust Policy Evaluation and Learning in Offline Contextual Bandits—0
Distributionally Robust Batch Contextual Bandits—0
Differentially Private Multi-Armed Bandits in the Shuffle Model—0
Distribution-Dependent Rates for Multi-Distribution Learning—0
Diversify and Conquer: Bandits and Diversity for an Enhanced E-commerce Homepage Experience—0
Diversity-Based Recruitment in Crowdsensing By Combinatorial Multi-Armed Bandits—0
Differentially Private Kernelized Contextual Bandits—0
DOPL: Direct Online Preference Learning for Restless Bandits with Preference Feedback—0
Double Doubly Robust Thompson Sampling for Generalized Linear Contextual Bandits—0
Online Multi-Armed Bandits with Adaptive Inference—0
Be Greedy in Multi-Armed Bandits—0
Differentially Private Episodic Reinforcement Learning with Heavy-tailed Rewards—0
Meta-Learning Bandit Policies by Gradient Ascent—0
Doubly robust off-policy evaluation with shrinkage—0
Beam Learning -- Using Machine Learning for Finding Beam Directions—0
Doubly Robust Policy Evaluation and Optimization—0
A Near-Optimal Change-Detection Based Algorithm for Piecewise-Stationary Combinatorial Semi-Bandits—0
Designing Truthful Contextual Multi-Armed Bandits based Sponsored Search Auctions—0
Designing an Interpretable Interface for Contextual Bandits—0
BEACON: Balancing Convenience and Nutrition in Meals With Long-Term Group Recommendations and Reasoning on Multimodal Recipes—0
Show:102550
← PrevPage 16 of 51Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1NeuralLinear FullPosterior-MRCumulative regret1.92—Unverified
2Linear FullPosterior-MRCumulative regret1.82—Unverified