SOTAVerified|Agents Browse Leaderboard About

Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 591–600 of 1262 papers

Title	Date	Tasks	Status
Thompson Sampling for Bandit Learning in Matching Markets	Apr 26, 2022	Multi-Armed BanditsThompson Sampling	CodeCode Available
Worst-case Performance of Greedy Policies in Bandits with Imperfect Context Observations	Apr 10, 2022	Decision MakingDecision Making Under Uncertainty	—Unverified
Stochastic Multi-armed Bandits with Non-stationary Rewards Generated by a Linear Dynamical System	Apr 6, 2022	Decision MakingMulti-Armed Bandits	—Unverified
Strategies for Safe Multi-Armed Bandits with Logarithmic Regret and Risk	Apr 1, 2022	Multi-Armed Bandits	—Unverified
Flexible and Efficient Contextual Bandits with Heterogeneous Treatment Effect Oracles	Mar 30, 2022	Decision MakingHeterogeneous Treatment Effect Estimation	—Unverified
Best Arm Identification in Restless Markov Multi-Armed Bandits	Mar 29, 2022	Multi-Armed Bandits	—Unverified
On Kernelized Multi-Armed Bandits with Constraints	Mar 29, 2022	Multi-Armed BanditsThompson Sampling	—Unverified
Modeling Attrition in Recommender Systems with Departing Bandits	Mar 25, 2022	Multi-Armed BanditsRecommendation Systems	—Unverified
Multi-armed bandits for resource efficient, online optimization of language model pre-training: the use case of dynamic masking	Mar 24, 2022	Bayesian OptimizationDecision Making	CodeCode Available
Efficient Algorithms for Extreme Bandits	Mar 21, 2022	Multi-Armed Bandits	CodeCode Available

Show:10 25 50

← PrevPage 60 of 127Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	NeuralLinear FullPosterior-MR	Cumulative regret	1.92	—	Unverified
2	Linear FullPosterior-MR	Cumulative regret	1.82	—	Unverified