SOTAVerified|Agents Browse Leaderboard About

Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 321–330 of 1262 papers

Title	Date	Tasks	Status
An Instrumental Value for Data Production and its Application to Data Pricing	Dec 24, 2024	Decision MakingMulti-Armed Bandits	—Unverified
Breaking the T Barrier: Instance-Independent Logarithmic Regret in Stochastic Contextual Linear Bandits	May 19, 2022	Multi-Armed Banditsparameter estimation	—Unverified
Breaking the (1/Δ_2) Barrier: Better Batched Best Arm Identification with Adaptive Grids	Jan 29, 2025	Multi-Armed Bandits	—Unverified
An Instance-Dependent Analysis for the Cooperative Multi-Player Multi-Armed Bandit	Nov 8, 2021	Multi-Armed Bandits	—Unverified
Adaptive Regret for Bandits Made Possible: Two Queries Suffice	Jan 17, 2024	Hyperparameter OptimizationMulti-Armed Bandits	—Unverified
Bounded Regret for Finitely Parameterized Multi-Armed Bandits	Mar 3, 2020	Multi-Armed Bandits	—Unverified
Boundary Crossing Probabilities for General Exponential Families	May 24, 2017	Multi-Armed Bandits	—Unverified
An Improved Relaxation for Oracle-Efficient Adversarial Contextual Bandits	Oct 29, 2023	Multi-Armed Bandits	—Unverified
Bootstrapping Upper Confidence Bound	Jun 12, 2019	Decision MakingMulti-Armed Bandits	—Unverified
An Exploration-free Method for a Linear Stochastic Bandit Driven by a Linear Gaussian Dynamical System	Apr 4, 2025	Hyperparameter OptimizationMulti-Armed Bandits	—Unverified

Show:10 25 50

← PrevPage 33 of 127Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	NeuralLinear FullPosterior-MR	Cumulative regret	1.92	—	Unverified
2	Linear FullPosterior-MR	Cumulative regret	1.82	—	Unverified