SOTAVerified|Agents Browse Leaderboard About

Multi-Armed Bandits

Multi-armed bandits refer to a task where a fixed amount of resources must be allocated between competing resources that maximizes expected gain. Typically these problems involve an exploration/exploitation trade-off.

( Image credit: Microsoft Research )

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 371–380 of 1262 papers

Title	Date	Tasks	Status
Master-slave Deep Architecture for Top-K Multi-armed Bandits with Non-linear Bandit Feedback and Diversity Constraints	Aug 24, 2023	DiversityMulti-Armed Bandits	CodeCode Available
On Universally Optimal Algorithms for A/B Testing	Aug 23, 2023	Multi-Armed Bandits	—Unverified
Clustered Linear Contextual Bandits with Knapsacks	Aug 21, 2023	EconometricsMulti-Armed Bandits	—Unverified
Graph Neural Bandits	Aug 21, 2023	Multi-Armed Bandits	—Unverified
Cost-Efficient Online Decision Making: A Combinatorial Multi-Armed Bandit Approach	Aug 21, 2023	Decision MakingMulti-Armed Bandits	CodeCode Available
AdaptEx: A Self-Service Contextual Bandit Platform	Aug 8, 2023	Multi-Armed BanditsThompson Sampling	—Unverified
Cooperative Multi-agent Bandits: Distributed Algorithms with Optimal Individual Regret and Constant Communication Costs	Aug 8, 2023	Multi-Armed Bandits	—Unverified
Transfer Learning with Partially Observable Offline Data via Causal Bounds	Aug 7, 2023	Multi-Armed BanditsTransfer Learning	—Unverified
Online Matching: A Real-time Bandit System for Large-scale Recommendations	Jul 29, 2023	Multi-Armed BanditsRecommendation Systems	CodeCode Available
Provable Benefits of Policy Learning from Human Preferences in Contextual Bandit Problems	Jul 24, 2023	Decision MakingMulti-Armed Bandits	—Unverified

Show:10 25 50

← PrevPage 38 of 127Next →

Benchmark Results

#	Model	Metric	Claimed	Verified	Status
1	NeuralLinear FullPosterior-MR	Cumulative regret	1.92	—	Unverified
2	Linear FullPosterior-MR	Cumulative regret	1.82	—	Unverified