SOTAVerified|Agents Browse Leaderboard About

Thompson Sampling

Thompson sampling, named after William R. Thompson, is a heuristic for choosing actions that addresses the exploration-exploitation dilemma in the multi-armed bandit problem. It consists of choosing the action that maximizes the expected reward with respect to a randomly drawn belief.

Papers

Recently Added Most Hyped Most Active Needs Verification Most Verified

Showing 341–350 of 655 papers

Title	Date	Tasks	Status
Exploiting correlation and budget constraints in Bayesian multi-armed bandit optimization	Mar 27, 2013	Bayesian OptimizationThompson Sampling	—Unverified
A Unified Approach to Translate Classical Bandit Algorithms to the Structured Bandit Setting	Oct 18, 2018	Thompson Sampling	—Unverified
Exploration for Multi-task Reinforcement Learning with Deep Generative Models	Nov 29, 2016	reinforcement-learningReinforcement Learning	—Unverified
Exploration via linearly perturbed loss minimisation	Nov 13, 2023	Thompson Sampling	—Unverified
Fast online inference for nonlinear contextual bandit based on Generative Adversarial Network	Feb 17, 2022	Bayesian InferenceGenerative Adversarial Network	—Unverified
Online Learning with Cumulative Oversampling: Application to Budgeted Influence Maximization	Apr 24, 2020	Thompson Sampling	—Unverified
Feel-Good Thompson Sampling for Contextual Bandits and Reinforcement Learning	Oct 2, 2021	Multi-Armed Banditsregression	—Unverified
Feel-Good Thompson Sampling for Contextual Dueling Bandits	Apr 9, 2024	Decision MakingMulti-Armed Bandits	—Unverified
Finite-Time Regret of Thompson Sampling Algorithms for Exponential Family Multi-Armed Bandits	Jun 7, 2022	Multi-Armed BanditsThompson Sampling	—Unverified
First-Order Bayesian Regret Analysis of Thompson Sampling	Feb 2, 2019	Combinatorial OptimizationThompson Sampling	—Unverified

Show:10 25 50

← PrevPage 35 of 66Next →

No leaderboard results yet.