SOTAVerified

Thompson Sampling

Thompson sampling, named after William R. Thompson, is a heuristic for choosing actions that addresses the exploration-exploitation dilemma in the multi-armed bandit problem. It consists of choosing the action that maximizes the expected reward with respect to a randomly drawn belief.

Papers

Showing 151–200 of 655 papers

TitleStatusHype
Thompson Sampling for Stochastic Bandits with Noisy Contexts: An Information-Theoretic Regret Analysis—0
Model-Free Approximate Bayesian Learning for Large-Scale Conversion Funnel Optimization—0
Decentralized Multi-Agent Active Search and Tracking when Targets Outnumber Agents—0
Improving sample efficiency of high dimensional Bayesian optimization with MCMC—0
Zero-Inflated Bandits—0
Finite-Time Frequentist Regret Bounds of Multi-Agent Thompson Sampling on Sparse HypergraphsCode0
Best Arm Identification in Batched Multi-armed Bandit Problems—0
Bayesian Analysis of Combinatorial Gaussian Process Bandits—0
RoME: A Robust Mixed-Effects Bandit Algorithm for Optimizing Mobile Health InterventionsCode0
Sample-based Dynamic Hierarchical Transformer with Layer and Head Flexibility via Contextual Bandit—0
The Sliding Regret in Stochastic Bandits: Discriminating Index and Randomized Policies—0
Thompson sampling for zero-inflated count outcomes with an application to the Drink Less mobile health study—0
Probabilistic Inference in Reinforcement Learning Done Right—0
A Distributed Neural Linear Thompson Sampling Framework to Achieve URLLC in Industrial IoT—0
Adaptive Interventions with User-Defined Goals for Health Behavior ChangeCode0
Exploration via linearly perturbed loss minimisation—0
Posterior Sampling-Based Bayesian Optimization with Tighter Bayesian Regret Bounds—0
Batch Bayesian Optimization for Replicable Experimental Design—0
Improved Bayesian Regret Bounds for Thompson Sampling in Reinforcement Learning—0
Dual-Directed Algorithm Design for Efficient Pure Exploration—0
Little Exploration is All You Need—0
Making RL with Preference-based Feedback Efficient via Randomization—0
Parallel Bayesian Optimization Using Satisficing Thompson Sampling for Time-Sensitive Black-Box Optimization—0
Using Adaptive Bandit Experiments to Increase and Investigate Engagement in Mental HealthCode0
Optimal Exploration is no harder than Thompson Sampling—0
Module-wise Adaptive Distillation for Multimodality Foundation Models—0
From Bandits Model to Deep Deterministic Policy Gradient, Reinforcement Learning with Contextual Information—0
Thompson Exploration with Best Challenger Rule in Best Arm Identification—0
Monte-Carlo tree search with uncertainty propagation via optimal transport—0
Task Selection and Assignment for Multi-modal Multi-task Dialogue Act Classification with Non-stationary Multi-armed Bandits—0
gym-saturation: Gymnasium environments for saturation provers (System description)—0
Generalized Regret Analysis of Thompson Sampling using Fractional Posteriors—0
Simple Modification of the Upper Confidence Bound Algorithm by Generalized Weighted AveragesCode0
Cost-Efficient Online Decision Making: A Combinatorial Multi-Armed Bandit ApproachCode0
Thompson Sampling for Real-Valued Combinatorial Pure Exploration of Multi-Armed Bandit—0
AdaptEx: A Self-Service Contextual Bandit Platform—0
Bag of Policies for Distributional Deep Exploration—0
VITS : Variational Inference Thompson Sampling for contextual banditsCode0
Approximate information for efficient exploration-exploitation strategies—0
Thompson Sampling under Bernoulli Rewards with Local Differential Privacy—0
Thompson sampling for improved exploration in GFlowNets—0
Geometry-Aware Approaches for Balancing Performance and Theoretical Guarantees in Linear Bandits—0
Scalable Neural Contextual Bandit for Recommender Systems—0
Langevin Thompson Sampling with Logarithmic Communication: Bandits and Reinforcement Learning—0
Bayesian Learning of Optimal Policies in Markov Decision Processes with Countably Infinite State-Space—0
Incentivizing Exploration with Linear Contexts and Combinatorial Actions—0
ReLU to the Rescue: Improve Your On-Policy Actor-Critic with Positive AdvantagesCode0
Combinatorial Neural Bandits—0
Practical Batch Bayesian Sampling Algorithms for Online Adaptive Traffic Experimentation—0
Discounted Thompson Sampling for Non-Stationary Bandit Problems—0
Show:102550
← PrevPage 4 of 14Next →

No leaderboard results yet.