UCB Algorithms
UCB1
Algorithme UCB de base utilisant l'inégalité de Hoeffding pour calculer les bornes de confiance, offrant un regret logarithmique garanti dans le cadre des bandits stationnaires.
← Indietro