Reinforcement Learning Optimization
Multi-Armed Bandit
Problème d'optimisation séquentielle simplifié où l'agent doit choisir entre plusieurs options avec des récompenses inconnues. Fondamental pour comprendre l'exploration-exploitation dans les contextes d'optimisation.
← Geri