Batch Constrained Q-learning (BCQ)
Batch Constrained Q-learning (BCQ)
Algorithme d'apprentissage par renforcement offline qui contraint les politiques à rester proches des actions observées dans le jeu de données d'entraînement pour éviter les erreurs d'extrapolation. BCQ utilise un modèle de générateur d'actions pour produire des actions similaires à celles du batch tout en explorant de légères variations.
← رجوع